Локальный запуск

llama.cpp: скачать, запуск на Windows и локальный сервер

llama.cpp — движок, который запускает языковые модели на обычном компьютере: на видеокарте, на процессоре или на обоих сразу. Ставится одной командой, модель качает сам с Hugging Face, а вместе с ним приходит локальный сервер с веб-чатом и адресом, совместимым с OpenAI. Всё бесплатно, лицензия MIT.

Дальше по порядку: чем этот проект отличается от привычных программ с окошком, как поставить его на Windows, macOS и Linux, как за одну команду скачать и запустить модель, как поднять сервер и подключить к нему свои приложения, сколько нужно видеопамяти и какую из полутора десятков сборок выбрать.

Факты и команды ниже сверены 19 августа 2026 года по репозиторию проекта и официальному сайту.

Что такое llama.cpp

llama.cpp — открытый движок вывода: он берёт файл модели и считает ответы. Всё, что вы видите в настольных программах для локальных нейросетей — окно чата, список моделей, ползунки — надстройка. Считает под капотом такой движок.

Проект написан на C и C++ без внешних зависимостей и с прицелом на то, чтобы работать на чём угодно: от макбука до сервера с несколькими видеокартами. Лицензия MIT, на 19 августа 2026 года у репозитория 124 664 звезды и 21 903 форка. Обновляется он почти ежедневно: сборка b10488 выпущена 18 августа.

Что стоит знать про этот проект, даже если вы не собираетесь трогать командную строку:

  • Формат GGUF родом отсюда. Файлы моделей с расширением .gguf, которые вы качаете для настольных запускалок, придуманы в этом же семействе проектов: GGUF расшифровывается как GGML Universal File, а спецификация лежит в соседнем репозитории ggml.
  • Модель может не помещаться в видеопамять целиком. Движок умеет считать часть слоёв на видеокарте, а остаток — на процессоре. Медленнее, но работает.
  • Квантование от 1,5 до 8 бит. Именно оно уменьшает файл модели в несколько раз и позволяет запустить на бытовой видеокарте то, что в исходном виде в неё не помещается.

Как поставить: четыре способа

Собирать из исходников не нужно — готовые сборки лежат в открытом доступе.

  1. Официальный установщик. На сайте проекта одна команда: curl -LsSf https://llama.app/install.sh | sh
  2. Пакетный менеджер. Способ, при котором обновления приходят сами: winget install llama.cpp на Windows, brew install llama.cpp на macOS и Linux, sudo port install llama.cpp в MacPorts, conda install -c conda-forge llama.cpp в conda.
  3. Готовые бинарники. На странице релизов лежат архивы под каждую систему и каждый тип ускорителя. Распаковали — запустили, установка не требуется.
  4. Docker. Официальные образы публикуются в реестре GitHub, включая вариант с сервером и поддержкой видеокарт NVIDIA.

Первый запуск и загрузка модели

Отдельно искать и качать файл модели не нужно: движок умеет тянуть её прямо с Hugging Face по имени репозитория. Пример из документации проекта: llama cli -hf ggml-org/Qwen3.5-0.8B-GGUF

Что происходит по этой команде: модель скачивается в локальный кеш, загружается в память и открывается диалог в терминале.

Полезные детали загрузки:

  • Квантование выбирается суффиксом. Запись -hf автор/модель:Q4_K_M указывает нужный файл. Если суффикс не указан, движок берёт Q4_K_M, а когда такого файла в репозитории нет — первый попавшийся.
  • Закрытые модели требуют токена. Для репозиториев, где автор просит принять лицензию, передаётся токен Hugging Face. Как их получают, разобрано в статье про Hugging Face.
  • Список скачанного показывается флагом -cl, а флаг --offline заставляет работать только с тем, что уже лежит в кеше, и не ходить в сеть.

Локальный сервер и веб-интерфейс

Главная причина ставить llama.cpp — режим сервера: llama serve -hf ggml-org/Qwen3.5-0.8B-GGUF

По умолчанию он слушает адрес 127.0.0.1 и порт 8080, то есть доступен только с вашего же компьютера. Вместе с ним поднимается встроенный веб-интерфейс: открыли http://localhost:8080 в браузере — получили чат, без установки отдельной программы. Отключается он флагом --no-webui.

Что сервер умеет, кроме чата:

ВозможностьЗачем нужна
Совместимость с OpenAIприложения, написанные под OpenAI, работают со сменой одного адреса
Совместимость с Anthropic Messagesто же самое для клиентов, говорящих на формате Anthropic
Ключ доступа --api-keyзащита, если сервер слушает не только локальный адрес
Несколько пользователей сразупараллельная обработка запросов вместо очереди
Режим маршрутизаторасервер запускается без модели и подгружает нужную по запросу
Вызов инструментов и структурированный ответответ строго по схеме, а не свободным текстом

Режим маршрутизатора стоит отметить отдельно: сервер стартует пустым, ему указывают папку с моделями, и дальше он сам поднимает и выгружает нужную модель под конкретный запрос. Для домашней машины, где несколько моделей под разные задачи, это удобнее, чем перезапускать процесс руками.

Что из локальных моделей реально годится в работу, а что только красиво считает, разбираем в канале.Открыть канал

Куда подключить свой сервер

Раз адрес совместим с OpenAI, подключается он туда же, куда обычно вписывают чужой ключ:

  • адрес: http://localhost:8080/v1
  • ключ: любой непустой, если вы не включали --api-key
  • модель: та, что загружена в сервер

Так работают почти все настольные ИИ-клиенты, расширения редакторов и самописные скрипты. Практическая польза от этого — переключаемость: один и тот же клиент сегодня ходит в локальную модель, завтра в облачную, и меняется одна строка в настройках. Как выглядит облачная сторона такой связки, разобрано в статье про OpenRouter.

Видеокарта, слои и квантование

Три параметра, которые решают, запустится ли модель и с какой скоростью.

Слои на видеокарте. Флаг -ngl говорит, сколько слоёв модели держать в видеопамяти. По умолчанию стоит режим auto, значение all требует разместить всё. Если модель не помещается целиком, часть слоёв остаётся на процессоре: скорость падает, но запуск состоится.

Размер контекста. Флаг -c задаёт, сколько токенов модель держит в памяти разговора. Значение по умолчанию берётся из самой модели. Контекст занимает видеопамять отдельно от весов, и на длинных диалогах именно он чаще всего приводит к нехватке памяти.

Квантование. Чем ниже разрядность, тем меньше файл и тем быстрее счёт, но тем заметнее потери в качестве. Практический ориентир — Q4_K_M: та самая середина, которую движок и берёт по умолчанию. Как читаются остальные метки и сколько весит одна и та же модель в каждом варианте — в статье про формат GGUF. Полный расклад «какая видеокарта какую модель тянет» посчитан в статье про локальные нейросети.

Какую сборку скачивать

На странице релизов лежит полтора десятка архивов, и разница между ними — в ускорителе, а не в возможностях.

Система и железоЧто качатьРазмер
Windows, только процессорbin-win-cpu-x64около 17 МБ
Windows, видеокарта NVIDIAbin-win-cuda + архив cudartоколо 240 МБ и библиотеки
Windows, видеокарта AMDbin-win-rocmоколо 190 МБ
Windows, любая видеокартаbin-win-vulkanоколо 33 МБ
macOS на Apple Siliconbin-macos-arm64около 10 МБ
Linuxbin-ubuntu-x64 или вариант с vulkan15–31 МБ
Androidbin-android-arm64около 74 МБ

Правило выбора простое: под NVIDIA берут сборку с CUDA, под AMD — с ROCm, под встроенную графику и в спорных случаях — Vulkan, он работает почти везде. Для Intel есть отдельная сборка на SYCL, для Apple ускорение через Metal уже внутри.

llama.cpp или LM Studio

Эти два инструмента решают одну задачу разными способами, и выбирать между ними имеет смысл по сценарию, а не по «продвинутости».

Что важноllama.cppLM Studio
Установкакоманда в терминалеобычный установщик с окном
Выбор моделипо имени репозиториякаталог с поиском внутри программы
Интерфейсвеб-чат сервера и терминалполноценное приложение
Тонкая настройкавсе флаги движка доступнынабор переключателей
Автозапуск фоновым сервисомштатный сценарийвозможен, но не главный
Обновленияпакетный менеджер или новый архиввнутри программы

Практический вывод: начинать удобнее с LM Studio, а к llama.cpp приходят, когда нужен сервер, который стартует вместе с системой, живёт без графики и слушается флагов. Третий сосед в этом ряду — Ollama, у неё своя логика работы с моделями; разбор есть в гайде на портале ИИ-офиса.

Что чаще всего идёт не так

Модель не влезает в память

Симптом — процесс падает при загрузке или система начинает свопить. Лечится меньшим квантованием, меньшим контекстом или явным ограничением числа слоёв на видеокарте.

Скачали сборку не под своё железо

Архив с CUDA на компьютере без видеокарты NVIDIA запустится на процессоре или не запустится вовсе. Для сборок с CUDA нужен ещё и архив с библиотеками cudart, если их нет в системе.

Команда не находится

После распаковки архива бинарники лежат в папке и в системный путь не прописываются. Либо запускайте из этой папки, либо ставьте через пакетный менеджер.

Сервер не виден с другого устройства

Так и задумано: по умолчанию он слушает 127.0.0.1. Чтобы открыть его в локальной сети, адрес прослушивания меняют флагом --host, и тогда стоит включить --api-key.

Ответы приходят обрывками или странного вида

Обычно причина в шаблоне диалога: движок берёт его из метаданных модели, но у нестандартных сборок шаблон бывает битым. Он задаётся вручную, флагом с указанием нужного шаблона.

Частые вопросы

Что такое llama.cpp простыми словами?

Это движок, который запускает языковые модели на вашем компьютере: читает файл модели и считает ответы на видеокарте, процессоре или на обоих сразу. Написан на C и C++, распространяется по лицензии MIT и работает на Windows, macOS, Linux и даже Android. Настольные программы для локальных моделей строятся поверх таких движков.

Как установить llama.cpp на Windows?

Проще всего командой winget install llama.cpp — пакет обновляется вместе с релизами проекта. Второй вариант: скачать готовый архив со страницы релизов и распаковать его, установка при этом не требуется. Для видеокарты NVIDIA берут сборку с CUDA, для AMD — с ROCm, универсальный вариант — сборка на Vulkan.

Нужно ли отдельно скачивать модель?

Нет, движок умеет забирать её сам. В команде указывается имя репозитория на Hugging Face с ключом -hf, и файл скачивается в локальный кеш. Квантование задаётся суффиксом после двоеточия, а без него берётся Q4_K_M. Список уже скачанных моделей показывает флаг -cl, работу без сети включает --offline.

Как поднять локальный сервер и открыть чат в браузере?

Командой llama serve с указанием модели. Сервер по умолчанию слушает адрес 127.0.0.1 и порт 8080 и поднимает встроенный веб-интерфейс: открываете в браузере localhost:8080 и получаете чат без установки отдельной программы. Отключить интерфейс можно флагом --no-webui, сменить адрес и порт — флагами --host и --port.

Можно ли подключить llama.cpp к своим программам?

Да, сервер отвечает по формату OpenAI, а также совместим с форматом сообщений Anthropic. Приложению достаточно указать адрес http://localhost:8080/v1 вместо облачного и любой непустой ключ. Если сервер слушает не только локальный адрес, включите ключ доступа флагом --api-key, иначе им сможет пользоваться вся сеть.

Чем llama.cpp отличается от LM Studio и Ollama?

Это движок, а не программа с интерфейсом: он даёт максимум настроек и удобно живёт фоновым сервисом. LM Studio — приложение с каталогом моделей и окном чата, с ним проще начать. Ollama решает ту же задачу своими командами и своим каталогом моделей. Формат файлов GGUF при этом общий для всех троих.

ИИ-офисПроект про работу с нейросетями: разборы инструментов, рабочие связки и практика, проверенная на своих задачах.