Локальный запуск
llama.cpp: скачать, запуск на Windows и локальный сервер
llama.cpp — движок, который запускает языковые модели на обычном компьютере: на видеокарте, на процессоре или на обоих сразу. Ставится одной командой, модель качает сам с Hugging Face, а вместе с ним приходит локальный сервер с веб-чатом и адресом, совместимым с OpenAI. Всё бесплатно, лицензия MIT.
Дальше по порядку: чем этот проект отличается от привычных программ с окошком, как поставить его на Windows, macOS и Linux, как за одну команду скачать и запустить модель, как поднять сервер и подключить к нему свои приложения, сколько нужно видеопамяти и какую из полутора десятков сборок выбрать.
Факты и команды ниже сверены 19 августа 2026 года по репозиторию проекта и официальному сайту.
Что такое llama.cpp
llama.cpp — открытый движок вывода: он берёт файл модели и считает ответы. Всё, что вы видите в настольных программах для локальных нейросетей — окно чата, список моделей, ползунки — надстройка. Считает под капотом такой движок.
Проект написан на C и C++ без внешних зависимостей и с прицелом на то, чтобы работать на чём угодно: от макбука до сервера с несколькими видеокартами. Лицензия MIT, на 19 августа 2026 года у репозитория 124 664 звезды и 21 903 форка. Обновляется он почти ежедневно: сборка b10488 выпущена 18 августа.
Что стоит знать про этот проект, даже если вы не собираетесь трогать командную строку:
- Формат GGUF родом отсюда. Файлы моделей с расширением
.gguf, которые вы качаете для настольных запускалок, придуманы в этом же семействе проектов: GGUF расшифровывается как GGML Universal File, а спецификация лежит в соседнем репозитории ggml. - Модель может не помещаться в видеопамять целиком. Движок умеет считать часть слоёв на видеокарте, а остаток — на процессоре. Медленнее, но работает.
- Квантование от 1,5 до 8 бит. Именно оно уменьшает файл модели в несколько раз и позволяет запустить на бытовой видеокарте то, что в исходном виде в неё не помещается.
Как поставить: четыре способа
Собирать из исходников не нужно — готовые сборки лежат в открытом доступе.
- Официальный установщик. На сайте проекта одна команда:
curl -LsSf https://llama.app/install.sh | sh - Пакетный менеджер. Способ, при котором обновления приходят сами:
winget install llama.cppна Windows,brew install llama.cppна macOS и Linux,sudo port install llama.cppв MacPorts,conda install -c conda-forge llama.cppв conda. - Готовые бинарники. На странице релизов лежат архивы под каждую систему и каждый тип ускорителя. Распаковали — запустили, установка не требуется.
- Docker. Официальные образы публикуются в реестре GitHub, включая вариант с сервером и поддержкой видеокарт NVIDIA.
Первый запуск и загрузка модели
Отдельно искать и качать файл модели не нужно: движок умеет тянуть её прямо с Hugging Face по имени репозитория. Пример из документации проекта: llama cli -hf ggml-org/Qwen3.5-0.8B-GGUF
Что происходит по этой команде: модель скачивается в локальный кеш, загружается в память и открывается диалог в терминале.
Полезные детали загрузки:
- Квантование выбирается суффиксом. Запись
-hf автор/модель:Q4_K_Mуказывает нужный файл. Если суффикс не указан, движок берёт Q4_K_M, а когда такого файла в репозитории нет — первый попавшийся. - Закрытые модели требуют токена. Для репозиториев, где автор просит принять лицензию, передаётся токен Hugging Face. Как их получают, разобрано в статье про Hugging Face.
- Список скачанного показывается флагом
-cl, а флаг--offlineзаставляет работать только с тем, что уже лежит в кеше, и не ходить в сеть.
Локальный сервер и веб-интерфейс
Главная причина ставить llama.cpp — режим сервера: llama serve -hf ggml-org/Qwen3.5-0.8B-GGUF
По умолчанию он слушает адрес 127.0.0.1 и порт 8080, то есть доступен только с вашего же компьютера. Вместе с ним поднимается встроенный веб-интерфейс: открыли http://localhost:8080 в браузере — получили чат, без установки отдельной программы. Отключается он флагом --no-webui.
Что сервер умеет, кроме чата:
| Возможность | Зачем нужна |
|---|---|
| Совместимость с OpenAI | приложения, написанные под OpenAI, работают со сменой одного адреса |
| Совместимость с Anthropic Messages | то же самое для клиентов, говорящих на формате Anthropic |
| Ключ доступа --api-key | защита, если сервер слушает не только локальный адрес |
| Несколько пользователей сразу | параллельная обработка запросов вместо очереди |
| Режим маршрутизатора | сервер запускается без модели и подгружает нужную по запросу |
| Вызов инструментов и структурированный ответ | ответ строго по схеме, а не свободным текстом |
Режим маршрутизатора стоит отметить отдельно: сервер стартует пустым, ему указывают папку с моделями, и дальше он сам поднимает и выгружает нужную модель под конкретный запрос. Для домашней машины, где несколько моделей под разные задачи, это удобнее, чем перезапускать процесс руками.
Куда подключить свой сервер
Раз адрес совместим с OpenAI, подключается он туда же, куда обычно вписывают чужой ключ:
- адрес:
http://localhost:8080/v1 - ключ: любой непустой, если вы не включали
--api-key - модель: та, что загружена в сервер
Так работают почти все настольные ИИ-клиенты, расширения редакторов и самописные скрипты. Практическая польза от этого — переключаемость: один и тот же клиент сегодня ходит в локальную модель, завтра в облачную, и меняется одна строка в настройках. Как выглядит облачная сторона такой связки, разобрано в статье про OpenRouter.
Видеокарта, слои и квантование
Три параметра, которые решают, запустится ли модель и с какой скоростью.
Слои на видеокарте. Флаг -ngl говорит, сколько слоёв модели держать в видеопамяти. По умолчанию стоит режим auto, значение all требует разместить всё. Если модель не помещается целиком, часть слоёв остаётся на процессоре: скорость падает, но запуск состоится.
Размер контекста. Флаг -c задаёт, сколько токенов модель держит в памяти разговора. Значение по умолчанию берётся из самой модели. Контекст занимает видеопамять отдельно от весов, и на длинных диалогах именно он чаще всего приводит к нехватке памяти.
Квантование. Чем ниже разрядность, тем меньше файл и тем быстрее счёт, но тем заметнее потери в качестве. Практический ориентир — Q4_K_M: та самая середина, которую движок и берёт по умолчанию. Как читаются остальные метки и сколько весит одна и та же модель в каждом варианте — в статье про формат GGUF. Полный расклад «какая видеокарта какую модель тянет» посчитан в статье про локальные нейросети.
Какую сборку скачивать
На странице релизов лежит полтора десятка архивов, и разница между ними — в ускорителе, а не в возможностях.
| Система и железо | Что качать | Размер |
|---|---|---|
| Windows, только процессор | bin-win-cpu-x64 | около 17 МБ |
| Windows, видеокарта NVIDIA | bin-win-cuda + архив cudart | около 240 МБ и библиотеки |
| Windows, видеокарта AMD | bin-win-rocm | около 190 МБ |
| Windows, любая видеокарта | bin-win-vulkan | около 33 МБ |
| macOS на Apple Silicon | bin-macos-arm64 | около 10 МБ |
| Linux | bin-ubuntu-x64 или вариант с vulkan | 15–31 МБ |
| Android | bin-android-arm64 | около 74 МБ |
Правило выбора простое: под NVIDIA берут сборку с CUDA, под AMD — с ROCm, под встроенную графику и в спорных случаях — Vulkan, он работает почти везде. Для Intel есть отдельная сборка на SYCL, для Apple ускорение через Metal уже внутри.
llama.cpp или LM Studio
Эти два инструмента решают одну задачу разными способами, и выбирать между ними имеет смысл по сценарию, а не по «продвинутости».
| Что важно | llama.cpp | LM Studio |
|---|---|---|
| Установка | команда в терминале | обычный установщик с окном |
| Выбор модели | по имени репозитория | каталог с поиском внутри программы |
| Интерфейс | веб-чат сервера и терминал | полноценное приложение |
| Тонкая настройка | все флаги движка доступны | набор переключателей |
| Автозапуск фоновым сервисом | штатный сценарий | возможен, но не главный |
| Обновления | пакетный менеджер или новый архив | внутри программы |
Практический вывод: начинать удобнее с LM Studio, а к llama.cpp приходят, когда нужен сервер, который стартует вместе с системой, живёт без графики и слушается флагов. Третий сосед в этом ряду — Ollama, у неё своя логика работы с моделями; разбор есть в гайде на портале ИИ-офиса.
Что чаще всего идёт не так
Модель не влезает в память
Симптом — процесс падает при загрузке или система начинает свопить. Лечится меньшим квантованием, меньшим контекстом или явным ограничением числа слоёв на видеокарте.
Скачали сборку не под своё железо
Архив с CUDA на компьютере без видеокарты NVIDIA запустится на процессоре или не запустится вовсе. Для сборок с CUDA нужен ещё и архив с библиотеками cudart, если их нет в системе.
Команда не находится
После распаковки архива бинарники лежат в папке и в системный путь не прописываются. Либо запускайте из этой папки, либо ставьте через пакетный менеджер.
Сервер не виден с другого устройства
Так и задумано: по умолчанию он слушает 127.0.0.1. Чтобы открыть его в локальной сети, адрес прослушивания меняют флагом --host, и тогда стоит включить --api-key.
Ответы приходят обрывками или странного вида
Обычно причина в шаблоне диалога: движок берёт его из метаданных модели, но у нестандартных сборок шаблон бывает битым. Он задаётся вручную, флагом с указанием нужного шаблона.
Частые вопросы
Что такое llama.cpp простыми словами?
Это движок, который запускает языковые модели на вашем компьютере: читает файл модели и считает ответы на видеокарте, процессоре или на обоих сразу. Написан на C и C++, распространяется по лицензии MIT и работает на Windows, macOS, Linux и даже Android. Настольные программы для локальных моделей строятся поверх таких движков.
Как установить llama.cpp на Windows?
Проще всего командой winget install llama.cpp — пакет обновляется вместе с релизами проекта. Второй вариант: скачать готовый архив со страницы релизов и распаковать его, установка при этом не требуется. Для видеокарты NVIDIA берут сборку с CUDA, для AMD — с ROCm, универсальный вариант — сборка на Vulkan.
Нужно ли отдельно скачивать модель?
Нет, движок умеет забирать её сам. В команде указывается имя репозитория на Hugging Face с ключом -hf, и файл скачивается в локальный кеш. Квантование задаётся суффиксом после двоеточия, а без него берётся Q4_K_M. Список уже скачанных моделей показывает флаг -cl, работу без сети включает --offline.
Как поднять локальный сервер и открыть чат в браузере?
Командой llama serve с указанием модели. Сервер по умолчанию слушает адрес 127.0.0.1 и порт 8080 и поднимает встроенный веб-интерфейс: открываете в браузере localhost:8080 и получаете чат без установки отдельной программы. Отключить интерфейс можно флагом --no-webui, сменить адрес и порт — флагами --host и --port.
Можно ли подключить llama.cpp к своим программам?
Да, сервер отвечает по формату OpenAI, а также совместим с форматом сообщений Anthropic. Приложению достаточно указать адрес http://localhost:8080/v1 вместо облачного и любой непустой ключ. Если сервер слушает не только локальный адрес, включите ключ доступа флагом --api-key, иначе им сможет пользоваться вся сеть.
Чем llama.cpp отличается от LM Studio и Ollama?
Это движок, а не программа с интерфейсом: он даёт максимум настроек и удобно живёт фоновым сервисом. LM Studio — приложение с каталогом моделей и окном чата, с ним проще начать. Ollama решает ту же задачу своими командами и своим каталогом моделей. Формат файлов GGUF при этом общий для всех троих.