Локальный запуск
LM Studio: установка, выбор модели и локальный сервер
LM Studio — программа, которая запускает языковые модели прямо на вашем компьютере: без интернета, без подписки и без отправки текста на чужие серверы. Версия 0.4.21, бесплатна в том числе для работы. Главный вопрос при установке один — какая модель влезет в вашу видеопамять.
Логика простая: вы скачиваете файл модели, LM Studio его загружает, дальше получается обычный чат — только он работает у вас на машине. Интернет нужен один раз, чтобы скачать модель.
Отсюда и причины, по которым к этому приходят: переписка не уходит наружу, лимитов на количество сообщений нет, платить помесячно не за что.
Что такое LM Studio
Это оболочка вокруг механизма запуска моделей. Она берёт на себя всё, что обычно отпугивает: поиск модели, скачивание нужного файла, подбор параметров под ваше железо, выгрузку слоёв на видеокарту.
С 8 июля 2025 года программа бесплатна и для личного, и для рабочего использования — раньше для работы требовалось запрашивать отдельную лицензию, теперь заполнять ничего не нужно. Платные тарифы остались только для организаций, которым нужны разграничение доступа, единый вход и контроль над тем, какие модели разрешены сотрудникам.
Требования к компьютеру
Здесь чаще всего и выясняется, получится ли вообще.
| Система | Что нужно |
|---|---|
| macOS | Только Apple Silicon (M1–M4), macOS 14.0 и новее. Intel-Маки не поддерживаются |
| Windows | x64 или ARM (Snapdragon X Elite). Для x64 обязателен набор инструкций AVX2 |
| Linux | Ubuntu 20.04 и новее, x64 или ARM64, поставляется в формате AppImage |
Память: рекомендуется от 16 ГБ оперативной, на 8 ГБ можно работать с небольшими моделями. Для Windows отдельно указано: желательно не меньше 4 ГБ собственной видеопамяти.
Отдельно про Intel-Маки: поддержку убрали совсем. Программа на них не запустится, обходного пути нет — нужен компьютер Apple с процессором Apple Silicon.
Установка
- Скачать установщик с lmstudio.ai под свою систему.
- Запустить и дождаться окончания — на Windows и macOS это обычный установщик, на Linux скачивается AppImage, которому нужно выдать право на запуск.
- При первом старте программа предложит скачать модель. На этом шаге лучше отказаться и сначала прочитать следующий раздел — иначе легко скачать двадцатигигабайтный файл, который у вас не запустится.
Дальше интерфейс делится на три части: поиск и загрузка моделей, чат и настройки сервера. Больше ничего осваивать не нужно.
Какую модель скачать
Главное правило: модель должна помещаться в видеопамять. Если не помещается, часть слоёв уйдёт в оперативную память и скорость упадёт в разы — с приемлемых секунд до десятков секунд на ответ.
Грубый ориентир для самого ходового формата сжатия: около 0,6 ГБ видеопамяти на каждый миллиард параметров, плюс запас гигабайта в полтора на контекст.
| Видеопамять | Какой размер модели брать | Чего ждать |
|---|---|---|
| 6–8 ГБ | до 9 млрд параметров | Переписка, черновики, простые вопросы |
| 12 ГБ | до 14 млрд | То же плюс работа с кодом и длинными текстами |
| 16–24 ГБ | 27–32 млрд | Заметно ровнее рассуждает, годится как основной инструмент |
| 32 ГБ и выше | 70 млрд и модели с разреженной активацией | Ближе к облачным моделям начального уровня |
На Маках с Apple Silicon память общая для процессора и графики, поэтому ориентироваться нужно на общий объём памяти машины за вычетом нескольких гигабайт на систему.
Что сейчас берут
По количеству скачиваний открытых моделей в формате GGUF картина на август 2026 такая: чаще всего берут семейство Qwen — версии 3.5 и 3.6 в размерах от 4 до 35 миллиардов параметров и отдельно Qwen3-Coder на 30 миллиардов под код. Рядом идут Gemma 4 от Google, DeepSeek V4 и линейка Nemotron от NVIDIA. Отдельно стоит gpt-oss-20b — открытая модель от OpenAI.
Модели вроде Llama 3.1 всё ещё лидируют по накопленным загрузкам, но это статистика за годы, а не показатель актуальности: поколение сменилось.
Все эти файлы лежат в одном месте — на Hugging Face, откуда LM Studio их и тянет. Если хочется выбирать модель самому, а не через встроенный поиск, разбор каталога есть в статье про Hugging Face.
Что такое квантование
У одной модели в каталоге всегда несколько файлов разного размера. Это квантование — сжатие весов модели, при котором она занимает меньше места и считается быстрее, а качество немного падает.
Обозначается это в имени файла: Q4, Q5, Q6, Q8 и приписки вроде K_M. Чем меньше число, тем сильнее сжатие.
- Q4_K_M — рабочий выбор по умолчанию. Лучший баланс размера и качества.
- Q5_K_M, Q6_K — чуть лучше качество, заметно больше размер. Имеет смысл, если модель и так помещается с запасом.
- Q8 — почти без потерь, но и почти без выигрыша в размере.
- Q2, Q3 — берут только когда иначе никак. Модель начинает путаться.
Практический вывод: между моделью на 27 миллиардов параметров в сильном сжатии и моделью на 9 миллиардов в мягком почти всегда выигрывает первая.
Подробный разбор меток, приписок IQ и i1, а также таблица «сколько весит одна и та же модель в каждом варианте» — в статье про формат GGUF.
Локальный сервер и подключение программ
Отдельная причина ставить LM Studio — встроенный сервер, совместимый с интерфейсом OpenAI. Он превращает вашу машину в замену облачному API.
Сервер поднимается на http://localhost:1234/v1 и отвечает на привычные адреса: /v1/models, /v1/chat/completions, /v1/completions, /v1/embeddings, /v1/responses. Любая программа, у которой в настройках есть поле «свой OpenAI-совместимый адрес», подключается к нему заменой одной строки.
Из консоли сервер запускается командой lms server start.
Приятное следствие: по этому же протоколу отвечают облачные сервисы. Один и тот же клиент переключается между вашей машиной и, например, быстрым облачным инференсом Groq заменой адреса — локально бесплатно и приватно, в облаке быстрее и без нагрузки на компьютер.
Есть и режим без графической оболочки — отдельный демон llmster. Он нужен, когда модель должна крутиться на сервере, на отдельной машине с видеокартой или в фоне, а окно программы никому не нужно. Поддерживается загрузка модели по требованию: модель подтягивается в память при первом обращении, а не держится там постоянно.
Если своей мощности не хватает, тот же код можно развернуть в облако — для этого меняется базовый адрес и добавляется ключ, например через OpenRouter. Это же и разумная связка: черновая работа локально, тяжёлые задачи наружу.
Про соседний способ запуска, который работает из командной строки и часто стоит рядом с LM Studio, есть отдельный разбор: установка Ollama и команды ollama run и ollama pull.
Что идёт не так
Модель загрузилась, но отвечает по слову в секунду. Не поместилась в видеопамять. Берите файл с более сильным сжатием или модель поменьше.
Программа не устанавливается на старом компьютере. Для процессоров x64 обязателен набор инструкций AVX2. На процессорах старше примерно 2013 года его нет.
На Маке ничего не запускается. Проверьте процессор: Intel-Маки больше не поддерживаются, нужен Apple Silicon.
Модель отвечает обрывками и забывает начало разговора. Мал размер контекста в настройках модели. Его можно увеличить, но он тоже занимает видеопамять.
Сторонняя программа не видит сервер. Сервер выключен либо в адресе пропущен /v1 в конце. Проверить можно, открыв http://localhost:1234/v1/models в браузере: там должен быть список загруженных моделей.
Если задача не в тексте, а в картинках, локально решается и она — но другими инструментами: смотрите разборы ComfyUI и Stable Diffusion.
Частые вопросы
Бесплатна ли LM Studio для работы?
Да. С 8 июля 2025 года программа бесплатна и для личного, и для рабочего использования, отдельную лицензию запрашивать не нужно. Платные тарифы существуют только для организаций, которым требуются разграничение доступа, единый вход и контроль над списком разрешённых моделей. Одному человеку и небольшой команде платить не нужно вообще.
Какая видеокарта нужна для LM Studio?
Для Windows рекомендуется не меньше 4 ГБ видеопамяти, но комфортная работа начинается примерно с 8 ГБ. Ориентир для подбора модели — около 0,6 ГБ видеопамяти на миллиард параметров плюс запас на контекст. На Маках с Apple Silicon память общая, считать нужно от общего объёма памяти машины.
Работает ли LM Studio без интернета?
Да, после того как модель скачана. Интернет нужен для загрузки моделей и обновлений программы, а сама переписка обрабатывается на вашем компьютере. Если отключить сеть, чат продолжит работать, и ни один запрос не уйдёт на внешние серверы. Это же делает программу пригодной для работы с конфиденциальными документами.
Чем LM Studio отличается от Ollama?
LM Studio — программа с окном, где есть поиск моделей, чат и настройки в интерфейсе. Ollama управляется из командной строки и удобнее для встраивания в скрипты. Обе поднимают локальный сервер, совместимый с интерфейсом OpenAI, поэтому подключаемые к ним программы работают одинаково.
Какой файл модели скачивать, если их несколько?
В большинстве случаев подходит вариант с обозначением Q4_K_M — это сжатие с лучшим соотношением размера и качества. Более слабое сжатие вроде Q5 и Q6 имеет смысл, когда модель помещается в память с запасом. Варианты Q2 и Q3 берут только в крайнем случае, они заметно теряют в точности.
Можно ли запустить LM Studio на Intel-Маке?
Нет. Поддерживаются только компьютеры Apple с процессорами Apple Silicon серий M1–M4 и macOS версии 14.0 или новее. На Маках с процессорами Intel программа не запустится, и обходного пути здесь нет. Остаётся либо другая машина, либо другой способ запуска — например, инструменты командной строки, которые поддерживают процессоры Intel.