Локальный запуск

Локальные нейросети: что запустить на своём компьютере

Локальная нейросеть — это модель, которая работает на вашем компьютере, а не на чужом сервере: без подписки, без лимита сообщений и без отправки текста наружу. Чат и распознавание речи запускаются даже на ноутбуке, генерация картинок требует видеокарты, а уровень топовых облачных моделей дома пока недостижим.

Спрос на это выглядит примерно так: «скачать нейросеть на пк», «нейросеть на русском без интернета», «локальная нейросеть бесплатно». За всеми формулировками одно желание — перестать зависеть от чужого сервиса.

Желание выполнимое, но не полностью. Разберём по частям, что получится, а что нет.

Зачем запускать у себя

Четыре причины, по которым к этому приходят:

  • Приватность. Переписка, документы и рабочие данные не покидают машину. Для юристов, врачей и всех, кто работает с чужими персональными данными, это часто единственный допустимый вариант.
  • Отсутствие лимитов. Нет счётчика сообщений и подписки. Генерируйте хоть всю ночь, платите только за электричество.
  • Доступность. Не нужны зарубежная карта, VPN и работающая регистрация. Скачали файл — пользуетесь.
  • Работа без интернета. После скачивания модели сеть не нужна вообще.

Причина, по которой не приходят, тоже одна: домашняя модель слабее топовой облачной. Это не вопрос настройки, это вопрос масштаба.

Что работает локально, а что нет

ЗадачаНасколько реально домаЧто нужно
Чат, переписка, черновикиХорошо8 ГБ видеопамяти или Мак с Apple Silicon
Работа с кодомХорошо12 ГБ и больше
Распознавание речиОтличноРаботает даже на процессоре
Генерация картинокХорошоВидеокарта от 6–8 ГБ
Разбор длинных документовСреднеУпирается в размер контекста и память
Генерация видеоПлохоТребует серверного железа
Уровень топовых облачных моделейНедостижимоТакие модели не помещаются на домашнюю машину

Строка про видео требует пояснения: ролик с говорящим аватаром дома собрать не выйдет, это делается в облаке — разбор одного из таких сервисов есть в статье про HeyGen.

Отдельно про распознавание речи: это самая недооценённая локальная задача. Модели вроде Parakeet от NVIDIA и Whisper весят меньше гигабайта, работают быстрее реального времени и переводят часовую запись в текст на обычном ноутбуке. Из свежего в этой нише — потоковые модели Nemotron ASR и Voxtral Mini, рассчитанные на распознавание на лету.

Самый массовый пример локального вывода живёт вообще не на компьютере: ИИ-функции современных телефонов считаются прямо на устройстве и моделями, которые оно скачивает себе. Как это устроено у Apple, какие модели подходят и почему в России всё упирается в язык интерфейса, разобрано в статье про Apple Intelligence.

Какое нужно железо

Главный ограничитель — видеопамять. Модель должна поместиться в неё целиком: не поместилась — часть уходит в оперативную память, и скорость падает в разы.

Грубый ориентир для ходового формата сжатия: примерно 0,6 ГБ видеопамяти на каждый миллиард параметров модели, плюс полтора гигабайта запаса на контекст.

Что у васЧто потянетОщущения
Ноутбук без отдельной видеокартыМодели до 4 млрд параметров, распознавание речиМедленно, но работает
Видеокарта 6–8 ГБМодели до 9 млрд, генерация картинокРабочий минимум
Видеокарта 12 ГБМодели до 14 млрд, уверенная работа с кодомКомфортно
Видеокарта 16–24 ГБМодели 27–32 млрдОсновной инструмент на каждый день
32 ГБ и вышеМодели 70 млрд и с разреженной активациейБлиже к облаку начального уровня
Мак с Apple SiliconПо общему объёму памяти минус 4–6 ГБ на системуПамять общая, 32 ГБ на Маке — хороший вариант

Мак здесь стоит особняком: у процессоров Apple память общая для вычислений и графики, поэтому машина с 32 или 64 ГБ запускает модели, для которых на ПК понадобилась бы дорогая видеокарта.

Чем запускать

Три инструмента под три разные задачи. Ставить все сразу не нужно.

Для текста

LM Studio — программа с обычным окном: поиск моделей, чат и настройки в интерфейсе. Самый короткий путь для того, кто раньше этим не занимался. Версия 0.4.21, бесплатна в том числе для рабочего использования. Установка и подбор модели разобраны в отдельной статье.

Ollama — то же самое, но из командной строки: модель ставится одной командой, поднимается локальный сервер. Открытый код, лицензия MIT, 178 тысяч звёзд на GitHub, обновления выходят чуть ли не ежедневно. Удобнее, когда модель нужно встроить в скрипт или запустить на отдельной машине. Как поднять её локальный API и обращаться к модели из своего кода — в разборе локального API Ollama.

Для картинок

ComfyUI — открытый редактор генерации изображений, где процесс собирается из блоков. Ставится распаковкой архива, работает в браузере. Пошагово — в статье про ComfyUI, а про сами модели изображений и их версии — в статье про Stable Diffusion.

Что из локального железа и моделей окупается, а что нет, разбираем в канале.Открыть канал

Какие модели брать

Картина на август 2026 года по количеству скачиваний открытых моделей:

  • Qwen — самое ходовое семейство. Версии 3.5 и 3.6 в размерах от 4 до 35 миллиардов параметров, отдельно Qwen3-Coder на 30 миллиардов под код.
  • Gemma 4 от Google — размеры от 12 до 31 миллиарда, есть облегчённые варианты с разреженной активацией.
  • DeepSeek V4 — сильна в рассуждениях и коде.
  • Nemotron 3 от NVIDIA — линейка от компактных до очень крупных.
  • gpt-oss-20b — открытая модель от OpenAI на 20 миллиардов параметров.

Отдельно стоит сказать про статистику: по накопленным загрузкам в каталогах до сих пор лидируют Llama 3.1 и DeepSeek-R1, но это цифры за годы. Поколение сменилось, и начинать сегодня стоит с актуальных семейств, а не с самых скачанных за всё время.

Про размер файла

У одной модели всегда несколько файлов разного веса — это степень сжатия. Обозначается как Q4, Q5, Q8 и приписки вроде K_M. По умолчанию берут Q4_K_M: лучший баланс размера и качества. Q2 и Q3 берут только когда иначе никак — модель начинает путаться в ответах.

Правило выбора: между крупной моделью в сильном сжатии и мелкой в мягком почти всегда выигрывает крупная.

Лежат все эти файлы на одном складе — Hugging Face. Как он устроен, какой файл брать и что делать с закрытыми репозиториями, разобрано в статье про Hugging Face.

Как обстоят дела с русским языком

Отдельный вопрос, потому что его задают чаще всего.

Современные открытые модели многоязычные и по-русски отвечают. Но качество русского заметно ниже английского у одной и той же модели, и чем меньше модель, тем разрыв сильнее. На 4 миллиардах параметров русский будет с шероховатостями, на 27–32 миллиардах — уже вполне рабочий.

Практический вывод: если основной язык русский, берите модель на ступень крупнее, чем взяли бы для английского. Разница ощущается сильнее, чем между двумя соседними семействами.

С чего начать за вечер

  1. Посмотрите объём видеопамяти. На Windows это диспетчер задач, вкладка «Производительность». На Маке — общий объём памяти машины.
  2. Поставьте одну программу. Для текста — LM Studio, для картинок — ComfyUI. Не обе сразу.
  3. Скачайте модель на ступень меньше, чем позволяет железо. Быстрый ответ средней модели полезнее правильного ответа через сорок секунд.
  4. Дайте ей три реальные задачи из своей недели, а не тестовые вопросы. Станет понятно, хватает ли качества.
  5. Если не хватает — не гонитесь за железом. Дешевле подключить облачную модель по ключу и оставить локальную для черновой и приватной работы. Как это устроено — в статье про OpenRouter.

Разумная конфигурация для большинства выглядит именно так: локальная модель для повседневного и конфиденциального, облачная — для сложного. Это дешевле, чем покупать видеокарту ради задачи, которая случается раз в неделю.

Частые вопросы

Можно ли запустить нейросеть на компьютере без видеокарты?

Да, но с ограничениями. Небольшие текстовые модели до 4 миллиардов параметров работают на процессоре, хотя и медленно. Распознавание речи на процессоре идёт вполне бодро. Генерация картинок формально запускается, но одна картинка считается минутами, поэтому для неё видеокарта обязательна. Начинать проще всего именно с распознавания речи: оно и полезно, и нетребовательно.

Сколько видеопамяти нужно для локальной нейросети?

Рабочий минимум — 6–8 ГБ, этого хватает для моделей до 9 миллиардов параметров и для генерации картинок. Ориентир для подбора: около 0,6 ГБ видеопамяти на миллиард параметров плюс полтора гигабайта запаса на контекст. Комфортная работа начинается с 12–16 ГБ, причём объём памяти важнее скорости самой видеокарты.

Локальная нейросеть работает без интернета?

Да. Интернет нужен один раз, чтобы скачать файл модели, и потом для обновлений программы. Сама работа идёт на вашем компьютере, и после загрузки модели сеть можно отключить. Ни один запрос при этом не уходит на внешние серверы, что и делает такой вариант привлекательным для конфиденциальных задач.

Какая локальная нейросеть лучше всего работает на русском языке?

Современные открытые модели многоязычные, но качество русского заметно ниже английского, и разрыв тем сильнее, чем меньше модель. Приемлемый русский начинается примерно с 27–32 миллиардов параметров. Если основной язык русский, берите модель на ступень крупнее, чем взяли бы для работы на английском.

Заменит ли локальная модель облачный чат?

Полностью — нет. Топовые облачные модели слишком велики, чтобы поместиться на домашнюю машину, и разрыв в качестве на сложных задачах сохраняется. Разумная схема — локальная модель для повседневной и конфиденциальной работы, облачная для сложного. Это дешевле покупки мощной видеокарты, а разрыв в качестве особенно заметен на длинных рассуждениях и сложном коде.

С чего начать, если раньше этим не занимался?

Поставьте одну программу под свою задачу: LM Studio для текста или ComfyUI для картинок. Скачайте модель на ступень меньше, чем позволяет ваша видеопамять, и дайте ей три реальные задачи из своей недели. Так за вечер станет понятно, хватает ли качества именно вам.

ИИ-офисПроект про работу с нейросетями: разборы инструментов, рабочие связки и практика, проверенная на своих задачах.