Локальный запуск
Локальные нейросети: что запустить на своём компьютере
Локальная нейросеть — это модель, которая работает на вашем компьютере, а не на чужом сервере: без подписки, без лимита сообщений и без отправки текста наружу. Чат и распознавание речи запускаются даже на ноутбуке, генерация картинок требует видеокарты, а уровень топовых облачных моделей дома пока недостижим.
Спрос на это выглядит примерно так: «скачать нейросеть на пк», «нейросеть на русском без интернета», «локальная нейросеть бесплатно». За всеми формулировками одно желание — перестать зависеть от чужого сервиса.
Желание выполнимое, но не полностью. Разберём по частям, что получится, а что нет.
Зачем запускать у себя
Четыре причины, по которым к этому приходят:
- Приватность. Переписка, документы и рабочие данные не покидают машину. Для юристов, врачей и всех, кто работает с чужими персональными данными, это часто единственный допустимый вариант.
- Отсутствие лимитов. Нет счётчика сообщений и подписки. Генерируйте хоть всю ночь, платите только за электричество.
- Доступность. Не нужны зарубежная карта, VPN и работающая регистрация. Скачали файл — пользуетесь.
- Работа без интернета. После скачивания модели сеть не нужна вообще.
Причина, по которой не приходят, тоже одна: домашняя модель слабее топовой облачной. Это не вопрос настройки, это вопрос масштаба.
Что работает локально, а что нет
| Задача | Насколько реально дома | Что нужно |
|---|---|---|
| Чат, переписка, черновики | Хорошо | 8 ГБ видеопамяти или Мак с Apple Silicon |
| Работа с кодом | Хорошо | 12 ГБ и больше |
| Распознавание речи | Отлично | Работает даже на процессоре |
| Генерация картинок | Хорошо | Видеокарта от 6–8 ГБ |
| Разбор длинных документов | Средне | Упирается в размер контекста и память |
| Генерация видео | Плохо | Требует серверного железа |
| Уровень топовых облачных моделей | Недостижимо | Такие модели не помещаются на домашнюю машину |
Строка про видео требует пояснения: ролик с говорящим аватаром дома собрать не выйдет, это делается в облаке — разбор одного из таких сервисов есть в статье про HeyGen.
Отдельно про распознавание речи: это самая недооценённая локальная задача. Модели вроде Parakeet от NVIDIA и Whisper весят меньше гигабайта, работают быстрее реального времени и переводят часовую запись в текст на обычном ноутбуке. Из свежего в этой нише — потоковые модели Nemotron ASR и Voxtral Mini, рассчитанные на распознавание на лету.
Самый массовый пример локального вывода живёт вообще не на компьютере: ИИ-функции современных телефонов считаются прямо на устройстве и моделями, которые оно скачивает себе. Как это устроено у Apple, какие модели подходят и почему в России всё упирается в язык интерфейса, разобрано в статье про Apple Intelligence.
Какое нужно железо
Главный ограничитель — видеопамять. Модель должна поместиться в неё целиком: не поместилась — часть уходит в оперативную память, и скорость падает в разы.
Грубый ориентир для ходового формата сжатия: примерно 0,6 ГБ видеопамяти на каждый миллиард параметров модели, плюс полтора гигабайта запаса на контекст.
| Что у вас | Что потянет | Ощущения |
|---|---|---|
| Ноутбук без отдельной видеокарты | Модели до 4 млрд параметров, распознавание речи | Медленно, но работает |
| Видеокарта 6–8 ГБ | Модели до 9 млрд, генерация картинок | Рабочий минимум |
| Видеокарта 12 ГБ | Модели до 14 млрд, уверенная работа с кодом | Комфортно |
| Видеокарта 16–24 ГБ | Модели 27–32 млрд | Основной инструмент на каждый день |
| 32 ГБ и выше | Модели 70 млрд и с разреженной активацией | Ближе к облаку начального уровня |
| Мак с Apple Silicon | По общему объёму памяти минус 4–6 ГБ на систему | Память общая, 32 ГБ на Маке — хороший вариант |
Мак здесь стоит особняком: у процессоров Apple память общая для вычислений и графики, поэтому машина с 32 или 64 ГБ запускает модели, для которых на ПК понадобилась бы дорогая видеокарта.
Чем запускать
Три инструмента под три разные задачи. Ставить все сразу не нужно.
Для текста
LM Studio — программа с обычным окном: поиск моделей, чат и настройки в интерфейсе. Самый короткий путь для того, кто раньше этим не занимался. Версия 0.4.21, бесплатна в том числе для рабочего использования. Установка и подбор модели разобраны в отдельной статье.
Ollama — то же самое, но из командной строки: модель ставится одной командой, поднимается локальный сервер. Открытый код, лицензия MIT, 178 тысяч звёзд на GitHub, обновления выходят чуть ли не ежедневно. Удобнее, когда модель нужно встроить в скрипт или запустить на отдельной машине. Как поднять её локальный API и обращаться к модели из своего кода — в разборе локального API Ollama.
Для картинок
ComfyUI — открытый редактор генерации изображений, где процесс собирается из блоков. Ставится распаковкой архива, работает в браузере. Пошагово — в статье про ComfyUI, а про сами модели изображений и их версии — в статье про Stable Diffusion.
Какие модели брать
Картина на август 2026 года по количеству скачиваний открытых моделей:
- Qwen — самое ходовое семейство. Версии 3.5 и 3.6 в размерах от 4 до 35 миллиардов параметров, отдельно Qwen3-Coder на 30 миллиардов под код.
- Gemma 4 от Google — размеры от 12 до 31 миллиарда, есть облегчённые варианты с разреженной активацией.
- DeepSeek V4 — сильна в рассуждениях и коде.
- Nemotron 3 от NVIDIA — линейка от компактных до очень крупных.
- gpt-oss-20b — открытая модель от OpenAI на 20 миллиардов параметров.
Отдельно стоит сказать про статистику: по накопленным загрузкам в каталогах до сих пор лидируют Llama 3.1 и DeepSeek-R1, но это цифры за годы. Поколение сменилось, и начинать сегодня стоит с актуальных семейств, а не с самых скачанных за всё время.
Про размер файла
У одной модели всегда несколько файлов разного веса — это степень сжатия. Обозначается как Q4, Q5, Q8 и приписки вроде K_M. По умолчанию берут Q4_K_M: лучший баланс размера и качества. Q2 и Q3 берут только когда иначе никак — модель начинает путаться в ответах.
Правило выбора: между крупной моделью в сильном сжатии и мелкой в мягком почти всегда выигрывает крупная.
Лежат все эти файлы на одном складе — Hugging Face. Как он устроен, какой файл брать и что делать с закрытыми репозиториями, разобрано в статье про Hugging Face.
Как обстоят дела с русским языком
Отдельный вопрос, потому что его задают чаще всего.
Современные открытые модели многоязычные и по-русски отвечают. Но качество русского заметно ниже английского у одной и той же модели, и чем меньше модель, тем разрыв сильнее. На 4 миллиардах параметров русский будет с шероховатостями, на 27–32 миллиардах — уже вполне рабочий.
Практический вывод: если основной язык русский, берите модель на ступень крупнее, чем взяли бы для английского. Разница ощущается сильнее, чем между двумя соседними семействами.
С чего начать за вечер
- Посмотрите объём видеопамяти. На Windows это диспетчер задач, вкладка «Производительность». На Маке — общий объём памяти машины.
- Поставьте одну программу. Для текста — LM Studio, для картинок — ComfyUI. Не обе сразу.
- Скачайте модель на ступень меньше, чем позволяет железо. Быстрый ответ средней модели полезнее правильного ответа через сорок секунд.
- Дайте ей три реальные задачи из своей недели, а не тестовые вопросы. Станет понятно, хватает ли качества.
- Если не хватает — не гонитесь за железом. Дешевле подключить облачную модель по ключу и оставить локальную для черновой и приватной работы. Как это устроено — в статье про OpenRouter.
Разумная конфигурация для большинства выглядит именно так: локальная модель для повседневного и конфиденциального, облачная — для сложного. Это дешевле, чем покупать видеокарту ради задачи, которая случается раз в неделю.
Частые вопросы
Можно ли запустить нейросеть на компьютере без видеокарты?
Да, но с ограничениями. Небольшие текстовые модели до 4 миллиардов параметров работают на процессоре, хотя и медленно. Распознавание речи на процессоре идёт вполне бодро. Генерация картинок формально запускается, но одна картинка считается минутами, поэтому для неё видеокарта обязательна. Начинать проще всего именно с распознавания речи: оно и полезно, и нетребовательно.
Сколько видеопамяти нужно для локальной нейросети?
Рабочий минимум — 6–8 ГБ, этого хватает для моделей до 9 миллиардов параметров и для генерации картинок. Ориентир для подбора: около 0,6 ГБ видеопамяти на миллиард параметров плюс полтора гигабайта запаса на контекст. Комфортная работа начинается с 12–16 ГБ, причём объём памяти важнее скорости самой видеокарты.
Локальная нейросеть работает без интернета?
Да. Интернет нужен один раз, чтобы скачать файл модели, и потом для обновлений программы. Сама работа идёт на вашем компьютере, и после загрузки модели сеть можно отключить. Ни один запрос при этом не уходит на внешние серверы, что и делает такой вариант привлекательным для конфиденциальных задач.
Какая локальная нейросеть лучше всего работает на русском языке?
Современные открытые модели многоязычные, но качество русского заметно ниже английского, и разрыв тем сильнее, чем меньше модель. Приемлемый русский начинается примерно с 27–32 миллиардов параметров. Если основной язык русский, берите модель на ступень крупнее, чем взяли бы для работы на английском.
Заменит ли локальная модель облачный чат?
Полностью — нет. Топовые облачные модели слишком велики, чтобы поместиться на домашнюю машину, и разрыв в качестве на сложных задачах сохраняется. Разумная схема — локальная модель для повседневной и конфиденциальной работы, облачная для сложного. Это дешевле покупки мощной видеокарты, а разрыв в качестве особенно заметен на длинных рассуждениях и сложном коде.
С чего начать, если раньше этим не занимался?
Поставьте одну программу под свою задачу: LM Studio для текста или ComfyUI для картинок. Скачайте модель на ступень меньше, чем позволяет ваша видеопамять, и дайте ей три реальные задачи из своей недели. Так за вечер станет понятно, хватает ли качества именно вам.