Доступ к моделям
Groq: бесплатный API-ключ, лимиты и доступ из России
Groq запускает открытые нейросети на собственных чипах и отдаёт ответ в разы быстрее привычных API. Ключ выдают бесплатно и без карты, ограничение — частота обращений: 30 запросов в минуту и 1000 в сутки. Из России консоль и API отвечают Forbidden, потому что блокировка стоит на IP-адресе.
Дальше по порядку: что это за сервис и откуда берётся скорость, почему его путают с чат-ботом Grok, как за пару минут получить ключ, что входит в бесплатный план, сколько стоят токены на платном и что делать с блокировкой по стране.
Что такое Groq
Groq — облачный сервис доступа к нейросетям. Своих моделей он не обучает: берёт открытые модели других разработчиков и запускает их на собственных чипах, спроектированных под одну задачу — выдавать текст как можно быстрее.
Разница видна сразу и измеряется в токенах в секунду. В каталоге сервиса скорость указана у каждой модели отдельной колонкой — это не рекламное обещание, а рабочий параметр, по которому выбирают модель.
| Модель | Скорость | Цена | Контекст |
|---|---|---|---|
| openai/gpt-oss-120b | 500 токенов/с | $0,15 вход · $0,60 выход за 1 млн токенов | 131 072 |
| openai/gpt-oss-20b | 1000 токенов/с | $0,075 вход · $0,30 выход за 1 млн токенов | 131 072 |
| qwen/qwen3.6-27b | 500 токенов/с | $0,60 вход · $3,00 выход за 1 млн токенов | 131 072 |
| groq/compound | 450 токенов/с | в каталоге не опубликована | 131 072 |
| whisper-large-v3-turbo | — | $0,04 за час аудио | — |
Практический смысл скорости — не в цифре, а в сценариях, где человек ждёт ответ и видит его появление. Голосовой помощник, живой перевод, длинная цепочка шагов, где модель вызывается десятки раз подряд: там разница между сотней и тысячей токенов в секунду превращается в разницу между «неудобно» и «нормально».
Формат запросов у Groq совместим с OpenAI, поэтому библиотеки и программы, написанные под неё, переключаются сменой базового адреса.
Groq или Grok: это разные вещи
Половина путаницы вокруг сервиса — из-за названия. Groq и Grok пишутся почти одинаково, но к одной компании отношения не имеют.
- Groq — американская компания, которая делает чипы для инференса и облако поверх них. Пользуются им через API, интерфейса «чат в браузере» как основного продукта у него нет.
- Grok — чат-бот компании xAI. Это обычный собеседник, к которому заходят на сайт или в приложение.
Если вы искали именно чат-бота, вам сюда не надо: разбор Grok есть в гайде на портале ИИ-офиса. Дальше в статье речь только про сервис инференса.
Как получить API-ключ
Порядок короткий и занимает пару минут.
- Открыть консоль. Рабочий адрес —
console.groq.com, а не витринаgroq.com: на витрине лежит описание компании, ключи выдаются в консоли. - Войти. Регистрация идёт через аккаунт Google, GitHub или почту. Карту на этом шаге не спрашивают.
- Создать ключ. Раздел API Keys, кнопка создания, имя проекта. Ключ показывается один раз — после закрытия окна его уже не подсмотреть, только выпустить новый.
- Убрать ключ в переменные окружения. В код и в репозиторий его класть нельзя: открытые ключи находят автоматические сканеры в течение часа.
Бесплатный план и его лимиты
Бесплатный план не требует карты и не ограничивает вас в деньгах — он ограничивает частоту обращений. Считаются четыре величины: запросы в минуту, запросы в сутки, токены в минуту и токены в сутки. Сработает та, до которой вы дойдёте первой.
| Модель | Запросов в минуту | Запросов в сутки | Объём в сутки |
|---|---|---|---|
| openai/gpt-oss-120b | 30 | 1000 | 200 000 токенов |
| openai/gpt-oss-20b | 30 | 1000 | 200 000 токенов |
| qwen/qwen3.6-27b | 30 | 1000 | 200 000 токенов |
| groq/compound | 30 | 250 | — |
| whisper-large-v3 | 20 | 2000 | 28 800 секунд аудио |
Две вещи, которые меняют картину на практике.
- Лимиты общие на организацию. Пять ключей не дают пятикратный лимит: они делят один и тот же.
- Кешированные токены не считаются. Если вы гоняете один и тот же длинный контекст, повторные его части в лимит не попадают.
Документация называет свою таблицу сводкой и отправляет за точными цифрами на страницу лимитов в настройках аккаунта — там показаны значения именно вашей организации. Перед тем как строить расчёт на лимитах, посмотрите их у себя.
Кто ещё раздаёт доступ к моделям без оплаты и чем за это платят — сведено в обзоре бесплатных API нейросетей.
Раз уж речь зашла про адрес, с которого приходит запрос: чем отличаются между собой три способа его сменить и почему арендованный сервер сам по себе ничего не решает — разобрано в статье про VPN, прокси и VPS.
Сколько стоит платный план
Платный план называется Developer, и абонплаты у него нет. Вы платите за токены по факту: переход на него не списывает деньги сразу, счёт выставляется в конце месячного цикла либо раньше, когда расход проходит порог в 1, 10, 100, 500 или 1000 долларов.
Что даёт переход, кроме цен из таблицы в начале статьи:
- Другие лимиты. У gpt-oss-120b это 250 тысяч токенов в минуту и 1000 запросов в минуту вместо 30.
- Пакетная и гибкая обработка. Режимы для больших объёмов, когда ответ нужен не сию секунду, а дешевле.
- Лимиты расхода. Можно поставить потолок трат и получать предупреждения, чтобы не проснуться со счётом.
Вернуться на бесплатный план можно в любой момент: сервис выставит финальный счёт за уже израсходованное, после оплаты переключит назад.
Forbidden из России: причина
Самый частый вопрос про Groq в русском поиске звучит как «почему Forbidden» и «почему не работает». Ответ проверяется прямым запросом.
Проверка 18 августа 2026 года с московского адреса: страница console.groq.com и адрес API api.groq.com отвечают кодом 403 и телом {"error":{"message":"Forbidden"}}. Витрина groq.com с того же адреса открывается нормально.
Отсюда диагноз: ограничение стоит на сетевом адресе. Дело не в карте, не в аккаунте и не в ключе — до проверки ключа запрос просто не доходит. Ключ, выпущенный когда-то из другой страны, из России тоже работать не будет.
Вариантов три, и они неравноценны.
Подключение из другой страны
Снимает ровно ту проблему, которая есть: адрес меняется, консоль и API открываются. Оплата платного плана этим не решается — там нужен зарубежный платёжный метод.
Те же модели через посредника
Открытые модели, ради которых идут в Groq, доступны не только у него. В каталоге OpenRouter есть и gpt-oss-120b, и gpt-oss-20b, причём у второго — вариант с пометкой «бесплатно». Сам сервис из России открывается, сложность там другая — пополнение баланса.
Запуск у себя
Модель gpt-oss-20b — открытая, её можно скачать и держать локально. Тогда ни блокировок, ни лимитов, ни счетов: разбор железа и инструментов есть в статье про локальные нейросети, а самый короткий путь к первому запуску — через LM Studio.
Куда подставить ключ
Groq говорит на языке OpenAI, поэтому отдельной поддержки от программ ему не требуется. Достаточно, чтобы приложение умело работать с «OpenAI-совместимым адресом» — это встречается в настройках практически любого ИИ-клиента.
- Адрес:
https://api.groq.com/openai/v1 - Ключ: подставляется туда же, куда обычно вписывают ключ OpenAI, заголовком
Authorization: Bearer - Модель: идентификатором из каталога, например
openai/gpt-oss-120b
Приятное следствие: тот же самый клиент можно переключать между Groq и собственным компьютером. Локальный сервер LM Studio отвечает по такому же протоколу на адресе http://localhost:1234/v1 — меняется одна строка в настройках, всё остальное остаётся на месте.
Чем заменить
Замена зависит от того, что именно вас в Groq привлекло.
Нужны те же открытые модели, но без возни с адресом
Смотрите в сторону агрегатора: один ключ, каталог из сотен моделей и привычный формат запроса. Как он устроен и что делать с оплатой, разобрано в статье про OpenRouter.
Нужен официальный ключ вместо открытых моделей
Groq запускает чужие открытые модели. Если задача требует именно флагманской проприетарной модели, смотрите первоисточник: сколько стоят токены и что там с географией, разобрано в статье про OpenAI API.
Нужен бесплатный доступ к сильной модели
У Google есть свой бесплатный уровень с моделями Gemini, но у него та же беда со страной — Россия в список регионов не входит. Что там бесплатно и на каких условиях, разобрано в статье про Google AI Studio.
Нужна приватность и отсутствие лимитов
Тогда решение не в другом облаке, а в своём компьютере. Начните с LM Studio: он ставится в два клика и поднимает такой же локальный сервер.
Нужны сами модели, чтобы крутить их у себя
Веса открытых моделей лежат на Hugging Face — там же, откуда их качают LM Studio и ComfyUI. Как устроен этот склад и какой файл скачивать, разобрано в статье про Hugging Face.
Частые вопросы
Groq бесплатный?
У Groq есть бесплатный план, и карта для него не нужна: платёжный метод спрашивают только при переходе на платный. Ограничение не в деньгах, а в частоте обращений. Для основных моделей это 30 запросов в минуту, 1000 запросов в сутки и 200 тысяч токенов в сутки. Лимиты считаются на всю организацию, а не на каждый ключ.
Чем Groq отличается от Grok?
Это разные компании и разные продукты с похожими названиями. Groq — американский сервис быстрого запуска чужих открытых моделей на собственных чипах, работает через API. Grok — чат-бот компании xAI, им пользуются как обычным чатом. Общего у них только созвучие, из-за которого запросы постоянно путают.
Почему Groq пишет Forbidden?
Так выглядит блокировка по стране. При проверке 18 августа 2026 года с московского IP консоль console.groq.com и адрес api.groq.com отвечали кодом 403 и текстом Forbidden, тогда как витрина groq.com открывалась нормально. Ограничение стоит на сетевом адресе, а не на карте или аккаунте, поэтому обходится только сменой страны подключения.
Сколько стоит Groq на платном плане?
Абонплаты у платного плана нет, счёт идёт по токенам. Модель gpt-oss-120b стоит 0,15 доллара за миллион входных токенов и 0,60 за миллион выходных, gpt-oss-20b — 0,075 и 0,30, распознавание речи Whisper Turbo — 0,04 доллара за час аудио. Деньги списываются в конце месяца либо на порогах в 1, 10, 100, 500 и 1000 долларов.
Какие модели доступны в Groq?
Groq не обучает свои нейросети, а запускает открытые модели других разработчиков. В каталоге есть gpt-oss на 120 и 20 миллиардов параметров, модели Qwen, собственная агентная связка Compound и распознавание речи Whisper. Контекст у основных текстовых моделей — 131 072 токена.
Зачем нужен Groq, если есть обычные API?
Ради скорости выдачи. В каталоге сервиса скорость указана прямо у модели: gpt-oss-20b выдаёт около 1000 токенов в секунду, gpt-oss-120b и Qwen — около 500. Это заметно в сценариях, где ответ читают в реальном времени: голосовые помощники, потоковая обработка текста, длинные цепочки шагов.