Цены Groq в 2026 году: перейти на платный тариф заставляют лимиты, а не токены
Цены Groq, проверенные в августе 2026 года: лимиты Free и Developer, стоимость всех моделей, Batch, кэширование, инструменты и сравнение провайдеров.

Цены Groq начинаются с $0, но лишь до тех пор, пока ограничения Free для конкретной модели не начинают мешать рабочему процессу. У Developer нет абонентской платы: после перехода оплачивается только фактическое использование. В расчёте для GPT-OSS 120B суточный лимит токенов Free соответствует всего $1.44 платного трафика в месяц. Поэтому перейти на платный тариф заставляет пропускная способность, а не расходы на токены.
Цены Groq: главное
У самостоятельного тарифа Groq нет фиксированной ежемесячной цены за пользователя, которую нужно держать в уме. Выбор сводится к Free с ограничениями, Developer с оплатой по факту использования и Enterprise с мощностями на индивидуальных условиях.
Актуальность цен и лимитов проверена 15 августа 2026 года по странице цен Groq, списку поддерживаемых моделей, FAQ по оплате и документации по лимитам.

Токен — единица, по которой модель рассчитывает плату. К входным токенам относятся инструкции, история диалога, документы и описания инструментов, отправленные модели. Выходные токены — то, что генерирует модель. Groq указывает обе ставки за миллион токенов, поэтому месячная сумма складывается из входных и выходных токенов, аудио и обращений к встроенным инструментам.
Developer не требует ни месячной, ни годовой подписки. Groq просит добавить способ оплаты, учитывает использование и обычно выставляет счёт постфактум. Отдельной повышенной ставки за превышение лимита нет: Free блокирует лишний трафик при достижении соответствующего ограничения, а Developer продолжает тарифицировать использование по тем же ставкам модели, пока запросы не остановит ограничение аккаунта или Spend Limit. Enterprise Performance устроен иначе: клиент покупает выделенную входную и выходную мощность, а не оплачивает токены по публичной ставке On Demand.
Free полезен, пока от общего лимита не зависит работа продукта
Free от Groq подходит для прототипа, внутреннего помощника и вполне серьёзного объёма автоматизации с небольшим трафиком. Но он перестаёт быть бесплатной инфраструктурой, как только ошибка из-за лимита становится событием, заметным клиенту.
Ограничения действуют на всю организацию, а не на каждый API-ключ. Создание новых ключей не увеличивает доступную мощность. Кроме того, Groq одновременно контролирует несколько показателей: запросы в минуту, запросы в сутки, токены в минуту и токены в сутки. Как только достигается первый из лимитов, следующий вызов блокируется с HTTP 429.
Для актуальных текстовых моделей, предназначенных для продакшена, опубликованы следующие лимиты Free:
- GPT-OSS 120B и GPT-OSS 20B: 30 RPM, 1,000 RPD, 8,000 TPM и 200,000 TPD.
- Llama 3.3 70B Versatile: 30 RPM, 1,000 RPD, 12,000 TPM и 100,000 TPD.
- Llama 3.1 8B Instant: 30 RPM, 14,400 RPD, 6,000 TPM и 500,000 TPD.
- Compound и Compound Mini: 30 RPM, 250 RPD и 70,000 TPM.
- Whisper Large V3 и Turbo: 20 RPM, 2,000 RPD, 7,200 секунд аудио в час и 28,800 секунд аудио в сутки.
Groq называет эту публичную таблицу сводной. Актуальные ограничения конкретной организации следует смотреть на странице Limits в Console.
Часто дневной лимит токенов заканчивается раньше, чем лимит запросов. Возьмём вызов GPT-OSS 120B с 2,000 входных и 500 выходных токенов. При суммарных 2,500 токенах ограничение 200,000 TPD позволяет выполнить 80 таких запросов в сутки. Лимит 8,000 TPM допускает три запроса за минуту; четвёртый сопоставимый вызов уже превысит ограничение по токенам, хотя для тарифа заявлено 30 RPM.
Именно здесь проходит практическая граница между Free и платным тарифом. На Developer тот же запрос стоит $0.0006, поэтому 80 запросов в день на протяжении 30 дней обойдутся примерно в $1.44. Подстраивать рабочий процесс под потолок Free финансово почти бессмысленно: платный тариф даёт мощность, пока счёт за модель всё ещё меньше большинства дополнений к SaaS.

Кому платный тариф может не понадобиться
Developer может вообще не понадобиться, если Groq используется для локальной разработки, нерегулярного тестирования, личного внутреннего скрипта или демо, трафик которого не выходит за соответствующие лимиты токенов и запросов. Free подходит и тогда, когда после 429 можно спокойно дождаться повторной попытки и непрерывная работа никому не обещана.
Платить стоит, как только процесс начинает обслуживать пользователя, зависит от срока или упирается в очередь, которая не терпит общего ограничения. В Developer также входят Batch, Flex, поддержка в чате и Spend Limits. Именно эти операционные возможности, а не иной набор моделей, образуют практическую границу между тарифами.
Цены Groq для всех актуальных моделей
Текущий каталог Groq для продакшена компактен: четыре текстовые модели, две модели распознавания речи и две системы Compound. Отдельно существует каталог preview-моделей, которые могут исчезнуть без длительного предупреждения.
Текстовые модели для продакшена
- Llama 3.1 8B Instant стоит $0.05 за вход и $0.08 за выход на миллион токенов. Это самый дешёвый текстовый вариант для продакшена. Базовый лимит Developer составляет 250,000 TPM и 1,000 RPM, а контекстное окно — 131,072 токена.
- GPT-OSS 20B стоит $0.075 за вход и $0.30 за выход на миллион токенов. Кэшированный вход стоит $0.0375 за миллион. Базовый лимит Developer составляет 250,000 TPM и 1,000 RPM, а контекстное окно — 131,072 токена.
- GPT-OSS 120B стоит $0.15 за вход и $0.60 за выход на миллион токенов. Кэшированный вход стоит $0.075 за миллион. Базовый лимит Developer составляет 250,000 TPM и 1,000 RPM, а контекстное окно — 131,072 токена.
- Llama 3.3 70B Versatile стоит $0.59 за вход и $0.79 за выход на миллион токенов. Базовый лимит Developer составляет 300,000 TPM и 1,000 RPM, а контекстное окно — 131,072 токена.
Если нужна более крупная модель с открытыми весами, а резервный провайдер той же модели имеет значение, проверку перед запуском стоит начинать с GPT-OSS 120B. Переходить на GPT-OSS 20B или Llama 3.1 8B следует только после проверки, подтверждающей, что меньшая модель сохраняет качество результата. Llama 3.3 70B оправдана лишь тогда, когда её результаты окупают ставку, которая в 3.93 раза выше GPT-OSS 120B для входа и в 1.32 раза — для выхода.
Эти коэффициенты не доказывают превосходство какой-либо модели. Они показывают, что именно результат должен компенсировать: меньше повторных попыток, более короткие ответы, меньший объём ручной проверки или возможность, которой нет у дешёвого варианта.
Модели распознавания речи
- Whisper Large V3 стоит $0.111 за час аудио. Базовая мощность Developer — 200,000 секунд аудио в час и 300 RPM, максимальный размер файла — 100 MB.
- Whisper Large V3 Turbo стоит $0.04 за час аудио. Базовая мощность Developer — 400,000 секунд аудио в час и 400 RPM.
При 1,000 часах аудио статьи расходов составят $111 для Whisper Large V3 и $40 для Turbo, разница — $71. Начать логично с более дешёвого варианта, однако команде, работающей с аудио, следует оставить ту модель, которая проходит её критерий качества транскрипта. Дешёвая расшифровка, которую приходится исправлять, не даёт дешёвого результата.
Системы Compound и preview-модели
Groq Compound и Compound Mini объединяют модели для продакшена с серверными инструментами. Единой фиксированной ставки за токены у них нет. Groq отдельно начисляет стоимость базовой модели и инструментов, поэтому бюджет Compound нужно складывать из нескольких статей, а не оценивать одной ценой за токен.
Сейчас в актуальном каталоге preview указаны:
- Qwen3.6 27B: $0.60 за вход и $3.00 за выход на миллион токенов.
- Safety GPT-OSS 20B: $0.075 за вход и $0.30 за выход на миллион токенов.
- Llama Prompt Guard 2 22M: $0.03 за вход и выход на миллион токенов.
- Llama Prompt Guard 2 86M: $0.04 за вход и выход на миллион токенов.
- Canopy Labs Orpheus V1 English: $22 за миллион символов.
- Canopy Labs Orpheus Arabic Saudi: $40 за миллион символов.
- MiniMax M2.7: цены Enterprise предоставляются по запросу в отдел продаж.
Статус preview означает тестирование, а не обещание доступности в продакшене. По словам Groq, такие модели могут быть отключены без длительного предупреждения. Поэтому для бюджета, зависящего от Qwen3.6 27B, ещё до выхода к клиентам нужен проверенный переход на другого провайдера или другую модель.
На текущей странице поддерживаемых моделей Groq нет DeepSeek или Kimi. Старые публикации и калькуляторы, где эти названия всё ещё оцениваются как действующие маршруты Groq, устарели. Если требуется DeepSeek, рассчитывайте стоимость у актуального провайдера, а не исходите из того, что модель по-прежнему доступна в каталоге Groq; этот отдельный выбор разобран в анализе цен DeepSeek.
Выбирать модель нужно по стоимости результата
Токены Groq стоят настолько дёшево, что до больших объёмов форма трафика влияет на выбор сильнее, чем сама модель. Для честного сравнения следует зафиксировать один типовой запрос и рассчитать каждый вариант на его основе.
Возьмём стандартный запрос с 2,000 входных и 500 выходных токенов. При 100,000 запросов в месяц, до учёта кэширования, Batch, инструментов и повторных попыток, получаются такие суммы:
- Llama 3.1 8B Instant: всего $14, или $0.00014 за запрос.
- GPT-OSS 20B: всего $30, или $0.0003 за запрос.
- GPT-OSS 120B: всего $60, или $0.0006 за запрос.
- Llama 3.3 70B Versatile: всего $157.50, или $0.001575 за запрос.
- Qwen3.6 27B preview: всего $270, или $0.0027 за запрос.
Правильный знаменатель — не запрос, а принятый результат. Если меньшая модель вынуждает делать повторные попытки, выдаёт более длинные ответы или перекладывает больше работы на человека, дешёвый запрос превращается в дорогой процесс. Учитывайте принятые результаты рядом с токенами: так модель будет оправдывать своё место качеством, а не побеждать ценником.
Платного объёма, после которого одна модель Groq автоматически становится дешевле другой, не существует. Все публичные ставки On Demand линейны, базовой платы нет. В расчётном примере GPT-OSS 20B обходится вдвое дешевле GPT-OSS 120B и на одном запросе, и на миллионе запросов. Решение меняется только тогда, когда качество результата или поведение в эксплуатации влияет на объём необходимой работы.
Для основателя стартапа с финансированием это может означать GPT-OSS 20B для классификации и GPT-OSS 120B для неоднозначных случаев. Для CTO компании среднего масштаба — сохранять поля модели и токенов в журнале каждого запроса, чтобы отдел закупок видел стоимость принятого процесса. Для руководителя эксплуатации — измерять исправления и повторные попытки, а не считать одно удачное демо доказательством готовности маршрута к продакшену.
Для асинхронных задач Batch выгоднее кэширования, а скидки не суммируются
Groq Batch предлагает самую низкую опубликованную ставку, если результат может подождать. Такой режим стоит на 50% меньше синхронного API, работает вне стандартных лимитов моделей и позволяет выбрать окно обработки от 24 часов до 7 дней.
Для расчётной нагрузки из 100,000 запросов к GPT-OSS 120B варианты выглядят так:
- Синхронно, без кэша: $60.
- Синхронно, 50% входных токенов получено из кэша: $52.50.
- Синхронно, 80% входных токенов получено из кэша: $48.
- Batch: $30.
Ключевое для бюджета правило сформулировано однозначно: скидки Batch и кэширования промптов не суммируются. Все токены Batch оплачиваются со скидкой 50% независимо от статуса кэша. Таблица, в которой итог Batch в $30 ещё раз делят пополам до $15, неверна.
Кэширование промптов остаётся полезным для синхронного трафика GPT-OSS. Оно работает автоматически, не требует отдельной платы за функцию и даёт скидку 50% на кэшированный вход. Сейчас поддерживаются GPT-OSS 20B, GPT-OSS 120B и GPT-OSS Safeguard 20B. Для попадания в кэш требуется полностью совпадающий префикс, минимальная длина кэшируемого префикса в зависимости от модели составляет от 128 до 1,024 токенов, а срок действия неиспользованных данных истекает через два часа. Попадание в кэш не гарантируется и происходит по принципу best effort.
Размещайте неизменные системные инструкции и описания инструментов в начале промпта, а переменные пользовательские данные — после них. Затем отслеживайте число кэшированных токенов в ответах. Прогнозируемая доля попаданий не может считаться фактом бюджета, пока её не подтвердят данные эксплуатации.
У Batch есть свои операционные ограничения. Файл JSONL может содержать до 50,000 строк и занимать до 200 MB. Задания, не уложившиеся в выбранное окно обработки, завершаются по истечении срока, хотя Groq взимает плату только за успешно выполненные запросы. Файлы Batch и результаты могут храниться в системах Groq до 30 дней, поэтому для чувствительных данных нужно проверить правила хранения ещё до того, как экономия определит выбор маршрута.
$60 за токены могут превратиться в счёт Compound на $560
Скрытые расходы Compound связаны не с моделью, а с циклом вызова инструментов.
Groq оценивает Basic Search в $5 за 1,000 запросов, Advanced Search — в $8 за 1,000, Visit Website — в $1 за 1,000, а Code Execution — в $0.18 за час. Эти суммы начисляются поверх стоимости токенов базовой модели.
Возьмём 100,000 стандартных запросов к GPT-OSS 120B. Токены модели стоят $60. Если каждый запрос вызывает Basic Search один раз, поиск добавит $500, а общий счёт составит $560. Один вызов Advanced Search на запрос даст итог $860. Один вызов Visit Website — $160.

Именно эта статья расходов чаще всего застаёт команду, создающую агентов, врасплох. Оптимизация токенов не спасёт процесс, в котором агент запускает поиск на каждом шаге. Начинать нужно с правил использования инструментов: определить, когда поиск действительно необходим, ограничить циклы вызовов, кэшировать устойчивые результаты вне модели и учитывать число вызовов инструментов на каждый принятый результат.
У платного тарифа нет годовой привязки, но есть операционные нюансы
Developer оплачивается по фактическому использованию: это не замаскированный годовой SaaS-контракт. Менее очевидные условия касаются сроков списания, поведения лимитов и судьбы кредитов.
Для новых аккаунтов Developer действует поэтапное выставление счетов. Groq может выставлять счёт, когда совокупное использование за всё время превышает $1, $10, $100, $500 и $1,000. После порога $1,000 начинается обычный ежемесячный расчёт. Для аккаунтов с платёжным адресом в Индии действуют пороги $1 и $10, после чего счета выставляются с шагом $100. Groq не требует оплаты, пока использование не достигнет хотя бы $0.50.
Из-за такой схемы в начале работы на карте может появиться несколько небольших списаний. Это не дополнительная комиссия, однако финансовой команде полезно знать закономерность, чтобы не принять платежи за дубликаты.
Spend Limits блокируют трафик с небольшой задержкой в отчётности
На платных тарифах можно задать один общий для организации месячный Spend Limit. Он охватывает все API-ключи и эндпоинты, сбрасывается первого числа месяца и блокирует новые запросы после обнаружения превышения. Groq поддерживает уведомления, например на 50%, 75% и 90% лимита.
Данные о расходах обновляются с задержкой от 10 до 15 минут. Поэтому всплеск трафика способен немного вывести итоговый счёт за заданный лимит до начала блокировки. Groq рекомендует сначала устанавливать лимит на 20%–30% выше ожидаемого месячного использования. Для критически важного процесса этот запас также снижает риск, что обычный скачок трафика превратит бюджетный предохранитель в сбой сервиса.
Кредиты сгорают, а предоплаченные покупки возврату не подлежат
Срок действия Service Credits от Groq истекает через один год после покупки или выдачи, если не указан иной срок. Их нельзя передать, обменять на деньги или вернуть. При закрытии аккаунта остаток сгорает сразу.
В общих случаях Groq рассматривает запросы на возврат средств через поддержку индивидуально, согласно FAQ по оплате. Но это не отменяет специальные условия Service Credits: купленные и промокредиты возврату не подлежат. Покупайте объём, привязанный к прогнозу, а не к неопределённой будущей миграции.
Flex повышает лимит ценой отказа от гарантированной мощности
Flex доступен платным клиентам по той же цене токенов, что и On Demand, и даёт лимит в 10 раз выше. Компромисс — мощность в режиме best effort. Если Flex заполнен, запрос может быстро завершиться ошибкой HTTP 498 с кодом capacity_exceeded.
Используйте Flex для очередей с повторными попытками, тестирования и массовых задач, где допустим быстрый отказ. Не делайте его единственным маршрутом для действия клиента, которое нельзя повторить. On Demand обеспечивает предсказуемую скорость, но в пиковые периоды может добавлять задержку очереди. Если такая вариативность неприемлема, договорным вариантом служит Enterprise Performance с SLA доступности 99.9% и гарантией по задержке на уровне 99% в корпоративном соглашении.
Groq, Together AI и Fireworks стоят одинаково для GPT-OSS 120B без кэша
Groq не выигрывает по одной только публичной цене токенов GPT-OSS 120B. Groq, Together AI и Fireworks AI указывают одинаковые ставки для этой модели: $0.15 за вход и $0.60 за выход на миллион токенов.
Возьмём нормализованную нагрузку: 100 миллионов входных и 20 миллионов выходных токенов. Без скидки за кэш у каждого провайдера получится $27. Именно поэтому выбор должны определять экономика кэша, лимиты, варианты развёртывания, надёжность и измеренная задержка.
Together AI
Together AI — провайдер инференса с несколькими моделями; его serverless-маршрут GPT-OSS 120B стоит $0.15 за вход и $0.60 за выход на миллион токенов. Для serverless-продукта нет минимальной платы или стоимости предварительно выделенной мощности.

В актуальной строке цен на GPT-OSS 120B у Together нет опубликованной ставки для кэшированного входа. Согласно документации, если у модели не указана цена кэша, весь вход оплачивается по стандартному тарифу. Поэтому на нормализованной нагрузке сумма остаётся равной $27, даже если промпт повторяется. Для поддерживаемых serverless-моделей Together предлагает скидку до 50% на Batch, так что при доступности именно этой модели сервис остаётся подходящим для асинхронных задач.
Together стоит выбирать, если более широкий каталог моделей или путь от serverless к зарезервированной инфраструктуре важнее особенностей работы Groq. Переходить между ними только ради цены не стоит, пока реальная нагрузка не выявит разницу: строка расходов на GPT-OSS без кэша у них одинакова.
Fireworks AI
Fireworks AI указывает для GPT-OSS 120B цену $0.15 за вход, $0.014 за кэшированный вход и $0.60 за выход на миллион токенов, а также $1 приветственного кредита для serverless.

При доле кэшированного входа 50% нормализованный итог составляет $20.20 у Fireworks, $23.25 у Groq и $27 у Together. По публичной цене Fireworks выигрывает для GPT-OSS 120B с часто повторяющимся входом — при условии, что заявленная ставка кэша применяется к измеренной нагрузке. Для асинхронной работы Groq Batch всё равно дешевле: $13.50 на том же нормализованном трафике.
Модель GPT-OSS разработана OpenAI, но компания не предоставляет её через OpenAI API или пользовательское приложение. Поэтому прямое сравнение с OpenAI API одновременно меняет и провайдера, и модель, нарушая нормализацию цены. Сначала сравнивайте одну модель у разных хостинг-провайдеров, а затем оценивайте проприетарные модели по стоимости принятого результата. Более широкий выбор моделей и провайдеров разобран в подборке самых дешёвых API для ИИ.
Правило выбора провайдера простое:
- Выбирайте Groq, когда на измеренном маршруте выигрывают синхронная пропускная способность и операционные возможности сервиса либо когда скидка Batch 50% делает отложенную работу самой дешёвой.
- Выбирайте Fireworks, когда к повторяющемуся контексту GPT-OSS стабильно применяется заявленная ставка кэшированного входа $0.014.
- Выбирайте Together, когда важен более широкий путь от serverless к выделенной инфраструктуре, а нагрузка не выигрывает от ставки для кэша GPT-OSS.
Кому подходит Groq, а кому лучше пройти мимо
Groq — сильный вариант, когда открытая модель уже проходит планку качества, а скорость ответа влияет на продукт. Он подходит хуже, если нужная модель, гарантия мощности или контроль развёртывания выходят за рамки текущего самостоятельного каталога.
- Free позволяет достаточно полно протестировать модели для продакшена до добавления способа оплаты.
- У Developer нет базовой подписки или годовой привязки.
- Публичные ставки On Demand для всех текстовых моделей для продакшена остаются ниже $1 за миллион токенов.
- Batch снижает стоимость подходящих асинхронных задач на 50%, не расходуя стандартные лимиты моделей.
- Кэширование промптов GPT-OSS работает автоматически и вдвое снижает цену кэшированного входа.
- Spend Limits могут остановить использование во всей организации до неконтролируемого превышения месячного бюджета.
- Лимиты Free общие для всей организации, причём токены могут закончиться намного раньше запросов.
- Скидки Batch и кэширования не суммируются.
- Расходы на инструменты Compound могут значительно превышать расходы на токены модели.
- Кэширование промптов работает только для указанного семейства GPT-OSS и требует точного совпадения префикса.
- Flex может вернуть HTTP 498, если мощность best effort недоступна.
- Preview-модели могут удалить из каталога без длительного предупреждения, поэтому на них нельзя строить непереносимую зависимость в продакшене.
Основателю стартапа с финансированием стоит выбрать Groq, если быстрая открытая модель сохраняет отзывчивость продукта, а команда может поддерживать резерв у другого провайдера той же модели. CTO компании среднего масштаба следует переходить на Developer только после централизации ключей, журналирования использования моделей и инструментов и установки общего лимита организации. Руководителю эксплуатации важна стоимость принятого результата, а не эффектный показатель количества токенов на доллар.
Не используйте Groq как единственного провайдера, если приложению нужна отсутствующая в каталоге проприетарная модель, гарантированный маршрут вместо best effort или preview-модель без стабильной замены. Enterprise Performance может предоставить согласованную мощность для поддерживаемых моделей, но это индивидуальная цена за выделенный ресурс, а не более дешёвый публичный тариф.
Правило решения однозначно: выбирайте Groq, только если актуальная модель для продакшена проходит проверку качества, а характеристики синхронной работы или стоимость Batch оказываются лучше, чем у резервного варианта с той же моделью. Если оба условия не выполняются, низкая цена токенов сама по себе не оправдывает миграцию.
История цен Groq показывает, почему нужна проверка по актуальным данным
Цены Groq меняются на уровне функций и моделей, даже когда сохраняется оплата по фактическому использованию. При запуске Developer в феврале 2025 года Batch рекламировался как вариант на 25% дешевле синхронной обработки. В текущей документации скидка Batch составляет 50%.
Groq также снизила цены GPT-OSS и начала добавлять кэширование промптов для этого семейства в октябре 2025 года. Текущие ставки — $0.15/$0.60 для GPT-OSS 120B и $0.075/$0.30 для GPT-OSS 20B, а кэшированный вход стоит вдвое меньше стандартного.
Изменения каталога не менее важны, чем история цен. Модели, которые встречаются в старых обзорах, включая маршруты Kimi и DeepSeek, отсутствуют на текущей странице поддерживаемых моделей. В бюджете должны быть дата проверки, ID модели и резервный вариант: скопированную однажды цену нельзя считать постоянной.
Что сделать в понедельник: рассчитать один рабочий процесс и поставить лимит
В понедельник выберите один чётко очерченный рабочий процесс и составьте бюджет, понятный и разработчикам, и финансовой команде. Не начинайте с полной миграции.
Зафиксируйте форму трафика
Выгрузите данные за репрезентативную неделю: число запросов, входные и выходные токены, кэшированные токены, ID моделей, вызовы инструментов, повторные попытки и принятые результаты. Отделите синхронный трафик от задач, которые могут подождать.
Рассчитайте три маршрута
Рассчитайте стоимость On Demand по актуальным ставкам модели, Batch со скидкой 50% для подходящих отложенных задач, а инструменты вынесите в отдельные строки. Не применяйте экономию кэша к Batch и не закладывайте долю попаданий в кэш, которую ещё не подтвердили данные об использовании.
Определите границу платного тарифа
Если лимиты Free прерывают процесс, переведите его на Developer. Установите месячный Spend Limit на 20%–30% выше прогноза, затем добавьте уведомления на 50%, 75% и 90%. Оставьте запас на задержку отчётности от 10 до 15 минут.
Поддерживайте один резервный маршрут
Запустите ту же модель у альтернативного провайдера на небольшой тестовой выборке. Зафиксируйте эндпоинт, наблюдаемую долю принятых результатов и условие переключения, чтобы изменение каталога или ошибка нехватки мощности не обернулись экстренной миграцией.
Итог — отдельная строка бюджета для каждого успешно выполненного процесса: токены модели, инструменты, повторные попытки и ручная проверка. Пересчитывайте её, когда меняются актуальный каталог моделей, лимиты или страница цен.
Частые вопросы
Сколько стоит Groq?
Groq Free стоит $0. У Developer нет базовой подписки, а использование оплачивается по ставкам выбранной модели. Текущие цены текстовых моделей для продакшена начинаются с $0.05 за вход и $0.08 за выход на миллион токенов для Llama 3.1 8B Instant и доходят до $0.59 за вход и $0.79 за выход для Llama 3.3 70B Versatile.
Можно ли пользоваться Groq бесплатно?
Да, в пределах лимитов организации, зависящих от модели. Для GPT-OSS 120B и 20B на Free сейчас указаны 30 RPM, 1,000 RPD, 8,000 TPM и 200,000 TPD. При превышении действующего ограничения сервер возвращает HTTP 429.
Какие модели Groq доступны бесплатно?
Free открывает поддерживаемый каталог в пределах лимитов каждой модели. Для проверки устойчивого рабочего сценария выбирайте модели для продакшена. По правилам Groq, preview-модели предназначены для оценки и могут быть отключены без длительного предупреждения.
Сколько стоит Groq в месяц?
Публичной месячной или годовой подписки для самостоятельного подключения нет. Месячный счёт складывается из входных и выходных токенов, аудио, инструментов и выбранного уровня обслуживания по актуальным ставкам. В расчёте для 100,000 запросов к GPT-OSS 120B синхронная обработка стоит $60 до учёта кэша и инструментов.
Есть ли у Groq скидка для студентов?
На страницах цен и оплаты, проверенных в августе 2026 года, Groq не указывает отдельную скидку для студентов. Студенты и другие пользователи с небольшой нагрузкой могут использовать общий тариф Free за $0 в пределах его ограничений.
Как Groq возвращает деньги?
Общие запросы на возврат платежей Groq рассматривает индивидуально через поддержку. Для Service Credits правила строже: купленные и промокредиты не подлежат возврату или передаче и истекают через один год, если не указан иной срок.
Менялись ли цены Groq?
Да. В феврале 2025 года Batch запустили со скидкой 25% к синхронной цене, а сейчас она составляет 50%. В октябре 2025 года Groq снизила цены GPT-OSS и добавила кэширование для этого семейства. Проверяйте актуальную страницу: каталог и ставки отдельных моделей меняются.
Как цены Groq соотносятся с OpenAI?
OpenAI не предоставляет GPT-OSS через собственный API, поэтому прямое сравнение меняет модель. В нормализованном расчёте для GPT-OSS 120B Groq, Together AI и Fireworks AI стоят одинаково — $27 за 100 миллионов входных и 20 миллионов выходных токенов без скидки за кэш.
Карта ИИ-инструментов для владельцев бизнеса
Карта ИИ-инструментов для владельцев бизнеса превращает цены моделей в план внедрения: каждый инструмент должен оправдать минимальный уровень качества, операционную роль и порог стоимости. Подпишитесь, чтобы бесплатно получить следующий выпуск.
3 сент. 2026 г.







