Самый дешевый API ИИ: цены и сравнение 8 сервисов
Сравниваем цены на API ИИ: от DeepInfra за $0.019/$0.03 до бесплатного Gemini. Выбираем оптимальный сервис для прототипа, продакшена и пакетных задач.

Если нужен дешевый API ИИ, минимальную цену в этом сравнении предлагает DeepInfra: Mistral Nemo стоит $0.019 за миллион входных токенов и $0.03 за миллион выходных. Но для недорогого продакшена надежнее начать с DeepSeek V4 Flash за $0.14/$0.28: модель поддерживает JSON, вызов инструментов и контекстное окно на 1M токенов. Для бесплатного прототипа выигрывает Gemini 2.5 Flash-Lite. Самый дешевый полезный API — тот, который при минимальной цене проходит требования задачи по качеству, конфиденциальности и задержке.
Дешевый API ИИ: краткий вывод
Для большинства текстовых задач в продакшене лучший дешевый API ИИ — DeepSeek V4 Flash. По стандартному тарифу 10 миллионов входных и 2 миллиона выходных токенов обойдутся в $1.96. При этом модель поддерживает вывод в JSON, вызов инструментов, Responses API и контекстное окно на 1M токенов. На практике такое сочетание важнее, чем экономия последних долей доллара.
Победителей здесь три, потому что за словом «дешевый» скрываются три разные задачи:
- DeepInfra дешевле всех по чистой цене токенов. Mistral Nemo стоит $0.019 за миллион входных токенов и $0.03 за миллион выходных.
- Google Gemini — самый дешевый вариант для прототипа. У Gemini 2.5 Flash-Lite есть бесплатный тариф, а платный Standard стоит $0.10 за входные и $0.40 за выходные токены на миллион.
- DeepSeek — самый дешевый функциональный вариант для продакшена. V4 Flash стоит $0.14 за входные и $0.28 за выходные токены на миллион при промахе кеша и дает основные API-возможности, нужные бэкенду приложения.
Все цены ниже сверены с актуальными страницами тарифов или документацией провайдеров 10 августа 2026 года. Если не указано иное, цены приведены за 1 миллион входных/выходных токенов.
Это не рейтинг качества. Модель 3B за $0.10/$0.10 и современная продакшен-модель за $0.14/$0.28 — разные продукты, даже если обе принимают запросы в формате chat completions. По прайсу стоит отбирать кандидатов, а победителя — по собственному приемочному тесту.
Цены на API ИИ: сколько стоят 20,000 запросов
При небольших и средних объемах все перечисленные провайдеры достаточно дешевы: одно неудачное решение в процессе обойдется дороже счета за токены. Тем не менее сравнивать стоит на нормализованной нагрузке — так становятся видны дорогой вывод и комиссии, которые скрывает одна лишь ставка за входные токены.
Предположим, продукт делает 20,000 вызовов в месяц. Каждый запрос содержит 500 входных токенов, а ответ — 100 выходных. Итого 10 миллионов входных и 2 миллиона выходных токенов:
Стоимость в месяц = 10 × цена входа + 2 × цена выхода.

В процентах разброс кажется огромным, в абсолютных долларах — совсем небольшим. На этой нагрузке DeepSeek дороже DeepInfra Mistral Nemo на $1.71, а OpenAI Luna дороже DeepSeek на $2.44. Если более дешевая модель нарушит схему, пропустит запрос клиента или создаст очередь на ручную проверку, экономия исчезнет почти мгновенно.
Здесь и появляется порог качества — минимально допустимое поведение модели, при котором не приходится компенсировать ее ошибки дополнительной работой. У эндпоинта классификации с пятью разрешенными метками этот порог низкий. У ответа клиенту, основанного на данных его аккаунта, — намного выше. Для агента, которому разрешено менять записи, порог еще выше: цена неверного действия не сводится к еще одному вызову API.
Особого внимания заслуживает цена выходных токенов. Суммаризатор может прочитать длинный документ и вернуть короткий результат — тогда основная часть расхода приходится на ввод. Агент для написания кода, генератор коммерческих писем или диалоговый ассистент способны выдавать гораздо больше текста. У OpenAI Luna вывод по $1.20 в шесть раз дороже ввода по $0.20; у Mistral Small 4 вывод по $0.60 в четыре раза дороже ввода по $0.15. Одинаковая цена входа и выхода у крошечных моделей привлекательна для задач с большим объемом генерации, но только если эти модели справляются с работой.
1. DeepSeek: лучший недорогой вариант для продакшена
DeepSeek — сильнейший первый кандидат, когда продакшен-приложению нужна низкая цена токенов без отказа от JSON, инструментов и длинного контекста. V4 Flash 0731 стоит $0.14 за миллион входных токенов при промахе кеша и $0.28 за миллион выходных. Для API заявлены контекст на 1M токенов, максимальный вывод 384K, JSON, вызов инструментов, Responses API и маршрут, совместимый с Anthropic. Среди моделей у нижней границы цен это один из самых полных наборов продакшен-возможностей.

Главное препятствие — предсказуемость бюджета. На собственной странице тарифов DeepSeek сообщает, что в ближайшее время планирует общее повышение цен и ожидает, что оно будет значительным. Стартап может воспользоваться сегодняшней нормализованной стоимостью $1.96, но отделу закупок не стоит переносить эту цифру в годовой прогноз без запаса или второго маршрута.
Лучше всего для: Продакшен-извлечения данных, структурированной генерации, экономичных агентов и задач с длинным контекстом
Главное преимущество: Контекст 1M плюс JSON, вызов инструментов, Responses API и поддержка Anthropic API
Цена: $0.14 за вход, $0.0028 за попадание входных токенов в кеш и $0.28 за выход на 1M токенов для V4 Flash
Бесплатный доступ: Постоянный бесплатный тариф на странице цен не указан
- $1.96 за нормализованную нагрузку с 10M входных и 2M выходных токенов
- Контекст на 1M токенов и вывод до 384K
- JSON и вызов инструментов на бюджетном тарифе
- Опубликованный лимит параллельности 2,500 для V4 Flash
- Провайдер уже предупредил, что цены значительно вырастут
- Постоянный бесплатный тариф не опубликован
- Для дешевого внешнего маршрута все равно нужно проверить конфиденциальность, надежность и региональные требования конкретного покупателя
Почему DeepSeek занимает первое место
DeepSeek выигрывает, когда дешевая модель должна уметь больше, чем присваивать тексту метку. Представим B2B SaaS-продукт, который извлекает из загруженных договоров дату продления, стоимость контракта, срок уведомления и перечисленные риски. Результат можно проверить по схеме, но модели по-прежнему нужны достаточный контекст для длинного документа и точное следование инструкциям, чтобы вернуть все обязательные поля. Для первого теста V4 Flash дает правильный баланс цены и возможностей API.
Ставка при попадании в кеш особенно низкая — $0.0028 за миллион входных токенов. Это важно, когда регулярно повторяются неизменные инструкции или справочный префикс. Но не каждый входной токен стоит $0.0028: тариф действует только на попадания в кеш. Пока статистика использования не подтвердит долю попаданий, планируйте бюджет по $0.14 за промах.
Как протестировать DeepSeek за одну неделю
Выберите одну ограниченную задачу
Начните с извлечения данных, классификации, суммаризации или действия агента только на чтение. Еще до отправки трафика определите поля, допустимые результаты и условия ошибки.
Соберите набор из 100 запросов
Возьмите репрезентативные обезличенные запросы из реальной нагрузки. Добавьте короткие, длинные, неоднозначные, некорректные и пограничные примеры, чтобы самый дешевый маршрут не победил лишь потому, что видел только простые случаи.
Требуйте машиночитаемый результат
Если у задачи есть схема, используйте JSON. Для каждого вызова записывайте долю валидных схем, долю принятых ответов, задержку, входные и выходные токены и попадания в кеш.
Оставьте текущую модель резервной
Направляйте в проверенный текущий маршрут ответы, не прошедшие валидацию, случаи с низкой уверенностью и любые действия с существенными последствиями. Первый запуск должен быть обратимым.
Настройте оповещение об изменении цены
DeepSeek сообщил о будущем повышении цен. Когда провайдер опубликует новый тариф, пересчитайте нормализованную нагрузку и не позволяйте временной цене превратиться в архитектурное допущение.
Выбирайте DeepSeek, если V4 Flash проходит тест задачи, а организация готова к изменению цен. Откажитесь от него, если фиксированная годовая цена за единицу, конкретный регион обработки или сложившиеся отношения с провайдером важнее разницы в стоимости токенов.
2. Google Gemini: лучший бесплатный API ИИ
Google Gemini — лучший бесплатный маршрут для прототипа на обезличенных данных. На тарифе Free у Gemini 2.5 Flash-Lite бесплатны и входные, и выходные токены. После перехода приложения на Paid тариф Standard стоит $0.10 за миллион входных текстовых токенов, токенов изображений или видео и $0.40 за миллион выходных; Batch и Flex снижают обе ставки вдвое, до $0.05/$0.20.

У бесплатного тарифа есть последствие для конфиденциальности, и учитывать его нужно при принятии решения, а не в примечаниях. На странице цен Google сказано, что контент тарифа Free используется для улучшения продуктов компании, а контент Paid — нет. Бесплатный маршрут разумно применять для синтетических промптов, публичных документов и тестового набора разработчика, но не по умолчанию для клиентских записей, конфиденциальных документов или еще не выпущенного кода.
Лучше всего для: Бесплатных прототипов, мультимодального ввода, пакетной обработки и экономичных процессов работы с документами
Главное преимущество: Бесплатные входные/выходные токены плюс платный ввод текста, изображений, видео и аудио
Цена: Тариф Free; Paid Standard — $0.10 за ввод текста/изображений/видео и $0.40 за вывод; Batch/Flex — $0.05/$0.20
Бесплатный доступ: Да, тариф Free с ограниченным набором моделей
- Бесплатные входные и выходные токены на тарифе Free
- $1.80 за нормализованную нагрузку на Paid Standard
- $0.90 за ту же асинхронную нагрузку через Batch или Flex
- Тариф Paid включает кеширование контекста и не использует контент для улучшения продуктов Google
- Контент тарифа Free используется для улучшения продуктов Google
- Бесплатный доступ ограничен по моделям и квоте
- Аудиоввод стоит $0.30 за миллион токенов на Standard — втрое дороже ввода текста, изображений или видео
Как перейти с бесплатного тарифа на платный
Основатель, проверяющий функцию разметки документов, может взять публичные или сгенерированные документы на тарифе Free, проверить формат ответа и изучить расход токенов до подключения биллинга. Когда в процесс попадут документы клиентов, переход на Paid потребуется не только из-за объема. Он меняет условия использования контента, повышает продакшен-лимиты и открывает кеширование контекста и Batch.
На нормализованной нагрузке Paid Standard стоит $1.80, а Batch или Flex — $0.90. Поэтому для асинхронной работы Gemini дешевле DeepSeek по прайсу, хотя правильный выбор все равно зависит от того, какая модель проходит требования задачи. Если мгновенный ответ не нужен, сначала стоит оценить экономию 50%, а уже потом менять провайдера.
Gemini также принимает изображения и видео по той же ставке Standard $0.10 за вход, что и текст для 2.5 Flash-Lite. Поэтому модель интереснее небольших решений только для текста, если процесс читает чеки, скриншоты или изображения товаров. На странице цен Flash-Lite описана как самая компактная и экономичная модель Google для масштабной работы — именно с нее стоит начинать, прежде чем переходить на более крупную Gemini.
Выбирайте Gemini, если проекту нужен бесплатный старт, мультимодальный ввод или асинхронная обработка за половину цены. Не используйте Free для конфиденциальных данных, а Flash-Lite — если приемочный тест показывает, что задаче нужна более крупная модель.
3. DeepInfra: минимальная цена токенов
DeepInfra побеждает по чистой цене: для Mistral Nemo Instruct миллион входных токенов стоит $0.019, а выходных — $0.03. Нормализованная нагрузка из 20,000 запросов обойдется в $0.25. Кроме того, DeepInfra предлагает Meta Llama 3.1 8B за $0.02/$0.04 и DeepSeek V4 Flash за $0.09/$0.18, поэтому разработчик может подниматься по линейке моделей у одного хостинга, не открывая новый платежный аккаунт.

Ограничение кроется в модели, которая стоит за ценой. Mistral Nemo и Llama 3.1 8B дешевы, потому что это небольшие открытые модели прежнего поколения. Для жестко заданной классификации этого может быть достаточно. Но клиентский процесс не должен автоматически наследовать низкую цену, пока собственная проверка не подтвердит приемлемое качество результата.
Лучше всего для: Массовой классификации с низким риском, тегирования, простого извлечения данных и ценовых экспериментов с моделями
Главное преимущество: Самая низкая опубликованная цена токенов для генерации текста в этом сравнении
Цена: Mistral Nemo — $0.019 за вход/$0.03 за выход; Llama 3.1 8B — $0.02/$0.04
Бесплатный доступ: Нет; DeepInfra требует карту или предоплату
- $0.25 за нормализованную нагрузку на Mistral Nemo
- Большой каталог моделей для текста, эмбеддингов, изображений, аудио и видео
- Режимы Standard, Priority и более дешевый Flex
- Автоматическое масштабирование с опубликованным лимитом аккаунта в 200 одновременных запросов
- Минимальная ставка относится к небольшой модели, а не к универсальному решению для продакшена
- Нужна карта или предоплата
- Flex может работать медленнее и иногда быть недоступен
Когда DeepInfra подходит: узкое пространство ответов
Допустим, маркетплейс локальных услуг размечает входящие сообщения значениями quote, reschedule, cancel, billing или other. Пространство ответа здесь узкое: система может отклонить все, что не входит в пять допустимых значений, а неоднозначные случаи направить в резервный маршрут. Именно в такой задаче модель за $0.019/$0.03 заслуживает проверки.
С ассистентом поддержки, который отвечает на вопросы по конкретному аккаунту, ситуация иная. Ему нужно получить правильную запись, соблюсти правила, сохранить нюансы и не дать уверенный, но ошибочный ответ. Экономия $1.71 относительно DeepSeek на нормализованной нагрузке не оправдывает перевод такой задачи на Mistral Nemo без более убедительного приемочного результата.
Уровни сервиса DeepInfra дают еще один рычаг. Standard стоит по базовой ставке 1×. Priority — 1.5× за более быстрое выделение ресурсов в часы пик. Flex — 0.8× в обмен на более медленные ответы и периодическую недоступность. Flex подходит для заполнения пропусков, фонового обогащения данных или ночной очереди с повторными попытками. Не стоит направлять туда интерактивные ответы клиентам лишь ради скидки 20% на счет, который и без того измеряется центами.
Выбирайте DeepInfra, когда узкая задача и строгий валидатор позволяют стабильно экономить на небольшой модели. Не берите самую дешевую строку для свободной генерации, сложных рассуждений и действий, способных изменить данные клиента или бизнеса.
4. Groq: дешево, когда важна задержка
Groq — недорогой выбор для интерактивных задач, где ответ должен ощущаться мгновенным. Продакшен-маршрут Llama 3.1 8B Instant заявлен примерно на уровне 560 токенов в секунду и стоит $0.05 за миллион входных и $0.08 за миллион выходных токенов. Нормализованная нагрузка обходится в $0.66 — всего на $0.41 дороже ценового минимума DeepInfra.

Компромисс касается глубины модели и стабильности каталога. Самый дешевый маршрут использует модель 8B. Groq отдельно помечает готовые к продакшену модели и предупреждает, что предварительные версии могут быть сняты с поддержки без долгого уведомления. Поэтому цена предварительной модели еще не означает обязательство для продакшена.
Лучше всего для: Классификации с низкой задержкой, автодополнения, диалоговых интерфейсов и быстрой первичной маршрутизации
Главное преимущество: Около 560 выходных токенов в секунду на самой дешевой продакшен-модели
Цена: Llama 3.1 8B Instant — $0.05 за вход/$0.08 за выход; GPT OSS 20B — $0.075/$0.30
Бесплатный доступ: В проверенной публичной документации условия пробного доступа не указаны
- $0.66 за нормализованную нагрузку на Llama 3.1 8B
- Около 560 токенов в секунду на Llama 3.1 8B
- Базовый URL, совместимый с OpenAI, и знакомая структура API
- Продакшен-модели четко отделены от предварительных
- Самый дешевый продакшен-вариант — всего лишь модель 8B
- Лимиты частоты для конкретного аккаунта нужно проверять в панели управления
- Доступность предварительных моделей может измениться без долгого уведомления
Задержка тоже входит в стоимость продукта
Голосовой продукт или чат в реальном времени расплачивается за задержку прерванными диалогами и неестественным общением, даже если счет за API остается низким. Groq заслуживает внимания, когда модель достаточно хороша, а ограничением становится скорость. Короткий классификатор намерения, который выбирает нужный процесс для сообщения, подходит сюда лучше, чем ответ поддержки со множеством правил.
Для Llama 3.1 8B на странице модели указано контекстное окно 131,072 токена, но емкость контекста не равна качеству работы с ним. Способность принять длинный промпт не гарантирует, что модель правильно использует каждую важную деталь. Первая задача для Groq должна быть короткой, ограниченной и пригодной для машинной проверки.
Маршрут GPT OSS 20B в Groq дает более крупную модель примерно с 1,000 токенов в секунду по цене $0.075/$0.30. Его нормализованная стоимость — $1.35, что все еще ниже $1.96 у DeepSeek, но выбирать нужно по тому же тестовому набору. Более низкая цена ничего не доказывает о качестве выполнения инструкций, работе инструментов или пригодности для бизнеса.
Выбирайте Groq, когда пользователь видит время ответа, а небольшая продакшен-модель проходит тест задачи. Откажитесь от него, если нужны рассуждения высокого уровня или процесс зависит от предварительной модели без стабильного продакшен-статуса.
5. Mistral: самый дешевый прямой доступ к линейке небольших моделей
Mistral предлагает наиболее понятную линейку небольших моделей напрямую от разработчика. Ministral 3B начинается с $0.10 за входные и $0.10 за выходные токены на миллион, модель 8B стоит $0.15/$0.15, а 14B — $0.20/$0.20. Mistral Small 4 обходится в $0.15/$0.60 и дает более широкий набор возможностей для текста, агентов и мультимодальных задач.

Дешевую строку 3B не стоит считать рекомендацией по умолчанию для свободного общения с клиентами. Она уместна там, где крошечная модель дает преимущество: в классификации, предварительной маршрутизации модерации или ограниченном преобразовании полей. Для приложения общего назначения убедительнее выглядит Mistral Small 4; нормализованная нагрузка на ней стоит $2.70.
Лучше всего для: Прямого доступа к небольшим моделям, работы непосредственно с разработчиком, пакетных преобразований и повторяющихся кешируемых промптов
Главное преимущество: Одинаковая стартовая цена $0.10/$0.10, скидка 50% для Batch и 90% на кешированные входные токены
Цена: Ministral 3B — $0.10/$0.10; Mistral Small 4 — $0.15/$0.60
Бесплатный доступ: Для основных текстовых моделей общего бесплатного продакшен-тарифа нет; бесплатны несколько эндпоинтов Labs или модерации
- Простые прямые тарифы провайдера для уровней 3B, 8B, 14B и Small
- Скидка 50% на пакетную обработку больших объемов асинхронных задач
- Скидка 90% на кешированный ввод для повторяющихся стабильных префиксов
- Mistral Small 4 поддерживает текстовые, агентские и мультимодальные сценарии
- Заголовочная цена $0.10/$0.10 относится к модели 3B
- У Mistral Small 4 вывод в четыре раза дороже ввода
- Для основных текстовых моделей не указан широкий бесплатный продакшен-тариф
Когда линейка Mistral окупается
Представим, что интернет-магазин каждую ночь генерирует теги каталога из названий, атрибутов и описаний. Результат нужен асинхронно, каждый товар обрабатывается по стабильной схеме, а человек может выборочно проверить ошибки до следующей публикации каталога. Такой процесс можно запустить на Ministral 3B или 8B, получить скидку 50% через Batch и вынести неизменные инструкции таксономии в кешируемый префикс.
Для чат-ассистента экономика меняется. На нормализованной нагрузке Ministral 3B стоит $1.20, а Mistral Small 4 — $2.70. Разница $1.50 дает более крупную модель с более широким позиционированием. Если Small 4 сокращает число переключений на резерв и ручных проверок, вся система может оказаться дешевле, несмотря на более высокую строку токенов.
Выбирайте Mistral, когда важны прямые отношения с лабораторией моделей или линейка небольших моделей. Не ориентируйтесь на цену 3B в заголовке для свободной задачи, пока тест не докажет, что модель остается выше порога качества.
6. SiliconFlow: новый недорогой хостинг разных моделей
SiliconFlow — самый дешевый хостинг нескольких моделей в этом списке, если требуется что-то крупнее 8B. GPT OSS 20B стоит $0.04 за миллион входных и $0.18 за миллион выходных токенов при контекстном окне 131K. Нормализованная нагрузка обходится в $0.76, а новые аккаунты получают кредит $1.

Важно не упустить название модели. GPT OSS 20B — открытая модель 20B, а не прямой доступ к семейству OpenAI GPT-5.6. В SiliconFlow также есть DeepSeek V4 Flash за $0.13 при обычном вводе, $0.028 при кешированном и $0.28 за вывод. Поэтому перейти на более сильную модель можно в том же каталоге, не меняя аккаунт.
Лучше всего для: Экономных разработчиков, которым нужны несколько открытых моделей в одном аккаунте провайдера
Главное преимущество: GPT OSS 20B за $0.04/$0.18 и стартовый кредит $1
Цена: GPT OSS 20B — $0.04 за вход/$0.18 за выход; DeepSeek V4 Flash — $0.13/$0.28
Бесплатный доступ: Кредит $1 без минимальных обязательств
- $0.76 за нормализованную нагрузку на GPT OSS 20B
- По прайсу кредита $1 хватает более чем на одну такую нормализованную тестовую нагрузку
- На публичной странице цен нет минимальных обязательств
- Недорогие маршруты к DeepSeek, Qwen, MiniMax, GPT OSS и другим открытым моделям
- Минимальные цены относятся к моделям с открытыми весами, а не к закрытым передовым API
- Ответственность за оценку качества выбранной модели все равно лежит на покупателе
- Для нового хостинга разных моделей может понадобиться дополнительная проверка закупок и надежности
Что можно проверить на бюджете $1
Стартовый кредит SiliconFlow необычно конкретен. Нормализованная нагрузка на GPT OSS 20B стоит $0.76, поэтому кредита $1 хватает на один полный прогон по расчетной цене без учета повторов и других моделей. Это не бесплатный месяц продакшена. Зато разработчик может измерить формат результата, задержку и учет токенов, не пополняя заранее крупный баланс.
Для внутренней очереди суммаризации начните с GPT OSS 20B, а неудачные случаи и ответы с низкой уверенностью отправляйте в DeepSeek V4 Flash на той же платформе. Лестница цен прозрачна: $0.04/$0.18 у дешевого маршрута, затем $0.13/$0.28 у DeepSeek. Приложение все равно должно записывать, какая модель дала ответ: смешанный счет без приемочной статистики по каждой модели не покажет, приносит ли пользу дешевый уровень.
Выбирайте SiliconFlow, если один недорогой хостинг и широкий каталог открытых моделей упрощают оценку. Откажитесь от него, если покупателю нужен прямой договор с разработчиком модели или уже используется шлюз, который дает те же модели по приемлемой полной цене.
7. OpenRouter: самый дешевый способ свободно менять модели
OpenRouter — лучший бюджетный шлюз, когда простое переключение моделей оправдывает небольшую комиссию. Он передает цены провайдеров на инференс без наценки, предлагает бесплатные варианты моделей и объединяет множество провайдеров за одним API-ключом. DeepSeek V4 Flash Latest указан по $0.08 за вход и $0.252 за выход на миллион токенов, поэтому сама модель на нормализованной нагрузке стоит $1.304 до комиссии за покупку кредитов.

Ограничение связано с пополнением кредитов. При их покупке OpenRouter берет 5.5%, но не меньше $0.80. Минимальная комиссия перестает влиять примерно на уровне $14.55, потому что $0.80, деленные на 5.5%, дают $14.5455. Поэтому при покупке кредитов на $10 комиссия составит $0.80, то есть 8%, а не 5.5%.
Лучше всего для: Сравнения моделей, поддержки резервных маршрутов и смены провайдеров без переписывания приложения
Главное преимущество: Цены провайдеров передаются без наценки на инференс
Цена: Бесплатные варианты за $0; платные модели стоят по-разному; DeepSeek V4 Flash Latest — $0.08/$0.252 до комиссии за кредиты
Бесплатный доступ: Небольшой лимит для новых пользователей и бесплатные варианты моделей с низкими суточными ограничениями
- Один API-ключ для множества провайдеров и моделей
- Нет наценки на базовую цену инференса
- Бесплатные варианты для оценки
- Первые 1M BYOK-запросов ежемесячно бесплатны
- Покупка кредитов облагается комиссией 5.5% с минимумом $0.80
- Для бесплатных вариантов доступно лишь 50 запросов в день до покупки кредитов на $10 за все время, после нее — 1,000 в день
- Неиспользованные платные кредиты сгорают через один год
- В план надежности нужно включить отказы и шлюза, и вышестоящего провайдера
Когда комиссия шлюза окупается
При тестировании DeepSeek, Gemini и открытой модели разработчик может потратить на отдельную авторизацию, биллинг, поведение повторных попыток и форматы ответов больше инженерного времени, чем на сам инференс. OpenRouter сводит переключение к настройке маршрута. Комиссия оправданна, если такое удобство позволяет держать резерв наготове или быстро заменить слабую модель.
Небольшие пополнения искажают экономику. Для $10 минимальная комиссия $0.80 равна 8%. Для $100 ставка 5.5% дает $5.50 и уже соответствует заявленному проценту. Небольшому прототипу остается либо принять минимум как плату за удобство, либо воспользоваться прямым бесплатным тарифом провайдера. Нельзя сравнивать ставку модели в OpenRouter с прямым тарифом и забывать о комиссии за кредиты.
У маршрута BYOK другое правило. Первые 1M запросов в месяц с собственными ключами провайдеров бесплатны, затем OpenRouter берет 5% от суммы, которую этот маршрут модели и провайдера стоил бы в OpenRouter. BYOK позволяет сохранить прямые лимиты провайдера и централизовать маршрутизацию, но следить по-прежнему придется за двумя поверхностями биллинга и отказов.
Выбирайте OpenRouter, если единая интеграция и быстрое переключение оправдывают комиссию. Откажитесь от него, когда продукт работает с одним стабильным провайдером, прямой API уже отвечает требованиям доступности, а дополнительный шлюз не дает операционной пользы.
8. OpenAI: самый дешевый путь без рискованной миграции
OpenAI не выигрывает по цене токенов, но GPT-5.6 Luna может стать самым дешевым маршрутом с низким риском для продукта, уже построенного на OpenAI. В Standard Luna стоит $0.20 за миллион входных токенов в коротком контексте, $0.02 за кешированный ввод и $1.20 за вывод. Batch и Flex снижают ставки ввода/вывода вдвое, до $0.10/$0.60, а нормализованную стоимость — с $4.40 до $2.20.

У миграции есть цена, даже если она никогда не появляется в счете API. Существующие схемы, промпты, правила модерации, инструменты, трассировка, поведение резерва и тесты нагрузки могут сделать месячную разницу $2.44 несущественной. Если текущий маршрут OpenAI проходит проверки продукта, сначала следует протестировать Luna, кеширование и Batch/Flex, а не менять провайдера.
Лучше всего для: Существующих продуктов на OpenAI, привычных инструментов разработчика, стабильных кешируемых промптов и асинхронных пакетных задач
Главное преимущество: GPT-5.6 Luna сочетает актуальную недорогую модель OpenAI со скидкой 50% в Batch/Flex
Цена: Standard — $0.20 за вход/$0.02 за кешированный вход/$1.20 за выход; Batch/Flex — $0.10/$0.01/$0.60
Бесплатный доступ: Постоянный бесплатный тариф API не указан
- $2.20 за нормализованную нагрузку через Batch или Flex
- Кешированный ввод стоит в десять раз дешевле стандартного
- Существующие приложения OpenAI могут проверить более дешевую модель без миграции к другому провайдеру
- Отдельно и понятно указаны ставки Standard, Batch, Flex и длинного контекста
- В Standard вывод в шесть раз дороже ввода
- Нормализованная стоимость Standard — $4.40, самая высокая среди отобранных маршрутов
- Для подходящей региональной обработки действует надбавка 10%
- В длинном контексте Luna применяются более высокие ставки $0.40 за вход и $1.80 за выход
Сначала оптимизируйте OpenAI, потом мигрируйте
В разборе маршрутизации GPT-5.6 подробнее объясняется, когда подходят Luna, Terra и Sol. Для этой ценовой задачи первый шаг проще: короткую повторяемую работу перевести на Luna, стабильные префиксы кешировать, несрочные задачи отправлять через Batch или Flex, а более сильную текущую модель сохранить резервной.
При 10 миллионах входных и 2 миллионах выходных токенов Luna Standard стоит $4.40, Batch или Flex — $2.20, а DeepSeek V4 Flash — $1.96. Разница между оптимизированным OpenAI и прямым DeepSeek на нормализованной нагрузке равна $0.24. Сама по себе она слишком мала, чтобы оправдать миграцию между провайдерами.
Длинный контекст и региональные настройки могут изменить результат. Стандартные ставки Luna для длинного контекста составляют $0.40 за вход и $1.80 за выход, а подходящая региональная обработка добавляет 10%. Используйте тариф, соответствующий типу запроса и выбранной обработке, а не применяйте ставку короткого контекста ко всем токенам.
Выбирайте OpenAI, если продукт уже надежно там работает, важны прямые отношения с массовым провайдером или Batch/Flex устраняют большую часть ценового разрыва. Не используйте Standard для несрочных офлайн-задач с возможностью повтора, которые подходят для тарифов за половину цены.
Как выбрать API нейросетей для каждой задачи
Сначала выбирайте маршрут по цене последствий, а затем ищите самую дешевую модель, которая ее выдерживает. Это правило предотвращает большинство случаев ложной экономии.

Для бесплатного прототипа на обезличенных данных выбирайте Gemini 2.5 Flash-Lite. Это самый простой старт без расходов и понятный переход на Paid Standard за $0.10/$0.40. Не отправляйте клиентские и конфиденциальные данные в Free: условия использования контента отличаются от Paid.
Для продакшена с низким риском начните с DeepSeek V4 Flash. JSON, вызов инструментов, контекст 1M и нормализованная стоимость $1.96 делают его лучшим кандидатом в целом. Заложите запас на изменение цены и резервный маршрут, поскольку провайдер сообщил о предстоящем повышении.
Для узкого массового классификатора сначала проверьте DeepInfra. Нормализованная стоимость $0.25 важна только там, где допустимые ответы ограничены, а ошибки легко обнаружить. Как только задача становится свободной, сразу поднимайтесь на следующую ступень.
Если пользователю заметна задержка, проверьте Groq. Маршрут Llama 3.1 8B со скоростью 560 токенов в секунду способен сделать интерфейс отзывчивым при цене $0.05/$0.08. Используйте его как быстрый канал с более глубокой резервной моделью, а не как автоматическую замену каждой модели.
Для офлайн-очередей сравните Gemini Batch/Flex, Mistral Batch и OpenAI Batch/Flex. Каждый из них документирует снижение цены на 50%. Лучшим будет провайдер, чья модель проходит приемку очереди, а не тот, у кого ниже стандартная ставка без скидки.
Для простого переключения выбирайте OpenRouter. Его комиссия может быть дешевле поддержки нескольких интеграций, особенно если продукту нужны резервирование и частая смена моделей. Для одного стабильного провайдера прямой биллинг проще.
В существующем приложении OpenAI сначала попробуйте Luna. Batch/Flex снижает нормализованную стоимость до $2.20 — лишь на $0.24 выше DeepSeek. Накопленные тесты и отлаженные операции OpenAI легко могут стоить больше этой разницы.
Решение меняется, когда дешевый маршрут опускается ниже приемочного порога задачи. Оставляйте более дешевую модель, пока валидность схем, качество принятых ответов, задержка, условия конфиденциальности и восстановление после сбоев отвечают требованиям. Поднимайтесь на ступень выше, когда нарушается хотя бы одно условие. Не пытайтесь бесконечно латать промптами слабую модель ради экономии центов.
Разработчику клиентского продукта на базе API также придется отвечать за авторизацию, биллинг, проверку и обработку сбоев. Руководство по созданию API на v0 показывает, почему базовая модель или агент — только один слой продукта.
Как отбирались эти API
Рейтинг оценивает самое дешевое надежное решение о покупке, а не одну минимальную ставку за ввод. Цены и характеристики каждого провайдера сверялись с его актуальными официальными страницами 10 августа 2026 года. Мы не оформляли подписку на эти API и не выдаем анализ за опыт их эксплуатации в продакшене.
При отборе использовались следующие критерии:
- Полезная стартовая цена: ставки входа и выхода для конкретной модели, которая сейчас указана в каталоге
- Порог качества: правдоподобная пригодность уровня модели для ограниченной задачи или более широкого продакшен-процесса
- Операционные возможности: JSON, инструменты, контекст, пакетная обработка, кеширование, лимиты запросов и особенности резервирования
- Последствия для конфиденциальности и договора: как обрабатываются бесплатные данные, насколько стабильна цена и есть ли отдельная комиссия шлюза
- Стоимость переключения: работа по переносу промптов, схем, тестовых наборов, мониторинга и биллинга
В список вошли восемь провайдеров, потому что каждый отвечает на отдельный вопрос покупателя. Провайдер исключался, если его самый дешевый продакшен-маршрут для текста заметно выходил за этот ценовой диапазон, цену нельзя было нормализовать на токен или его роль повторяла другой вариант без более явного преимущества. Специализированные API для изображений, видео, речи и эмбеддингов тоже исключены: их единицы измерения нельзя напрямую сопоставить с входными и выходными текстовыми токенами.
Расчет стоимости — оригинальный анализ на одной явно заданной нагрузке, а не бенчмарк. Стоимость принятого результата можно определить только на собственных репрезентативных запросах, валидаторах и процессе проверки.
Какие варианты лучше не использовать
Бесплатные модели OpenRouter как зависимость продакшена
Не делайте бесплатный вариант OpenRouter единственным маршрутом для живого клиентского трафика. Аккаунту доступно 50 запросов к бесплатным моделям в день, пока за все время не куплено кредитов хотя бы на $10; после этого — 1,000 в день. Это лимит для оценки, а не надежный план мощности.
Gemini Free с клиентскими или конфиденциальными данными
Не отправляйте чувствительный контент через Gemini Free. Google сообщает, что контент бесплатного тарифа используется для улучшения продуктов компании, а контент Paid — нет. Нормализованная нагрузка на Paid Standard стоит $1.80, поэтому ради такой суммы неразумно пересекать границу конфиденциальности.
DeepInfra Mistral Nemo для свободной работы с клиентами
Не переносите маршрут за $0.019/$0.03 напрямую в свободную поддержку, юридическое толкование или автономные действия. Такая ставка относится к небольшой модели. Используйте ее в ограниченной проверяемой задаче и держите более сильный резерв, пока приемочные данные не подтвердят возможность расширить область применения.
DeepSeek без резерва на изменение цены
Не считайте $0.14/$0.28 фиксированной годовой ставкой. DeepSeek предупреждает о значительном предстоящем повышении. Модель все равно может быть лучшим вариантом сейчас, но и бюджету, и архитектуре нужен второй маршрут.
OpenAI Standard для офлайн-задач с повторными попытками
Не платите за Luna по ставке Standard $0.20/$1.20, если задача может подождать. Batch и Flex стоят $0.10/$0.60 и снижают нормализованную стоимость с $4.40 до $2.20 без смены провайдера.
Что сделать в понедельник
На следующей неделе перенесите один ограниченный класс задач, а не все приложение. Теста на 100 запросах хватит, чтобы до запуска продакшен-трафика обнаружить очевидные сбои схемы, задержки и маршрутизации, но постоянный мониторинг он не заменяет.
Отберите 100 репрезентативных запросов
Выберите одну задачу и соберите обычные, сложные, неоднозначные и некорректные примеры. Перед использованием любого бесплатного тарифа удалите персональные, конфиденциальные и клиентские данные.
Запустите три маршрута
Сравните текущего провайдера, DeepSeek V4 Flash и Gemini 2.5 Flash-Lite. Добавляйте DeepInfra или Groq, только если явная цель — минимальная цена или задержка.
Оцените четыре результата
Записывайте долю валидных схем, долю принятых ответов, сквозную задержку и точную стоимость входных/выходных токенов. Время ручной проверки учитывайте как отдельную операционную метрику.
Перенесите один выигравший класс
Отправляйте дешевому провайдеру только ограниченную задачу, прошедшую тест. Старый маршрут сохраните для неудачной валидации, неоднозначного ввода и действий с более серьезными последствиями.
Пересчитывайте цены после каждого изменения провайдера
Сохраните формулу и допущения нагрузки. Пересчитывайте их, когда DeepSeek повысит цены, модель снимут с поддержки или изменятся лимиты бесплатного тарифа и шлюза.
Так список ставок превращается в обратимое бюджетное решение. Заодно появляется показатель, которого нет ни в одном публичном прайсе: ваша стоимость одного принятого результата.
Частые вопросы
У какого ИИ самый дешевый API?
Самая низкая цена генерации текста в этом сравнении у DeepInfra: Mistral Nemo стоит $0.019 за миллион входных и $0.03 за миллион выходных токенов. Если для продакшена нужны JSON, инструменты и длинный контекст, более удачным дешевым вариантом будет DeepSeek V4 Flash.
Есть ли бесплатный API ИИ?
Да. Google Gemini бесплатно предоставляет входные и выходные токены на тарифе Free, а OpenRouter предлагает бесплатные варианты моделей. Контент Gemini Free может использоваться для улучшения продуктов Google; бесплатные модели OpenRouter ограничены 50 запросами в день или 1,000 после покупки кредитов минимум на $10 за все время.
Сколько стоит API ИИ?
При 20,000 ежемесячных вызовов с суммарными 10M входных и 2M выходных токенов отобранные маршруты стоят от $0.25 на DeepInfra Mistral Nemo до $4.40 на OpenAI GPT-5.6 Luna Standard. Итоговый счет меняют Batch, Flex, кеширование, комиссии шлюза, повторы и выбор модели, которая проходит порог качества.
Сколько стоит API ChatGPT?
Подписка на ChatGPT и оплата OpenAI API существуют отдельно. В этом сравнении бюджетная модель OpenAI — GPT-5.6 Luna: $0.20 за вход и $1.20 за выход на миллион токенов в коротком контексте Standard или $0.10/$0.60 через Batch либо Flex.
Скачайте чек-лист аудита бизнес-процессов с ИИ, чтобы за одну неделю превратить эту лестницу цен в проверку провайдеров.
3 сент. 2026 г.







