Стоимость ИИ: Opus 4.7 прибавил 27%, GPT-5.5 подорожал вдвое — а контур выдержал

За одну неделю три поставщика повысили реальную стоимость ИИ. Разбираю, как кэш, маршрутизация моделей и жёсткие лимиты удержали бюджет под контролем.

Saturday, September 5, 2026Omid Saffari
Стоимость ИИ: Opus 4.7 прибавил 27%, GPT-5.5 подорожал вдвое — а контур выдержал

Примерно 14 мая Anthropic выпустила Opus 4.7, не изменив прайс — $5/M за входные и $25/M за выходные токены, как у 4.6. Но новый токенизатор выдаёт на одном и том же тексте на 32–45% больше нативных токенов. Фактически стоимость ИИ в продакшене выросла на 12–27%, хотя на странице тарифов это никак не отразилось. В ту же неделю OpenAI открыто подняла цену GPT-5.5 вдвое. Расходы моих шести процессов почти не изменились — благодаря архитектуре, а не везению.

Три поставщика, три механизма — стоимость ИИ растёт в одном направлении

За одну неделю три поставщика тремя разными способами увеличили реальную стоимость ИИ. На страницах с тарифами заметен ровно один из них.

OpenAI действовала открыто. Входные токены GPT-5.5 подорожали с $2.50 до $5.00 за миллион, выходные — с $15 до $30 за миллион: ровно 2x в обоих случаях. OpenRouter изучил группу пользователей, которые на тех же задачах перешли с 5.4 на 5.5, и зафиксировал рост реальных расходов на +49–92% в зависимости от распределения длины промптов. Это честный вариант повышения цены: цифра изменилась, её можно обсуждать с закупками, а нагрузку — перенаправить.

Anthropic сделала это незаметно. Прайс Opus 4.7 полностью совпадает с 4.6 — на странице тарифов не изменился ни один пиксель. Изменился токенизатор. На том же входном тексте новая модель выдаёт на 32–45% больше нативных токенов. Anthropic указала диапазон инфляции 1.0–1.35x, а OpenRouter измерил ~45% на запросах короче 2K токенов и ~32–34% в продакшене при объёме свыше 10K. Итоговый рост реальной стоимости: +12–27% для всего, что длиннее 2K, и небольшое снижение ниже этого порога. Ни анонса, на который можно отреагировать, ни волны оттока, ни повода для закупок пересмотреть условия — просто следующий месячный счёт окажется выше.

GitHub изменила сам принцип расчёта. С 1 июня единицы premium requests в Copilot превращаются в AI Credits с учётом токенов по опубликованным API-тарифам, включая кэшированные токены. Стоимость базовых планов остаётся прежней. Сильнее всего это ударит по пользователям агентных функций на годовых планах — тем, кто запускает длинные циклы рефакторинга с большим контекстом, где множители моделей накладываются друг на друга.

Дело не в том, кого из поставщиков назначить виноватым. Главное — страница тарифов больше не позволяет предсказать итоговый счёт. Прайс по-прежнему нужен, но его уже недостаточно: модель расходов, которая не измеряет собственный объём нативных токенов, оторвана от реальности.

Почему изменение токенизатора опаснее всего

Из трёх механизмов, проявившихся на этой неделе, именно шаг Anthropic незаметно меняет сам подход к оценке расходов на ИИ.

Сама цифра уже хорошо подтверждена. Анализ пользователей, перешедших на новую модель, от OpenRouter показал на реальном продакшен-трафике на 32–45% больше нативных токенов. Simon Willison прогнал те же промпты напрямую через токенизатор Anthropic и получил инфляцию ~1.46x на системных промптах. В собственном описании релиза 4.7 Anthropic указывает диапазон 1.0–1.35x. Три независимых измерения показывают одно и то же. Это не артефакт выборки и не особенность бенчмарка.

Операционный риск создаёт сам способ доставки изменений. Явное повышение цены — событие в календаре: юристы изучают договор, финансисты пересчитывают прогноз, инженеры тестируют альтернативу. Смена токенизатора — ретроактивное подорожание всего, что уже работает в продакшене. Каждый промпт в кодовой базе, каждое системное сообщение, настроенное за последние шесть месяцев, каждый кэшированный блок контекста — всё это стало на 32–45% тяжелее в ту секунду, когда клиент обратился к эндпоинту новой модели. В счёте нет отдельной строки, которую можно показать финансовому директору. Итоговая сумма просто выросла.

Для поставщика это гораздо удобнее объявленного повышения. Нет волны оттока. Нет риска проиграть на странице сравнения с конкурентами. Нет цикла заголовков «Anthropic подняла цены на 27%». Снаружи это выглядит как обновление модели — и действительно им является. Просто экономика продукта незаметно меняется вместе с ним.

Для оператора меняется главный рычаг. Торговаться о цене по прайсу и раньше было не лучшим вложением времени. Теперь это и вовсе бессмысленно: реальная цена больше не живёт в тарифной таблице.

Архитектурный контур, который принял удар

Шесть издательских процессов у меня проходят через одну точку контроля: подготовка брифа, черновик, редактура с учётом авторского голоса, фактчекинг, постановка задачи для изображений и финальная проверка качества. В день обновления два из них обратились к Opus. Жёсткий лимит $20/day не был превышен. Ограничение $1 на один запуск тоже выдержало. Стоимость одной статьи изменилась лишь на однозначное число процентов.

Это не случайность. Четыре защитных механизма появились ещё до новостей этой недели: я уже разбирал переход Agent SDK на отдельный учёт и повышение недельных лимитов Claude Code, после чего пришёл к выводу: волатильность расходов со стороны поставщиков стала правилом, а не исключением. Механизмы разные, контур один.

Рычаг 1 — стабильный кэшированный префикс. Каждый процесс начинает работу с контракта в Markdown (~3500 токенов) и блока требований к голосу категории (~1500 токенов), объединённых в эфемерный кэшированный префикс на 1 час. Благодаря скидке 90% на кэшированные токены инфляция токенизатора почти целиком приходится на небольшой динамический хвост. По расчётам OpenRouter, кэш поглощает 9% дополнительных токенов при длине промпта 10–25K, 77% при 50–128K и 93% свыше 128K. Мой процесс подготовки черновика работает примерно на ~14K, поэтому кэш принимает около 9% инфляции. Однако стабильный кэшированный фрагмент составляет 5K из 14K и без этого решения дорожал бы полностью. На этот архитектурный выбор приходится 70% результата.

Рычаг 2 — маршрутизация моделей. Черновик готовит Sonnet. Синтез брифа и категоризацию выполняет Haiku. Opus подключается только для редких проходов с глубоким исследованием. Изменение цены у одного поставщика не может потянуть за собой весь счёт, потому что флагманская модель не используется по умолчанию. Маршрутизатор заодно сохраняет свободу манёвра: когда GPT-5.5 подорожал вдвое, любой из процессов можно было перевести к конкуренту без переписывания всего контура.

Рычаг 3 — дисциплина длины промптов. Диапазон 2K–10K сильнее всего пострадал у Opus 4.7: по данным пользователей, сменивших модель, реальная стоимость выросла на +27–69%. Именно здесь обычно скапливаются последствия небрежной работы с промптами: раздутые few-shot-примеры, повторяющиеся определения ролей, устаревший контекст, который никто не удалил. Сжатие ненужного контекста теперь не просто гигиена, а прямая экономическая выгода.

Рычаг 4 — единая точка контроля расходов. Каждый платный вызов модели проходит через одну функцию. Проверка до запуска: остаются ли расходы за сегодня ниже $20? Проверка после: стоил ли этот запуск меньше $1? Если хотя бы одно условие не выполнено, процесс останавливается и присылает мне уведомление. Даже если поставщик за ночь удвоит число токенов, стоимость одной статьи изменится на однозначное число процентов, а не на 27%, потому что последней линией защиты служит лимит. Он не делает модель дешевле, зато ограничивает худший сценарий.

И честно о главном: вся конструкция держится прежде всего на кэшированном префиксе. Остальные три механизма — страховка. Если бы промпт для каждого запроса собирался с нуля, как до сих пор происходит в большинстве команд, все 32–45% легли бы на счёт целиком. Причём заметил бы я это на второй неделе, а не в момент изменения.

Что нужно сделать на этой неделе

Если вы используете Opus 4.7, перестаньте смотреть на страницу тарифов и начните анализировать собственный расход токенов. Возьмите выборку из 100 продакшен-вызовов, прогоните их через эндпоинт подсчёта токенов Anthropic для 4.6 и 4.7 и измерьте разницу именно на своих промптах. Затем уже на этой неделе выделите стабильный кэшируемый префикс — не в следующем спринте и не в следующем цикле планирования. Кэш — единственный рычаг, эффективность которого растёт вместе с длиной промпта, а сильнее всего инфляция проявляется как раз на длинном контексте.

Если вы переходите на GPT-5.5, сначала посчитайте экономику на группе пользователей, переключившихся с 5.4. Удвоение тарифа частично компенсируется сокращением длины ответов на –19 до –34% при контексте свыше 10K токенов, поэтому реальная стоимость полностью зависит от соотношения выходных и входных токенов. Для рефакторинга с длинным контекстом итог может оказаться примерно тем же. Для чат-продукта — нет.

Если вы работаете с Copilot, до 1 июня запросите предварительную статистику потребления, которая станет доступна в начале мая. Пользователи базовых планов, отправляющие одиночные промпты, изменений не заметят.

Если смотреть шире, ИИ стал самой волатильной статьёй технологического бюджета. AWS не удваивает цену за ночь. Объём CDN-трафика не начинает незаметно считаться с коэффициентом 1.4x. Postgres не заменяет токенизатор. ИИ-слой проделал всё это за одну неделю. Для команд, которым важны расходы, такой контур — структура кэша, маршрутизатор моделей, дисциплина длины и жёсткий лимит — уже не опциональная архитектура. Это цена эксплуатации подобной инфраструктуры в продакшене.

Поставщики продолжат менять правила. Постройте единую точку контроля — иначе следующие двенадцать месяцев придётся принимать на себя последствия каждого их решения.

Последнее обновление

5 сент. 2026 г.

КатегорияAI

Сделать этот сайт предпочтительным в Google

Добавить omidsaffari.com как предпочтительный источник в Google Поиске

Отметьте omidsaffari.com как предпочтительный источник — и Google будет поднимать его для вас в Top Stories, AI Overviews и AI Mode.

Рассылка

Одно письмо, каждое воскресенье. Работающие системы, а не горячие мнения.

Билд-логи, системы в продакшене и полевые заметки из портфеля ИИ-проектов.

Еженедельно. Без спама. Отписка в любой момент.