Обзор Kimi K3: уровень флагманов за полцены API, но весов пока нет

Обзор Kimi K3 с ценами API, независимыми тестами и ограничениями для продакшена. Разбираем, когда модель выгоднее GPT-5.6 Sol и Claude Fable 5.

Thursday, September 3, 2026Omid Saffari
Обзор Kimi K3: уровень флагманов за полцены API, но весов пока нет

Этот обзор Kimi K3 показывает: модель стоит испытать в длительных задачах программирования с кэшированием контекста, но делать её стандартом пока рано. API обходится в $3 за миллион некэшированных входных токенов и $15 за миллион выходных — примерно вдвое дешевле смешанной стоимости токенов у GPT-5.6 Sol. При этом обещанные веса и технический отчёт ещё не опубликованы, а сама Kimi предупреждает о нестабильности при переключении сессий, излишне инициативных действиях и отставании в пользовательском опыте.

Kimi K3 вышла 16 июля 2026 года как флагман Moonshot AI для программирования, агентов и полного цикла интеллектуальной работы. Модель уже доступна через Kimi.com, Kimi Work, Kimi Code и API kimi-k3.

Страница запуска Kimi K3 с характеристиками модели и результатами тестов
Kimi K3

Запуск важен тем, что K3 включается в борьбу флагманских моделей по соотношению цены и возможностей, не заявляя превосходство во всём. Kimi прямо признаёт, что в целом модель пока уступает Claude Fable 5 и GPT-5.6 Sol. Такая откровенность делает более узкое преимущество убедительнее: K3 предлагает серьёзные возможности для длительных задач при заметно более низкой цене API.

Обзор Kimi K3: вердикт в одной таблице

Kimi K3 заслуживает контролируемого испытания в продакшене, но не перехода на неё как на основную модель. Она достаточно доступна, чтобы проверить её на реальной работе, и достаточно сильна, чтобы выиграть на отдельных маршрутах. Однако ограничения на момент запуска делают полный переход преждевременным.

МодельЛучше всего подходит дляЦена API за 1M, вход / выходКэшированный входТекущее подтверждениеГлавное ограничение
Kimi K3Программирование с большим кэшированным контекстом, работа с репозиториями, экономичные испытания агентов$3 / $15$0.3057 в Artificial Analysis Intelligence Index, #4 из 189Веса и технический отчёт не опубликованы; доступен только максимальный уровень усилий
GPT-5.6 SolЗрелая работа с инструментами, сложные решения, широкий спектр продакшен-маршрутов$5 / $30$0.50Флагманская модель с контекстом 1,050,000 токенов и зрелым набором инструментовБолее высокая цена выходных токенов
Claude Fable 5Длительная работа, где автономность и качество решений оправдывают доплату$10 / $50$1 после скидки 90% за кэшированиеСамая мощная общедоступная модель AnthropicСамая высокая цена; некоторые чувствительные запросы перенаправляются на Opus 4.8

Правило выбора простое: испытывайте K3, если стоимость ограничивает маршрут агента с большим контекстом; оставляйте Sol или Fable там, где ошибка обойдётся дороже экономии на токенах. Если требуется самостоятельное размещение, дождитесь самих весов и лицензии.

Что представляет собой Kimi K3

Kimi K3 — модель инфраструктурного масштаба с архитектурой смеси экспертов, а не гигантская плотная модель, задействующая все 2.8 триллиона параметров для каждого токена. В смеси экспертов каждый токен направляется в небольшой набор специализированных подсетей. В K3 технология Stable LatentMoE активирует 16 из 896 экспертов, благодаря чему модель такого размера выдаёт ответы по цене API ниже, чем у закрытых флагманов.

В официальном руководстве по быстрому старту закреплены основные характеристики:

  • Всего 2.8 триллиона параметров.
  • Контекст на 1,048,576 токенов с единой ценой токена без отдельного тарифа за большой контекст.
  • Встроенное понимание изображений: модель принимает текст и изображения, а возвращает текст.
  • Kimi Delta Attention — гибридная схема внимания для эффективной передачи информации по длинным последовательностям.
  • Attention Residuals — способ извлекать полезные представления с разных глубин модели вместо одинакового накопления вклада каждого слоя.
  • Автоматическое кэширование контекста без идентификатора кэша, настройки срока жизни или дополнительного параметра запроса.

Kimi связывает эти изменения архитектуры и обучения с улучшением эффективности масштабирования примерно в 2.5x относительно K2. Это заявление разработчика об архитектуре, а не прикладной тест. Практическое следствие для покупателя проверить проще: K3 даёт рабочее пространство на миллион токенов, а при попадании префикса в кэш вход обходится в десять раз дешевле обычной цены.

K3 уже доступна в четырёх вариантах. Kimi.com служит интерфейсом чата. Kimi Work версии 3.1.0 и новее работает на Windows и Mac с Apple silicon. В терминале Kimi Code модель выбирается командой /model. Разработчики обращаются к модели kimi-k3 через API Kimi.

API поддерживает вызовы инструментов, JSON Mode, структурированный вывод, ограничения на выбор инструментов и их динамическую загрузку. У работы с изображениями есть неудобное ограничение: публичные URL изображений не принимаются, поэтому приложение должно передавать данные в base64 или ссылку на файл Kimi.

Тесты показывают уровень флагманов, но не безусловное лидерство

По независимым измерениям Kimi K3 находится среди лидеров, но низкий тариф скрывает дополнительную цену: модель медленная и многословная. Artificial Analysis оценивает K3 в 57 баллов и ставит её на #4 место среди 189 моделей. Скорость составляет 62.0 выходного токена в секунду — #91 из 189. В рамках Intelligence Index модель сгенерировала 130M выходных токенов при среднем значении 63M.

Многословность важна, потому что выходные токены — дорогая часть счёта K3. Artificial Analysis потратила на оценку модели $2,709.75. Низкая стоимость токена не гарантирует низкую стоимость принятого результата, если модель генерирует примерно вдвое больше текста, чем модели в сравнительной выборке.

Таблица тестов Kimi показывает более сложную картину возможностей:

ТестKimi K3Claude Fable 5GPT-5.6 SolВывод
DeepSWE67.570.073.0В этом тесте разработки ПО K3 уступает обеим моделям
Program Bench77.876.877.6K3 лидирует с небольшим отрывом
Terminal-Bench 2.188.384.688.8K3 почти сравнялась с Sol и обошла указанный результат Fable
FrontierSWE81.286.671.3K3 находится между лидерами
SWE Marathon42.035.039.0K3 лидирует в этом тесте длительной работы
GDPval-AA v2, Elo166817601748В широком спектре профессиональных задач K3 уступает обеим моделям
BrowseComp91.288.090.4В таблице разработчика K3 лидирует в веб-поиске

Результаты сильные, но это не единое прямое сравнение. Kimi запускала K3 с максимальным уровнем рассуждений, температурой 1.0 и top-p 1.0. В разных строках меняется среда оценки: Kimi Code, Claude Code или Codex. Некоторые результаты Fable 5 могут учитывать переключение на Opus 4.8. Таблица подтверждает конкурентоспособность K3 на уровне флагманов, но не её универсальное превосходство.

Независимые и собственные данные разработчика приводят к одному полезному выводу. K3 достаточно сильна, чтобы побороться за отдельный продакшен-маршрут, но ещё недостаточно проверена, чтобы заменить все маршруты.

Сильные стороны
Что получается хорошо
10 points

  • K3 стоит $3 за вход и $15 за выход на миллион некэшированных токенов — значительно меньше Sol и Fable 5.
  • При попадании в кэш входная цена снижается до $0.30 за миллион токенов благодаря автоматическому кэшированию префикса.
  • Для контекста на 1,048,576 токенов нет отдельного тарифа за большую длину.
  • Встроенное распознавание изображений, структурированный вывод, вызовы инструментов и их динамическая загрузка покрывают ключевые потребности агентов.
  • В независимом широком индексе интеллекта K3 занимает #4 место среди 189 моделей.
  • Полные веса, окончательная лицензия и технический отчёт ещё не опубликованы.
  • Доступен только максимальный уровень усилий, поэтому простые задачи нельзя направить в более дешёвый или быстрый режим той же модели.
  • Kimi предупреждает: отсутствие истории рассуждений или смена модели посреди сессии может нарушить стабильность качества.
  • Инструмент веб-поиска Kimi обновляется и пока не рекомендуется к использованию.
  • Независимые измерения показывают, что K3 медленнее и намного многословнее среднего результата в сравнительной выборке.

Цена Kimi K3 API — главная причина начать тестирование

Первый аргумент Kimi K3 для продакшена — стоимость, особенно когда в сессии программирования многократно используется стабильный префикс репозитория. По официальному тарифу миллион входных токенов при попадании в кэш стоит $0.30, без попадания — $3, а миллион выходных токенов — $15.

Для миллиона некэшированных входных токенов и миллиона выходных прямое сравнение выглядит так:

  • Kimi K3: $18
  • GPT-5.6 Sol: $35
  • Claude Fable 5: $60

На этой намеренно простой нагрузке K3 дешевле Sol на 48.6%, а Fable — на 70%.

Более показательный пример для агента-программиста — месяц с 10M входных и 1M выходных токенов, где 9M входных токенов достаточно стабильны для попадания в кэш. Kimi сообщает, что в официальном API доля попаданий в кэш при программировании превышает 90%, хотя повторить этот результат в конкретном приложении удастся только при подходящей структуре репозитория и стабильном префиксе.

  • K3: 9 x $0.30 за кэшированный вход + 1 x $3 за некэшированный вход + 1 x $15 за выход = $20.70.
  • Sol: 9 x $0.50 за кэшированный вход + 1 x $5 за некэшированный вход + 1 x $30 за выход = $39.50.
  • Fable: 9 x $1 за кэшированный вход + 1 x $10 за некэшированный вход + 1 x $50 за выход = $69.00.

Без попаданий в кэш та же нагрузка стоит $45 на K3, $80 на Sol и $150 на Fable. Преимущество K3 в цене возникает не благодаря кэшу, но сохраняется с ним и в длительных сессиях.

Схема сравнения стоимости нагрузки с кэшированием для Kimi K3, GPT-5.6 Sol и Claude Fable 5
При 90% попаданий входных данных в кэш K3 становится самым дешёвым вариантом для серьёзного испытания.

Главная ловушка — оптимизировать цену токена вместо стоимости принятого результата. В тестах Artificial Analysis K3 выдала 130M выходных токенов при среднем значении 63M в сравнительной выборке. Если маршрут требует более тщательной проверки, длинных ответов или повторных исправлений, тариф $15 за выходные токены может съесть часть заявленной экономии.

Пользовательская подписка оплачивается отдельно от API. В официальных тарифах подписки Kimi указан бесплатный план Adagio с 6 кредитами Agent и одной параллельной задачей Agent, но без кредитов Kimi Code. Moderato стоит от $19 в месяц или $15 в месяц при годовой оплате и включает 60 кредитов Agent и кредиты Kimi Code в объёме 1x. Более высокие месячные тарифы — Allegretto за $39, Allegro за $99 и Vivace за $199.

Бесплатного плана достаточно, чтобы познакомиться с интерфейсом K3 и стилем ответов. Но он не заменит проверку API на продакшен-нагрузке: кредиты подписки и оплата токенов API учитываются по-разному.

Ограничения продакшена важнее эффектной демонстрации

Главный риск Kimi K3 в продакшене связан не с уровнем интеллекта. Проблема возникает на стыке состояния сессии, фиксированного уровня рассуждений, разрешений инструментов и пока незрелого продукта.

Сохраняйте полную историю рассуждений

K3 обучали с расчётом на сохранение истории рассуждений в течение всей сессии. Kimi предупреждает, что качество может стать крайне нестабильным, если среда агента удалит эту историю или переключит уже начатую сессию с другой модели на K3. Это не просто деталь формата промпта: эксперимент с маршрутизацией может несправедливо показать K3 слабее, если модель подменить посреди диалога.

Начинайте оценку K3 с новой сессии и полностью сохраняйте историю рассуждений ассистента. Не сравнивайте модели, меняя лишь идентификатор посреди уже начатой траектории Sol или Fable.

Доступен только максимальный уровень усилий

K3 рассуждает всегда, а параметр reasoning_effort сейчас принимает только значение max. В будущем планируются другие уровни, но пока их нет. Из-за этого исчезает полезный рычаг продакшен-маршрутизации: простую работу нельзя провести через тот же эндпоинт дешевле и быстрее.

Для основателя стартапа с финансированием, который разбирается со сложной миграцией, обязательный максимальный уровень усилий может быть оправдан. Для технического директора средней компании, направляющего тысячи обычных задач классификации, это лишние расходы. Держите рядом с K3 более дешёвую модель, а не заставляйте её обрабатывать все запросы.

Ограничивайте действия строже, чем формулируете промпты

По словам Kimi, K3 может принимать неожиданные решения при неоднозначных инструкциях: модель обучали доводить длительную работу до конца. Решение — не более длинный промпт с описанием характера, а чёткие правила действий: разрешённый список инструментов, подтверждение перед внешней записью, лимиты расходов, ограниченные пути к файлам и возможность отката.

Если агент написал хороший патч, но заодно изменил постороннюю конфигурацию, полезной автономностью это назвать нельзя. Считайте инициативность возможностью, которой необходим меньший радиус потенциального ущерба.

Пока не стройте систему вокруг веб-поиска

В документации API Kimi сказано, что веб-поиск обновляется и пока не рекомендуется. Поэтому исследовательским агентам нужен отдельный слой поиска или извлечения данных — рассчитывать на готовность официального инструмента K3 не стоит.

Kimi также признаёт заметное отставание от Fable 5 и Sol в пользовательском опыте. Формулировка широкая, но сопутствующие ограничения делают её конкретной: совместимость сессий хрупкая, маршрутизация по уровню усилий не завершена, а один из официальных инструментов меняется. Ни один из этих недостатков не обесценивает модель, но вместе они задают разумные границы испытания.

Открытые веса остаются обещанием до 27 июля

На 17 июля 2026 года Kimi K3 нельзя самостоятельно развернуть как модель с открытыми весами. Kimi обещает опубликовать полные веса к 27 июля, а технический отчёт должен последовать за ними. Пока этих материалов и окончательной лицензии нет, слово «открытая» описывает заявленную цель, а не доступный для скачивания продакшен-ресурс.

Масштаб меняет и практический смысл открытых весов. При 2.8 триллиона параметров исходные веса занимают примерно 1.4 TB при 4 битах на параметр или 5.6 TB при 16 битах на параметр — без учёта накладных расходов среды выполнения, кэша, активаций и резервирования. Kimi рекомендует суперузлы с 64 и более ускорителями.

Это инфраструктура уровня дата-центра, а не модель для рабочей станции. Независимому техническому специалисту разумнее арендовать API. Компании среднего размера, которая рассматривает закрытый контур, стоит оценить стоимость кластера, сети, команды эксплуатации и запаса мощности, прежде чем считать самостоятельное размещение способом сэкономить.

Важно различать понятия:

  • Открытые веса означают, что обученные параметры можно скачать.
  • Открытый исходный код дополнительно предполагает наличие кода и лицензии, разрешающей нужный сценарий использования.
  • Практическое самостоятельное размещение означает, что модель укладывается в доступный и устойчивый бюджет инфраструктуры и эксплуатации.

В нынешнем ландшафте моделей с открытыми весами уже есть более компактные варианты, которые проще развернуть. K3 может войти в него на уровне флагманских возможностей, но сначала должны появиться файлы релиза и лицензия.

Что выбрать: Kimi K3, GPT-5.6 Sol или Claude Fable 5

Выбирайте по цене ошибки, а не по лучшей строке модели в тестах.

СценарийВыборПочемуКогда отказаться
Агент-программист многократно читает большой стабильный репозиторийИспытание Kimi K3Автоматическое кэширование и вход по $0.30 делают длительные сессии экономичнымиСреда выполнения не может сохранить полную историю рассуждений
Продакшен-агенту нужны зрелые инструменты и сложные решенияGPT-5.6 SolСильные универсальные возможности, зрелые инструменты работы с вебом и компьютером, актуальная продакшен-платформаОсновные расходы приходятся на выход, а K3 обеспечивает на вашем маршруте то же качество
В ответственной многодневной задаче качество решений важнее ценыClaude Fable 5Рассчитана на амбициозную длительную работу и проверку результатаЦена выхода $50 не окупается меньшим числом исправлений
Данные должны оставаться в подконтрольной инфраструктуреПодождать или выбрать другую открытую модельВеса K3 и окончательная лицензия не опубликованыНа период оценки допустимо использовать API
Массовой простой работе нужны низкая задержка и небольшие расходы на рассужденияНи один флагман по умолчаниюУ K3 есть только максимальный уровень усилий; Sol и Fable — премиальные маршрутыИзмеренная доля ошибок доказывает окупаемость флагмана

Kimi K3 — испытание со ставкой на цену и возможности

Kimi K3 стоит испытать там, где большой контекст, работа с кэшированным репозиторием или встроенное распознавание изображений дают реальное преимущество. При цене $3 за вход, $0.30 за кэшированный вход и $15 за выход на миллион токенов модель может позволить себе уступить в эффективности и всё равно обойти флагманов по стоимости. Откажитесь от неё, если уровень сессии не сохраняет историю, официальный веб-поиск критически важен или преждевременное действие может дорого обойтись.

GPT-5.6 Sol — продакшен-стандарт, который нужно превзойти

GPT-5.6 Sol остаётся более сильным выбором по умолчанию, когда маршрут зависит от зрелого набора инструментов и проверенного поведения в разных задачах. Модель поддерживает вызов функций, структурированный вывод, поиск в вебе и файлах, выполнение кода, размещённую оболочку, управление компьютером, MCP и поиск инструментов. Тарифы $5 за вход, $0.50 за кэшированный вход и $30 за выход выше, чем у K3, но меньшие затраты на проверку могут оправдать эту доплату. В актуальном руководстве по маршрутизации GPT-5.6 разобрано, как распределить работу между Sol, Terra и Luna.

Страница запуска OpenAI GPT-5.6 с моделями Sol, Terra и Luna
GPT-5.6 Sol

От Sol стоит отказаться, если K3 стабильно даёт такой же принятый результат на повторяемом маршруте. Продолжать платить за флагман после успешной проверки более дешёвой модели — привычка, а не управление рисками.

Claude Fable 5 — доплата за качество решений

Claude Fable 5 — самая мощная общедоступная модель Anthropic для сложных задач программирования и интеллектуальной работы. Миллион входных токенов стоит $10, выходных — $50, а кэширование промпта даёт скидку 90% на вход. Anthropic позиционирует её для длительных проектов, в которых модель планирует, делегирует, тестирует и проверяет собственную работу.

Страница продукта и тарифов Anthropic Claude Fable 5
Claude Fable 5

Главные ограничения — цена и предсказуемость маршрутизации. Чувствительные запросы по кибербезопасности и биологии могут перенаправляться на Opus 4.8. Доплата за Fable оправдана лишь тогда, когда меньшее число исправлений, более качественные решения или более длительная надёжная автономная работа дают больше принятых результатов, чем K3 или Sol.

План обратимого испытания Kimi K3

Самый безопасный путь внедрения K3 — менять по одному маршруту и сохранять прежнюю модель в готовности. К запуску модели стоит относиться как к обновлению зависимости: процесс должен быть наблюдаемым, обратимым и достаточно узким для диагностики.

Четырёхэтапная схема допуска Kimi K3 в продакшен с предупреждениями о рисках сессий и инструментов
Прежде чем получить продакшен-маршрут, K3 должна пройти проверки истории, разрешений и результатов.
  1. Выберите один дорогой маршрут

    Начните с задачи, где стоимость Sol или Fable ощутима, а K3 имеет вероятное преимущество: отладка на уровне репозитория, анализ длинных документов или исправление фронтенда по изображениям. Не начинайте со всех вызовов ИИ в продукте сразу.

  2. Зафиксируйте условия сравнения

    Используйте одинаковые промпты, файлы, инструменты, границы разрешений и критерии приёмки. По возможности не меняйте среду агента, чтобы не принять разницу в инструментах за разницу между моделями.

  3. Начните заново и сохраняйте историю

    Создавайте новые сессии K3, сохраняйте всю требуемую API историю рассуждений ассистента и поддерживайте стабильные префиксы побайтно одинаковыми, чтобы они попадали в кэш. Никогда не переводите на K3 уже начатую сессию другой модели.

  4. Ограничьте действия за пределами модели

    Задайте список разрешённых инструментов, требуйте подтверждения внешней записи и разрушительных изменений, ограничьте расходы и предусмотрите откат. Закрепляйте границы в коде и разрешениях, а не только в системном промпте.

  5. Измеряйте принятые результаты

    Записывайте объём входных, кэшированных входных и выходных токенов, затраченное время, повторные попытки, отклонённую работу и усилия на проверку. Делите общие расходы на число принятых результатов. Так низкий тариф K3 и её склонность к длинным ответам попадут в один показатель.

  6. Передавайте K3 только выигранные маршруты

    Переносите маршрут, когда K3 достигает нужного уровня качества при меньших общих расходах. Сохраняйте Sol или Fable как явный путь эскалации сложных случаев, а простую массовую работу оставляйте более дешёвой модели.

Этот план не требует верить, что K3 лучше вообще. Нужно доказать её превосходство в одной конкретной работе. Только на таком уровне решение о продакшен-модели сохраняет актуальность.

Что такое Kimi K3?

Kimi K3 — флагманская модель Moonshot AI на 2.8 триллиона параметров для длительных задач программирования, интеллектуальной работы и рассуждений. Она принимает текст и изображения, поддерживает контекст на 1,048,576 токенов и доступна в приложениях, инструменте программирования и API Kimi.

Будет ли Kimi K3 моделью с открытым исходным кодом?

Kimi обещает выпустить полные веса модели к 27 июля 2026 года. На 17 июля веса, окончательная лицензия и технический отчёт ещё не опубликованы, поэтому коммерческие права и возможность воспроизводимого самостоятельного размещения следует оценивать после выхода этих материалов.

Можно ли запустить Kimi AI локально?

K3 нельзя считать обычной локальной моделью. Её 2.8 триллиона параметров занимают примерно 1.4 TB даже при 4 битах на параметр без накладных расходов среды выполнения, а Kimi рекомендует суперузлы с 64 и более ускорителями. Большинству команд стоит оценивать K3 через API.

Kimi полностью бесплатна?

Нет. Бесплатная подписка Adagio включает 6 кредитов Agent, но не даёт кредитов Kimi Code. Платные подписки начинаются с Moderato за $19 в месяц, а API Kimi оплачивается отдельно по числу входных и выходных токенов.

Kimi K3 лучше GPT-5.6 Sol или Claude Fable 5?

Не в целом. K3 лидирует в отдельных тестах, опубликованных разработчиком, и стоит дешевле, но Kimi признаёт, что в общем сравнении модель всё ещё уступает Sol и Fable. Практический вопрос в том, достигает ли K3 вашего порога приёмки на конкретном маршруте при меньших общих расходах.

Хотите увидеть, какие современные модели подходят именно для ваших задач? Получите бесплатную карту ИИ-инструментов для владельцев бизнеса.

Последнее обновление

3 сент. 2026 г.

КатегорияAI

Сделать этот сайт предпочтительным в Google

Добавить omidsaffari.com как предпочтительный источник в Google Поиске

Отметьте omidsaffari.com как предпочтительный источник — и Google будет поднимать его для вас в Top Stories, AI Overviews и AI Mode.

Рассылка

Одно письмо, каждое воскресенье. Работающие системы, а не горячие мнения.

Билд-логи, системы в продакшене и полевые заметки из портфеля ИИ-проектов.

Еженедельно. Без спама. Отписка в любой момент.