Обзор GLM-5.2: почему GLM-5.3 Flash теперь выгоднее
Обзор GLM-5.2 с актуальными ценами и тестами: сравниваем модель с GLM-5.3 Flash и объясняем, кому всё ещё нужны открытые веса предыдущей версии.

Обзор GLM-5.2 начинается с главного: это по-прежнему модель для программирования с открытыми весами, у которой 753 млрд параметров и лицензия MIT, но внутри собственной линейки она уже не лидер по соотношению цены и возможностей. GLM-5.3 Flash теперь стоит $0.15 за миллион входных и $0.50 за миллион выходных токенов — против $1.40 и $4.40 у GLM-5.2 в Cloudflare. При этом новая модель нативно работает с изображениями, а размер ее контекстного окна в Cloudflare достигает 1,048,576 токенов.
Вердикт
Не стоит запускать новую облачную нагрузку на GLM-5.2, если только не требуется совместимость с уже развернутой системой или точное воспроизведение старой оценки. Для экономичных агентов и мультимодальных задач разумнее по умолчанию выбирать GLM-5.3 Flash. Полная GLM-5.3 лучше подойдет там, где максимальная производительность в программировании важнее стоимости токенов. Сегодня главная роль GLM-5.2 — быть стабильной базовой моделью для самостоятельного развертывания.
Этот вывод жестче первоначальной версии обзора. GLM-5.2 по-прежнему сочетает открытые веса с либеральной лицензией, длинный контекст и убедительные результаты в программировании, однако Z.ai уже выпустила двух преемников. Теперь выбор обычно идет не между GLM-5.2 и дорогой закрытой моделью, а между Flash и полной GLM-5.3. GLM-5.2 остается лишь там, где риск миграции важнее возможной экономии.

С 30 августа 2026 года Cloudflare AI Search поддерживает GLM-5.3 Flash как нативную модель генерации Workers AI. Для нее используется псевдоним @cf/zai-org/glm-5.3-flash, а контекстное окно составляет 1,048,576 токенов. Таким образом, Flash доступна не только через Z.ai или тариф для программистов, но и внутри управляемой системы поиска с генерацией. О настройке и расходах подробно рассказано в материале Cloudflare AI Search с GLM-5.3 Flash: как это работает.
Если GLM-5.2 уже развернута на собственной инфраструктуре, переходить только из-за появления новой версии необязательно. Но для нового облачного проекта разница в цене слишком велика, чтобы ее игнорировать: заявленная стоимость выходных токенов Flash ниже на 88.6%, а сама модель нативно принимает изображения, видео и файлы, чего GLM-5.2 не умеет.
Обзор GLM-5.2: что это за модель
Z.ai выпустила GLM-5.2 16 июня 2026 года как инженерную модель для длительных задач. В официальной карточке модели указаны 753 млрд параметров, текстовый ввод и вывод, открытые веса, а также варианты локального запуска через SGLang, vLLM, KTransformers, xLLM и Transformers. Версия самой Z.ai поддерживает контекст в 1 миллион токенов и вывод длиной до 128K токенов. У облачного эндпоинта GLM-5.2 в Cloudflare другие ограничения: контекст не превышает 262,144 токена.
Главной архитектурной особенностью первого релиза стала IndexShare. Как говорится на странице запуска GLM-5.2 от Z.ai, один компактный индексатор обслуживает каждую группу из четырех слоев разреженного внимания. Благодаря этому при контексте в 1 миллион токенов объем вычислений на токен сокращается в 2.9 раза. Проще говоря, на каждом слое модели не приходится заново выполнять часть дорогого поиска по огромному промпту. Поэтому обслуживание длительных сессий с репозиториями обходится дешевле.
GLM-5.3 стала прямым преемником GLM-5.2 в программировании. По данным Z.ai, обе версии используют одну базовую модель, а прирост качества обеспечен дополнительным постобучением. GLM-5.3 Flash относится к другой ветке и создана на новой базе: всего 320 млрд параметров, из которых активны 18 млрд, гибридное разреженное и линейное внимание и мультимодальный обучающий корпус объемом 30 трлн токенов. В актуальной документации перечислены видео, изображения, текст и файлы на входе, текст на выходе, контекст в 1 миллион токенов и максимальный вывод в 128K токенов.
Именно меньшее число активных параметров важнее всего с экономической точки зрения. По данным Z.ai, модели требуется в 3.0 раза меньше вычислений для механизма внимания, а ее кеш ключей и значений в 4.4 раза компактнее, чем у полной GLM-5.3. Именно снижение нагрузки на вычислительные ресурсы и память позволяет заметно уменьшить цену токенов. Flash — не просто GLM-5.2 с новым названием: у нее другая экономика обслуживания и возможность нативно использовать визуальную обратную связь в процессе программирования.
GLM-5.2 и GLM-5.3 Flash по-прежнему доступны по лицензии MIT. Их разрешено применять в коммерческих продуктах, модифицировать и развертывать самостоятельно. Поэтому обе модели остаются частью рынка моделей с открытыми весами, хотя облачный доступ и оборудование для запуска систем такого масштаба все равно требуют затрат.
Результаты тестов без маркетинговых иллюзий
Первоначальные результаты GLM-5.2 сегодня стоит воспринимать как устаревшую точку отсчета, а не как актуальный рейтинг. В июньских материалах к запуску Z.ai сообщала, что GLM-5.2 отстает от Claude Opus 4.8 примерно на один балл в FrontierSWE, занимает место ниже Opus 4.8 в PostTrainBench и уступает ей 13 баллов в SWE-Marathon. Для модели с открытыми весами это были сильные показатели, но они отражают состав моделей по состоянию на июнь и набор задач, выбранный самой Z.ai.

Более свежие данные меняют практическую рекомендацию. В оценке GLM-5.3 Flash, опубликованной Z.ai, модель Flash набрала 84.3 балла против 81.0 у GLM-5.2 в Terminal Bench 2.1, 63.4 против 46.2 в DeepSWE v1.1 и 48.8 против 26.2 в AutomationBench v1.0.6. В Z.ai Code Bench v1.0 при максимальном уровне усилий и запуске через Claude Code 2.1.207 результат Flash составил 29.0, а Opus 4.8 — 29.5.
Эти результаты полезны, но все они опубликованы производителем. Открытые тесты одинаково указывают на это преимущество в программировании и работе агентов, тогда как внутренний Code Bench контролирует сама Z.ai. Обоснованный вывод звучит так: в представленных Z.ai сценариях Flash превосходит GLM-5.2 и приближается к Opus 4.8 в собственном тесте программирования Z.ai. Это не доказывает равенство Flash и Opus в написании текстов, анализе, следовании инструкциям или работе с любым продуктовым репозиторием.
Реальная стоимость
С актуальными тарифами GLM-5.2 трудно рекомендовать для новой облачной нагрузки. Эти цены были сверены с действующим прайс-листом Z.ai и актуальными тарифами Cloudflare Workers AI 30 августа 2026 года.
Акция на Flash действует только в API Z.ai и заканчивается 9 сентября 2026 года в 24:00 по сингапурскому времени UTC+8. В Cloudflare указаны стандартные ставки: $0.15 за ввод, $0.03 за кешированный ввод и $0.50 за вывод. Не следует рассчитывать бюджет развертывания в Cloudflare исходя из временной скидки Z.ai.
Простая нагрузка с 1 миллионом входных и 1 миллионом выходных токенов обойдется в $5.80 на GLM-5.2 или полной GLM-5.3. Flash по обычному тарифу стоит $0.65 — на 88.8% меньше. Во время акции Z.ai цена снижается до $0.325, то есть на 94.4%. В реальных задачах соотношение входных и выходных токенов будет другим, но суть выбора не меняется: GLM-5.2 и GLM-5.3 находятся в одной ценовой категории, а Flash — значительно ниже.

GLM Coding Plan тоже изменился. Lite по-прежнему стоит $18 в месяц или $12.60 в пересчете на месяц при оплате за год, а теперь в тариф входят 10,000 кредитов в неделю. Pro стоит $80 в месяц или $56 в пересчете на месяц при оплате за год и дает в 6 раз больше лимита, чем Lite. Max стоит $168 в месяц или $117.60 в пересчете на месяц при годовой оплате и дает в 14 раз больше лимита Lite. На странице указано более 20 агентских инструментов, включая Claude Code и ZCode, а для настройки по-прежнему предлагается команда npx @z_ai/coding-helper.
GLM-5.3 Flash доступна всем подписчикам Coding Plan и дает в 3 раза больше доступной квоты, чем полная GLM-5.3. Поэтому выбор тарифа стал проще: начните с Lite, если для ваших еженедельных задач хватает 10,000 кредитов, и переходите выше только при необходимости. Если сравниваете этот тариф с подпиской на одну из передовых закрытых моделей, пригодится руководство по ценам Claude Code. Полную GLM-5.3 внутри подписки стоит выбирать лишь тогда, когда ее более высокий уровень в программировании оправдывает ускоренный расход квоты.
Можно ли использовать GLM-5.2 бесплатно?
Веса можно бесплатно скачать и использовать по лицензии MIT. Веса GLM-5.2 размещены на Hugging Face, а Z.ai перечисляет поддерживаемые фреймворки для локального инференса. То же относится и к GLM-5.3 Flash.
Но вычисления не бесплатны. В GLM-5.2 насчитывается 753 млрд параметров, а в Flash — 320 млрд параметров в общей сложности, поэтому самостоятельный запуск любой из них требует полноценной инфраструктуры и не сводится к установке на ноутбук. Облачная GLM-5.2 стоит $1.40 за миллион входных и $4.40 за миллион выходных токенов. Обычные тарифы Flash — $0.15 и $0.50 соответственно; временная скидка Z.ai описана выше.
У Cloudflare AI Search есть еще одно важное отличие. В период открытого бета-тестирования AI Search бесплатен в пределах опубликованных лимитов: тариф Workers Free включает 20,000 запросов в месяц и сканирование 500 страниц в день. Однако генерация в Workers AI и использование AI Gateway оплачиваются отдельно. Бесплатный поисковый слой не делает токены генерации бесплатными.
GLM-5.2 против GPT и Claude в программировании
Полезный вопрос теперь не в том, способна ли GLM-5.2 иногда приблизиться к GPT или Claude. Важнее, насколько вы цените открытую модель, предсказуемую стоимость токенов и нативный мультимодальный ввод — и готовы ли ради этого принять менее зрелую экосистему. GLM-5.3 Flash усиливает каждое из этих преимуществ.
На фоне GPT и Claude главные преимущества семейства GLM — контроль и цена. Веса можно развернуть самостоятельно, а Flash заметно удешевляет постоянную генерацию. Закрытые передовые модели остаются более очевидным выбором для тех, кому нужен один отлаженный ассистент одновременно для текстов, анализа и программирования, а не модель под конкретный тип нагрузки.
В задачах чистого программирования нельзя превращать июньский результат FrontierSWE в универсальное доказательство. Отставание GLM-5.2 от Opus 4.8 примерно на один балл в одном историческом тесте никогда не означало, что модели одинаково хорошо справляются со всем. Flash улучшает соотношение цены и возможностей, а полная GLM-5.3 предназначена для наиболее сложного программирования и стоит в API столько же, сколько GLM-5.2. Перед тем как менять рабочий процесс в продакшене, полезнее обратиться к широкому сравнению передовых моделей для программирования. В обзоре Kimi K3 рассмотрена еще одна альтернатива с открытыми весами и иным балансом цены и производительности.
Кому подходит модель, а кому лучше выбрать другую
Сохраняйте GLM-5.2, если существующая система на собственной инфраструктуре работает стабильно, результаты оценки должны оставаться воспроизводимыми или одна из зависимостей привязана к поведению этой версии. Выход нового релиза сам по себе не делает исправное развертывание неправильным.
Для новых агентов с высокой нагрузкой, визуального программирования, работы с документами и генерации в Cloudflare AI Search выбирайте GLM-5.3 Flash. Ее стандартные ставки составляют почти одну девятую от ставок GLM-5.2, она принимает визуальные данные и файлы, а ее контекстное окно в Cloudflare больше. Полная GLM-5.3 подходит для случаев, когда качество на сложных задачах программирования важнее пропускной способности. Цена ее API не изменилась относительно GLM-5.2, поэтому запускать на GLM-5.2 новую платную нагрузку для программирования по той же ставке почти нет смысла.
Не торопитесь с миграцией, если нагрузка настолько мала, что стоимость модели несущественна, или если проверка после замены потребует больше ресурсов, чем удастся сэкономить за месяц. Тесты производителя не заменят репрезентативную задачу из вашего собственного репозитория.
Практический план на ближайший понедельник: запустите одну реальную задачу из репозитория на GLM-5.3 Flash, зафиксируйте число выходных токенов, затраченное время и правки, которые пришлось внести, а затем повторите опыт с полной GLM-5.3. Если качество Flash вас устраивает, сделайте ее основной моделью для повседневных задач, а полную версию оставьте для сложных случаев. Если используете Cloudflare AI Search, выберите @cf/zai-org/glm-5.3-flash в качестве модели генерации и при первом сравнении не меняйте настройки поиска.
GLM-5.2 — китайская модель?
Да. Согласно истории компании Z.ai, ZhipuAI была основана в 2019 году на базе технологий Университета Цинхуа. Веса GLM-5.2 и GLM-5.3 Flash доступны по лицензии MIT, поэтому команды со строгими требованиями к месту хранения данных могут оценить самостоятельное развертывание вместо передачи промптов облачному провайдеру.
Можно ли использовать GLM-5.2 бесплатно?
Веса под лицензией MIT можно бесплатно скачать и использовать. Облачный инференс платный: согласно актуальному прайс-листу, GLM-5.2 стоит $1.40 за миллион входных и $4.40 за миллион выходных токенов. Оборудование и эксплуатация также превращают самостоятельное развертывание в реальную статью расходов.
GLM-5.2 лучше GPT для программирования?
В общем случае так утверждать нельзя. Июньские данные Z.ai показывали, что в отдельных тестах длительных задач программирования GLM-5.2 приближалась к лучшим закрытым моделям. С тех пор GLM-5.3 и GLM-5.3 Flash превзошли ее в опубликованных Z.ai оценках программирования. Сегодня главные доводы в пользу GLM-5.2 — открытые веса и совместимость, а не статус самой производительной новой модели.
Работает ли GLM-5.2 с Claude Code?
Да. GLM Coding Plan поддерживает Claude Code и более 20 агентских инструментов. Теперь GLM-5.3 Flash доступна всем подписчикам и дает в 3 раза больше доступной квоты, чем полная GLM-5.3, поэтому для повседневной работы сначала стоит попробовать именно ее.
Решение о том, нужна ли GLM-5.2 в вашей системе, обычно зависит от устройства самого агента для программирования. Я собрал шаги по подключению более дешевой модели без поломки рабочего процесса в бесплатный чек-лист по настройке Claude Code и Codex. Подпишитесь на рассылку, чтобы получить его, а также еженедельный разбор моделей, на которые действительно стоит переходить.
3 сент. 2026 г.







