Cloudflare AI Search с GLM-5.3 Flash: разбор архитектуры и цен
Cloudflare AI Search теперь генерирует ответы через GLM-5.3 Flash. Разбираем работу пайплайна, окно в 1,048,576 токенов и реальные затраты.

30 августа 2026 года компания Cloudflare добавила нейросеть GLM-5.3 Flash в AI Search в качестве опции генерации текста. Главная ценность обновления — не просто еще одна строка в меню. Вы сохраняете полностью управляемый пайплайн поиска Cloudflare и меняете только модель, которая пишет финальный ответ, получая контекстное окно в 1,048,576 токенов и тарифы Workers AI: $0.15 за миллион входных токенов и $0.50 за миллион выходных.
Что на самом деле изменилось в Cloudflare AI Search
Cloudflare AI Search — это управляемый сервис семантического поиска по вашему собственному контенту. Вы подключаете сайт, бакет R2 (объектное хранилище Cloudflare) или загружаете файлы напрямую. Сервис парсит эти материалы, разбивает их на фрагменты (чанки), индексирует их и находит релевантные куски, когда пользователь задает вопрос. Workers AI — это хостинг моделей Cloudflare, который и запускает GLM-5.3 Flash внутри этой цепочки.
Такая архитектура называется генерацией с дополненной выборкой (retrieval-augmented generation, или RAG). Простыми словами: система сначала находит фрагменты первоисточника, а затем просит ИИ сформулировать ответ на их основе.
GLM-5.3 Flash вступает в дело только на втором шаге. Модель не сканирует веб-сайт. Она не строит эмбеддинги — векторные представления текста для вычисления сходства. Она не выполняет поиск по ключевым словам и не занимается реранкингом (повторным ранжированием выдачи по релевантности). Она берет извлеченный контекст и пишет понятный ответ. При этом гибридный поиск совмещает смысловое векторное сопоставление с точным совпадением ключевых фраз.
В этом разделении и заключается вся суть. Вы можете сменить генерирующую модель без переиндексации базы и без смены модели эмбеддингов. Cloudflare позволяет задать модель глобально в настройках инстанса или переопределять ее для каждого отдельного запроса.

Зачем нужно окно в 1,048,576 токенов и в чем подвох
Заявленное контекстное окно новой модели ровно в восемь раз больше лимита в 131,072 токена у GLM-4.7 Flash в списке поддерживаемых моделей AI Search. Контекст — это объем данных, который модель способна удержать за один вызов: системные инструкции, найденные фрагменты, история переписки и сам генерируемый ответ.
Такой запас дает AI Search возможность оперировать большими подборками цитат и вести длинные диалоги. Это критично для технической документации, нормативных баз или тикетов поддержки, где точный ответ зависит от деталей, разбросанных по разным документам.
Однако это вовсе не означает, что AI Search начнет отправлять всю вашу базу знаний в каждый промпт. Механизм поиска по-прежнему отбирает строго ограниченное число чанков. Биндинг Workers возвращает 10 результатов по умолчанию и поддерживает от 1 до 50. Окно в миллион токенов не спасет проект, если индексация настроена плохо, фильтры выставлены неверно, а порог отсечения отбрасывает нужный фрагмент.
Здесь есть еще один важный технический нюанс. В Workers AI напрямую модель поддерживает рассуждения (reasoning), вызов функций (function calling) и зрение (vision). Внутри же AI Search она подключена исключительно для генерации текста. Изображения в исходных материалах преобразуются в Markdown еще на этапе индексации до формирования ответа, поэтому данное обновление не превращает чат AI Search в эндпоинт для прямого анализа картинок.
Сценарии внедрения: кто выиграет уже сейчас
Соло-фаундер SaaS с завалом в техподдержке
Проиндексируйте открытую документацию, выберите GLM-5.3 Flash для генерации ответов и выведите чат в виджет помощи на сайте. Вы получите не абстрактного чат-бота, а сквозную управляемую связку: от вопроса клиента к фрагменту документации и далее к четкому ответу.
Работу всей цепочки можно проверить прямо в дашборде без единой строчки кода.
Создайте инстанс
Откройте AI Search в панели Cloudflare, нажмите Create Instance, укажите имя и подключите сайт продукта либо бакет R2. Вы также можете создать пустой инстанс и загрузить файлы позже.
Дождитесь индексации
Перейдите на вкладку Items инстанса и убедитесь, что контент успешно проиндексирован. Загрузка любого файла инициирует процесс индексации автоматически.
Выберите модель генерации
Откройте Settings, переключитесь со Smart Default на явный выбор модели и укажите
@cf/zai-org/glm-5.3-flash. Модель эмбеддингов останется прежней.Протестируйте оба режима
В разделе Playground используйте вкладку Search, чтобы оценить найденные чанки, а затем перейдите в Chat, чтобы увидеть сформированный ответ. Если на этапе Search система не находит первоисточник, смена генеративной модели ситуацию не исправит.
Небольшое агентство, ведущее базы знаний клиентов
Размещайте контент каждого клиента в отдельном инстансе AI Search и переводите генерацию на GLM-5.3 Flash там, где качество ответов устраивает заказчика. Главный плюс чисто операционный: ваша команда работает с единой системой индексации и поиска, сохраняя изолированные базы, промпты и циклы релизов для каждого проекта.
Не смешивайте данные разных заказчиков в одну базу только ради упрощения настроек. Модель конфигурируется на уровне каждого инстанса, а Cloudflare поддерживает пространства имен (namespaces), если нужно управлять пулом инстансов через один биндинг.
Инженерная команда, ищущая инструкции по инцидентам
Подключите регламенты и runbooks из бакета R2, активируйте гибридный поиск для перехвата точных кодов ошибок и смысловых описаний процедур, а задачу сведения инструкций в понятный ответ доверьте GLM-5.3 Flash. Результат — мгновенный доступ к нужным шагам при сохранении исходных чанков для сверки.
При устранении сбоев всегда выводите рядом с ответом ссылки на исходные фрагменты. Сгенерированный текст — это лишь удобный интерфейс, а не истина в последней инстанции для изменений в продакшене.
Платформенный инженер, тестирующий модель без миграций
Используйте параметр model в теле запроса, чтобы направить контролируемый процент трафика на GLM-5.3 Flash. Собирайте статистику: входные и выходные токены, качество чанков, процент принятых ответов и задержку (latency). Весь остальной трафик пусть обслуживает модель по умолчанию.
Это идеальный A/B-тест: поисковый индекс, параметры выборки и база знаний остаются абсолютно идентичными. Меняется только финальный генератор.
Если вашему агенту требуется поиск по живому интернету, а не по заранее собранной базе, для этого нужен другой стек инструментов. В обзоре поисковых AI API подробно рассмотрены провайдеры под такие задачи.
Рабочий пример Worker с поддержкой GLM-5.3 Flash
Официальный гайд Cloudflare по Workers предлагает начать с чистого TypeScript-проекта:
npm create cloudflare@latest -- ai-search-tutorial
cd ai-search-tutorialДобавьте биндинг пространства имен в файл wrangler.jsonc. Биндинг — это именованная связь, позволяющая Worker безопасно обращаться к другим сервисам Cloudflare. Опция remote: true обязательна, так как AI Search не запускается в локальном процессе: при разработке Wrangler перенаправляет вызовы на облачный сервис.
{
"$schema": "./node_modules/wrangler/config-schema.json",
"ai_search_namespaces": [
{
"binding": "AI_SEARCH",
"namespace": "default",
"remote": true
}
]
}Замените содержимое src/index.ts следующим готовым кодом. Достаточно один раз открыть эндпоинт /setup, чтобы создать инстанс и проиндексировать тестовый документ. Все остальные запросы будут искать нужную информацию и передавать ее в GLM-5.3 Flash для формирования ответа.
export interface Env {
AI_SEARCH: AiSearchNamespace;
}
export default {
async fetch(request, env): Promise<Response> {
const url = new URL(request.url);
if (url.pathname === "/setup") {
const instance = await env.AI_SEARCH.create({ id: "my-instance" });
const item = await instance.items.uploadAndPoll(
"getting-started.md",
"AI Search indexes uploaded content for retrieval.",
);
return Response.json({ created: "my-instance", status: item.status });
}
const query = url.searchParams.get("q") ?? "What does AI Search do?";
const response = await env.AI_SEARCH.get("my-instance").chatCompletions({
messages: [
{
role: "system",
content: "Answer only from the indexed content. If the answer is missing, say so.",
},
{ role: "user", content: query },
],
model: "@cf/zai-org/glm-5.3-flash",
ai_search_options: {
retrieval: { max_num_results: 5 },
},
});
return Response.json(response);
},
} satisfies ExportedHandler<Env>;Запустите проект локально командой npx wrangler dev. Убедившись в работоспособности, выполните npx wrangler login и задеплойте сервис через npx wrangler deploy.
Благодаря биндингу коду вашего Worker не требуются отдельные токены авторизации для AI Search API. Если же вы обращаетесь к REST API напрямую, токену понадобятся права AI Search:Edit и AI Search:Run.
Типичная ошибка инженеров — пытаться исправить модель или промпт, когда нужная информация попросту потерялась на этапе поиска. Всегда проверяйте массив response.chunks перед тем, как переписывать инструкции или обвинять модель в галлюцинациях. Нейросеть физически не сможет сослаться на факт, которого не было в переданных ей чанках.
Экономика, лимиты и расчет затрат
Сам сервис AI Search полностью бесплатен во время открытой беты в рамках действующих лимитов вашего тарифа Workers. Использование Workers AI оплачивается отдельно, а подключение AI Gateway при необходимости тарифицируется по собственным расценкам. Cloudflare обязуется предупредить пользователей минимум за 30 дней до введения платных тарифов на AI Search.
Цены на GLM-5.3 Flash составляют $0.15 за миллион входных токенов и $0.50 за миллион выходных токенов. Запрос с 5,000 некэшированных входных токенов и ответом на 500 токенов обходится ровно в $0.001:
0.005 × $0.15 + 0.0005 × $0.50 = $0.001
При объеме в 20,000 аналогичных запросов расходы на генерацию через Workers AI составят $20. Это базовый пример, а не финальный бюджет: во входной контекст входят системный промпт, история диалога и все найденные чанки. Если retrieval возвращает избыточно много текста, итоговый чек вырастет заметно быстрее, чем кажется по базовым тарифам.
Бесплатный тариф Workers Free включает 20,000 запросов к AI Search в месяц, 100 инстансов, 100,000 файлов на инстанс и краулинг 500 страниц сайтов в сутки. Максимальный размер одного файла — 4 MB. Тариф Workers Paid расширяет лимит до 5,000 инстансов, снимает ограничения на число ежемесячных запросов и дневной краулинг, а также позволяет хранить 1 миллион файлов на инстанс (или 500,000 при активном гибридном поиске). Лимит на размер файла в 4 MB сохраняется.
Cloudflare не публикует изолированных замеров задержек или тестов качества генерации конкретно для связки AI Search и этой модели. В документации описаны параметры архитектуры нейросети, но это ничего не говорит о поведении на ваших файлах. Прогоните контрольный набор вопросов с заранее известными ответами до релиза в прод, особенно если речь идет о юридических, финансовых, медицинских регламентах или инструкциях по авариям.
План действий
Переключайтесь на новую модель на этой неделе, если вы уже вызываете метод AI Search Chat Completions, хотите использовать стек моделей внутри Cloudflare и имеете тестовый набор типовых запросов. Зафиксируйте GLM-5.3 Flash на тестовом инстансе или переопределите модель на уровне отдельных запросов, после чего сравните выдачу, принятые ответы, расход токенов и задержку с вашей текущей моделью.
Подождите, если режим Smart Default полностью закрывает ваши требования по качеству и бюджету. Появление новой опции не обязывает проводить миграцию. Не спешите и в том случае, если проблемы кроются в индексации: замена генерирующей модели не исправит пропуски фактов и некорректное дробление исходных статей на чанки.
Обновление вас не затрагивает, если вы используете только эндпоинт Search, а генерацию строите на собственной инфраструктуре. Оно также не влияет на вас, если вы не работаете с AI Search. Сама по себе GLM-5.3 Flash доступна в каталоге Workers AI напрямую, но этот релиз интересен именно ее интеграцией в качестве генератора внутри AI Search.
Если вам нужны глубокие технические разборы инфраструктурных изменений и инструментов, подписывайтесь на рассылку.
3 сент. 2026 г.







