Мониторинг LLM в 2026 году: шесть платформ и расходы команды

Сравниваем Langfuse, LangSmith, Helicone, Arize Phoenix, Braintrust и Datadog: расходы на 100,000 запусков в месяц, размер команды и условия развёртывания.

Monday, October 5, 2026Omid Saffari
Мониторинг LLM в 2026 году: шесть платформ и расходы команды

Мониторинг LLM в небольшой команде с приложением в продакшене лучше всего начать с Langfuse. Эта платформа для трассировки и оценки качества при нагрузке в 100,000 запусков из расчёта ниже обходится в $69.80/месяц на Core без затрат на модели и вычисления для оценивания. Выбор меняется, если релизы зависят от проверок качества, нужен шлюз к моделям, развёртывание в своей инфраструктуре или разбор инцидентов в уже используемом Datadog.

Мониторинг LLM: какую платформу выбрать

Langfuse — отправная точка для общей панели продакшен-трейсов; LangSmith — для доработки агентов на LangChain; Helicone — для мониторинга запросов через шлюз; Arize Phoenix — для самостоятельной эксплуатации в закрытой инфраструктуре; Braintrust — для решений о релизе по результатам оценивания; Datadog Agent Observability — для инцидентов, затрагивающих разные части приложения. Размер команды особенно влияет на бюджет там, где платить нужно за каждого, кто разбирает сбои.

Трейс — запись одного запуска приложения. Спан — отдельная операция внутри этой записи: например, вызов модели, поиск данных или обращение к инструменту. Оценка качества, которую часто называют eval, проверяет, соответствует ли результат заданному правилу или стандарту. Все три нужны, чтобы понять, почему агент выдал правдоподобный ответ, хотя выполнил неверное действие.

Цены сверены с актуальными страницами тарифов самих поставщиков 5 октября 2026 года. Все суммы указаны в USD. Стартовые цены не включают дополнительное использование и оплату провайдерам моделей, если прямо не сказано обратное. Сравнение опирается на тарифы и документацию; оно не претендует на рейтинг производительности по результатам практического тестирования.

ИнструментКому подходитСтартовая цена платного тарифаБесплатный тариф / пробный период
LangfuseНебольшим командам с продакшеном, которым нужны общие трейсы и данные о расходахCore $29/месяц плюс единицы использованияHobby: 50k единиц/месяц, 2 пользователя; бесплатное ядро для своей инфраструктуры
LangSmithКомандам, которые уже дорабатывают агентов на LangChain или LangGraphPlus $39/пользователь/месяц плюс трейсыDeveloper: 1 пользователь, 5k базовых трейсов/месяц
HeliconeДля мониторинга запросов вместе со шлюзом к моделямPro $79/месяц плюс запросы и хранениеHobby: 10k запросов/месяц, 1 пользователь; для платных тарифов указан пробный период на 7 дней
Arize PhoenixДля закрытого развёртывания трассировки и оценивания с ответственным за инфраструктуруПлатные тарифы Phoenix не опубликованы; отдельный AX Pro $50/месяцPhoenix в своей инфраструктуре не требует платы за лицензию; AX Free включает 25k спанов/месяц
BraintrustДля общих наборов данных для оценивания и сравнения релизовPro $249/месяц; на Starter возможна оплата использованияStarter: 1 GB обработанных данных/месяц, 10k оценок, без лимита пользователей
Datadog Agent ObservabilityКомандам эксплуатации, которые связывают сбои агентов с работой сервисовPro $160/месяц при годовом договоре; $200 при помесячной оплате; $240 по ставке on-demandFree: 40k LLM-спанов/месяц, хранение 15 дней

Источники: тарифы Langfuse, тарифы LangSmith, тарифы Helicone, тарифы Arize, тарифы Braintrust и тарифы Datadog.

При сравнении важнее всего единица, за которую берут доплату. Платформа с оплатой за трейс приложения считает другой объём, чем сервис с оплатой за каждый вызов модели, наблюдение, оценку или гигабайт. Прежде чем сравнивать подписки, выясните, какие записи создаёт ваше приложение.

Сколько стоят 100,000 запусков агента в месяц

Для команды из пяти человек один и тот же агент при допущениях ниже может обойтись в $69.80 на Langfuse или в $645 на LangSmith. Эти суммы ничего не говорят о качестве платформ. Разницу создают способ подсчёта событий, включённый объём и плата за пользователей.

Возьмём явно заданную модель нагрузки в продакшене:

  • 100,000 полных запусков агента в месяц, по одному трейсу на запуск.
  • Пять наблюдаемых операций на запуск: корневой процесс, два вызова модели, один поиск данных и один вызов инструмента.
  • Всего 200,000 вызовов модели и 500,000 наблюдаемых операций.
  • 10,000 оценок, рассчитанных внешними программными проверками, по одной на каждый запуск в выборке. Дополнительные вызовы моделей и трейсы оценщиков в сценарий не входят.
  • Пять пользователей, которым нужен доступ к панели.
  • 5 GB обработанных данных в Braintrust и отдельно 5 GB учитываемого хранения в Helicone. Это независимые допущения: способы учёта байтов у поставщиков не взаимозаменяемы.

Так может работать агент поддержки: прочитать обращение, найти заказ, вызвать инструмент управления заказами и попросить модель подготовить итоговый ответ. Числа здесь — допущения для бюджета, а не замеры работающего приложения. Если агент повторяет операции, ветвится или запускает оценщиков внутри платформы, состав записей будет другим.

Запуск агента без оценки: процесс, два вызова модели, поиск данных и инструмент с разными единицами тарификации у поставщиков
Один запуск без оценки может учитываться как один трейс, шесть единиц Langfuse или два платных запроса к модели. У оценок свой счётчик.
Инструмент / тарифОбъём, который учитывается при оплатеРасчётная стоимость платформы в месяцЧто ещё учесть в бюджете
Langfuse Core610k единиц: трейсы + наблюдения + оценки$69.80Дополнительные события оценщиков увеличивают число единиц
LangSmith Plus100k базовых трейсов, 5 пользователей$645Продление хранения трейсов и работа оценщиков оплачиваются дополнительно
Helicone Pro200k записанных запросов к моделям, 5 GB храненияОценочно $146.25-$149.50Таблица тарифа и калькулятор по-разному учитывают хранение
Phoenix в своей инфраструктуреХранимые вами спаны и данные оценивания$0 за лицензию + ваша инфраструктураЦена размещённой инфраструктуры не подразумевается; для AX при таком объёме нужен индивидуальный расчёт
Braintrust Starter / Pro5 GB обработанных данных, 10k оценок$16 / $249Использование моделей и продление хранения оплачиваются отдельно
Datadog Pro200k оплачиваемых LLM-спанов$195 по годовой ставке; $242 при помесячной оплате; $290 по ставке on-demandДругие продукты Datadog и продление хранения оплачиваются отдельно

Расчёты сделаны по актуальным ставкам поставщиков, ссылки на которые приведены выше. Для LangSmith взята цена из текущей подсказки на странице тарифов: $0.005 за базовый трейс, при этом 10,000 трейсов включены на всю организацию. Диапазон Helicone сохраняет расхождение на его собственной странице: таблица тарифа включает 1 GB бесплатно, а калькулятор начисляет плату с первого гигабайта. У Phoenix нет лицензионной платы, зависящей от объёма; затраты на инфраструктуру нужно считать по реальным требованиям вашего развёртывания.

Не переносите эти суммы без пересчёта на агента с более длинными трейсами. Если вместо двух вызовов модели появляется цикл с повторными рассуждениями, Datadog и Helicone учитывают больше обращений к модели. Добавление наблюдений и сохранённых оценок увеличивает число единиц Langfuse. Более крупные документы при том же числе трейсов увеличивают объём обработанных данных Braintrust. В сравнении инструментов учёта токенов агентов подробнее разобрано, как относить расходы провайдера к клиенту или функции продукта.

По каким критериям отобраны платформы

Рейтинг начинается с покупки, которую небольшая команда с продакшеном может обосновать, а затем переходит к инструментам, чья ценность зависит от конкретного способа работы. Разработчикам и руководителю направления ИИ нужно разбирать неверные результаты, учитывать расходы по клиентам и превращать сбои в проверки перед релизом. Специализированный продукт может оказаться удачным выбором, даже если решает лишь одну из этих задач.

Каждая рекомендация опирается на пять критериев:

  1. Понятный учёт оплаты. Покупатель может определить, за что начисляется плата: трейсы, операции, пользователей, оценки или объём данных, — и увидеть бесплатный объём и следующий лимит.
  2. Полезная запись запуска в продакшене. Неудачный ответ можно связать с вызовами модели, поиском данных и работой инструментов, которые к нему привели.
  3. Процесс улучшения продукта. Запись помогает провести оценивание, собрать набор данных, поставить эксперимент или принять решение при проверке, а не остаётся отдельной строкой журнала.
  4. Чёткие условия развёртывания. Бесплатная установка в своей инфраструктуре, коммерческая корпоративная лицензия и контур данных в облаке заказчика описаны отдельно.
  5. Документированная инструментация. Поддержка OpenTelemetry оценивается по актуальным инструкциям поставщика, включая протокол и сопоставление полей там, где они указаны.

В подборку вошли шесть продуктов с разными задачами: универсальная платформа трассировки, процесс разработки вокруг фреймворка, шлюз, платформа с приоритетом локального развёртывания, сервис оценивания и комплекс для эксплуатации. Более широкий каталог увеличил бы число вариантов, но не помог бы решить именно эту задачу бюджета и ответственности. Сравнение не содержит утверждений о замеренной скорости приёма данных, удобстве интерфейса, доступности сервисов или точности оценивания.

«Бесплатно» здесь означает пригодный для работы включённый объём, а не обещание нулевого счёта навсегда. На Braintrust Starter и LangSmith Developer возможна плата за использование. У Phoenix лицензия может ничего не стоить, тогда как сопровождение базы данных и дежурства остаются существенными расходами. Подходящий бесплатный тариф — тот, чьи ограничения позволяют довести ваш эксперимент до конца.

Шесть инструментов: кому каждый подходит в продакшене

1. Langfuse: отправная точка для небольшой команды с продакшеном

Langfuse объединяет для небольшой команды трассировку, учёт токенов и расходов, управление промптами и оценивание; на Core плата за пользователей не взимается. SaaS-ассистент поддержки может привязать вызовы моделей к клиенту, процессу и релизу, а затем сопоставить дорогие сбои с успешными запусками. Главный фактор бюджета — количество сохранённых записей: один запуск агента создаёт трейс, несколько наблюдений и оценки. Выбирайте Langfuse, если хотите видеть трейс и расходы вместе и сохранить возможность позднее перенести платформу в свою инфраструктуру.

Актуальная страница цен Langfuse с тарифами Hobby, Core, Pro и Enterprise
Langfuse

Кому подходит: Небольшой или растущей продуктовой команде, где разработчики и руководитель направления ИИ должны разбирать одни и те же запуски в продакшене
Сильная сторона: Неограниченное число пользователей Core, расходы в контексте трейса и ядро для своей инфраструктуры под лицензией MIT
Цена: Core от $29/месяц; в платных тарифах Cloud использование дополнительно оплачивается в единицах
Пробный период: Для бесплатного Hobby не нужна банковская карта; это постоянный включённый объём, а не пробный доступ на ограниченный срок

Тарифы и ограничения, от которых зависит выбор

На актуальной странице цен указаны Hobby за $0, 50,000 единиц/месяц, два пользователя и 30 дней доступа к данным. Core стоит $29/месяц и включает 100,000 единиц, неограниченное число пользователей и 90 дней доступа к данным. Pro стоит $199/месяц при том же включённом объёме единиц, даёт три года доступа к данным, управление сроками хранения и более высокие ограничения скорости. Дополнительный модуль Teams для Pro стоит $300/месяц и добавляет корпоративный SSO, принудительное применение этих настроек и более детальные права доступа. Enterprise стоит $2,499/месяц, включает 100,000 единиц, журналы аудита, SCIM и договорные обязательства по сервису; при годовом договоре возможны индивидуальные ставки за объём.

Использование платного Cloud тарифицируется по диапазонам. Объём от 100,000 до одного миллиона единиц стоит $8 за 100,000; от одного до десяти миллионов — $7 за 100,000; от десяти до пятидесяти миллионов — $6.50 за 100,000. Пониженная ставка действует на единицы в соответствующем диапазоне. При переходе через границу уже использованный объём первого диапазона задним числом не дешевеет.

Лимит приёма данных у Core — 4,000 запросов/минуту, у Pro — 20,000 запросов/минуту. Это запросы на приём данных, а не единицы, за которые начисляется плата. Один пакет может содержать несколько сохраняемых событий. Проверяйте и месячный бюджет единиц, и всплески трафика, которые создаёт экспортёр.

Трейс Langfuse: учитывайте наблюдения и оценки

Трейс Langfuse описывает запуск, но формула тарификации выглядит так: трейсы + наблюдения + оценки. Для заданной нагрузки получается 100,000 + 500,000 + 10,000 = 610,000 единиц. Поэтому Core стоит $29 + 5.1 × $8 = $69.80/месяц. Тот же объём сохранённых данных на Pro обходится в $239.80/месяц.

Эта формула влияет на выбор того, что отслеживать. Поиск данных и вызов инструмента возврата денег дают важные сведения, хотя увеличивают число записей. Если убрать их ради экономии, причины сбоя могут остаться непонятными. Лучше осознанно выбирать, какие малоинформативные успешные запуски сохранять, и оставлять данные, нужные для диагностики дорогих или опасных ошибок.

Развёртывание, лицензия и OpenTelemetry

Self-hosted Open Source не требует лицензионной платы по MIT, не ограничивает использование и предоставляет основные API трассировки, оценивания, наборов данных и управления промптами. Self-hosted Enterprise использует коммерческую лицензию с индивидуальной ценой. На текущей странице тарифов сказано, что корпоративная цена Langfuse добавляется к соответствующему коммерческому тарифу ClickHouse. Облачная подписка и предложение на корпоративное развёртывание в своей инфраструктуре — разные покупки.

В документации OpenTelemetry указана поддержка OTLP через HTTP/JSON или HTTP/protobuf и отсутствие поддержки gRPC. Базовый адрес — /api/public/otel; аутентификация использует публичный и секретный ключи проекта через Basic auth. Для прямого приёма по текущему пути v4 с обработкой в реальном времени нужен заголовок x-langfuse-ingestion-version: 4. Без него документация предупреждает о задержке до десяти минут. Атрибуты пользователя, сессии, релиза и другие атрибуты трейса также нужно передавать в спаны, по которым вы будете фильтровать и агрегировать данные.

Это существенное требование к интеграции для команды платформы, которая уже отправляет gRPC в Collector. Collector может принимать один протокол и экспортировать другой, но последнее соединение с Langfuse должно соответствовать документированному HTTP-адресу и сопоставлению атрибутов. Приём данных без нужных метаданных клиента ещё не означает, что интеграция готова.

Langfuse и Python: начните с рекомендованного SDK

Поставщик рекомендует собственный SDK для Python: он управляет полями Langfuse, передачей контекста и экспортом. Следуйте актуальному руководству по началу трассировки, задайте ключи проекта и LANGFUSE_HOST для выбранного региона или своего развёртывания и поместите всю бизнес-операцию в используемый контекст наблюдения. Поиск данных и работу инструментов оставляйте внутри этого контекста, чтобы трейс сохранял сведения о причине неверного ответа.

По возможности используйте данные об использовании от провайдера. Учёт расходов Langfuse отдаёт приоритет переданной стоимости перед расчётом по ценам модели, а в Project Settings > Models можно задать собственные определения. Это важно, когда договор с провайдером предусматривает согласованную ставку или у внутренней модели нет публичной цены. Показанная оценка должна соответствовать коммерческой ставке, по которой вы управляете расходами.

Langfuse и LangChain: весь запрос в одном контексте

Интеграция с LangChain использует обработчик обратных вызовов, передаваемый в callbacks при вызове. Создайте контекст трейса для запроса целиком и разместите цепочку внутри него. Документация отдельно обращает внимание на фоновые события в очереди: короткоживущий процесс должен отправить накопленные данные или завершить работу экспортёра до выхода. В серверлесс-средах JavaScript дождитесь фоновых обратных вызовов, как указано в руководстве.

Первое внедрение стоит ограничить объёмом, который можно проверить вручную:

  1. Создайте проект трассировки для продакшена

    Выберите регион Cloud или адрес собственного развёртывания, создайте ключи проекта и настройте адрес по актуальному руководству. Записи продакшена должны быть отличимы от записей разработки.

  2. Проследите одну бизнес-операцию целиком

    Добавьте инструментацию корневого запроса, вызовов моделей, поиска данных и инструментов. Привяжите метаданные клиента, процесса, релиза и результата к нужным спанам; проверьте передачу обязательных атрибутов трейса.

  3. Сверьте расходы с ответом провайдера

    Откройте завершённый трейс и проверьте модель, использование и стоимость. Задайте собственные цены моделей, если расчёт по публичным ставкам не соответствует вашему договору.

  4. Сохраните оценку и проверьте учёт использования

    Оцените известный пример, убедитесь, что оценка привязана к нужному запуску, затем сравните количество трейсов, наблюдений и оценок с панелью Usage Management. Отправьте накопленные данные экспортёра до завершения короткоживущего обработчика.

Сильные стороны
Что получается хорошо
7 points

  • Core даёт доступ всем, кто участвует в проверке, без доплаты за пользователей
  • В одной записи можно объединить вызовы моделей, инструменты, поиск данных, расходы и оценки качества
  • Переданные расходы и собственные определения моделей учитывают согласованные и непубличные цены
  • Ядро под MIT позволяет развернуть платформу в своей инфраструктуре
  • Трейсы, наблюдения и сохранённые оценки расходуют включённый объём Cloud
  • Pro и модуль Teams могут увеличить фиксированную плату ещё до роста использования
  • Приёмник OTel требует экспорта по HTTP и правильной передачи атрибутов

2. LangSmith: для доработки агентов вокруг LangChain

LangSmith — платформа трассировки и оценивания для команды, которая уже разрабатывает и проверяет агентов через LangChain или LangGraph; инструментация других фреймворков тоже описана в документации. Руководитель разработки может связать сбой в продакшене с набором данных, оцениванием онлайн или офлайн, проверкой человеком и изменением промпта. Бюджет складывается из пользователей и трейсов: новые участники проверки увеличивают подписку, а объём трейсов оплачивается отдельно. Выбирайте LangSmith, если такой процесс разработки и оценивания оправдывает платный доступ для каждого участника проверки.

Тарифы LangSmith: Developer, Plus, Enterprise и плата за использование
LangSmith

Кому подходит: Команде разработки, которая уже выстраивает улучшение агентов вокруг LangChain или LangGraph
Сильная сторона: Трассировка, наборы данных, очереди разметки и оценивание онлайн и офлайн в одном продукте
Цена: Plus $39/пользователь/месяц, затем плата за трейсы и использование других продуктов
Пробный период: Developer даёт постоянный бесплатный объём для одного пользователя; превышение включённого числа трейсов оплачивается

Тарифы и общий включённый объём трейсов

Developer стоит $0 за пользователя в месяц, рассчитан на одного пользователя и включает 5,000 базовых трейсов/месяц, после чего действует оплата по использованию. Plus стоит $39 за пользователя в месяц, позволяет добавлять платных пользователей и включает всего 10,000 базовых трейсов в месяц. Калькулятор прямо указывает, что этот объём общий для всей организации. Цена Enterprise определяется индивидуально; тариф предоставляет гибридное развёртывание и установку в своей инфраструктуре, средства безопасности и условия поддержки.

В подсказке на текущей странице указаны 0.005 LangChain Standard Units за базовый трейс и 0.0025 за перевод трейса на продлённое хранение. Одна LSU равна $1, поэтому ставки составляют $0.005 за базовый трейс и $0.0025 за продление. Базовый срок хранения — 14 дней, продлённый — 180 дней. Цена за трейс, запомнившаяся по старому тарифу, не подходит для бюджета, который проверяется сегодня.

Для пяти пользователей Plus и 100,000 базовых трейсов счёт составит $195 за пользователей + $450 за дополнительные трейсы = $645/месяц. Продление хранения 10,000 трейсов добавит $25: получится $670 без вычислений оценщиков и использования других продуктов. Продление сохраняет запись дольше; оно не предоставляется бесплатно вместе с Plus.

У Tuned Evaluators есть отдельная опубликованная ставка: 0.015 LSU за успешный запуск оценивания Perceived Error. В подсказке сказано, что Tuned Evaluator, добавляющий обратную связь, также переводит трейс на продлённое хранение. Для Deployment, Engine, Fleet и Sandboxes действуют отдельные правила использования. Если покупателю нужна только наблюдаемость, бюджет следует ограничить этим сервисом: платный пользователь не получает за эту цену среду выполнения агентов со всем включённым.

Почему число пользователей меняет выбор

Пять разработчиков, которые разбирают трейсы, — один сценарий; те же разработчики вместе с более широкой группой продуктовой проверки и контроля качества — другой. При тех же 100,000 базовых трейсов пятнадцать пользователей Plus стоят $1,035/месяц: плата за пользователей вырастает до $585, а за дополнительные трейсы остаётся $450. Дополнительные пользователи не увеличивают общий бесплатный объём трейсов.

Расходы оправданы, когда каждый участник регулярно превращает трейсы в исправленные промпты, наборы данных или решения о релизе. Обосновать их сложнее, если большинству лишь изредка нужен доступ к панели расходов. Определите, кто должен смотреть исходные записи, кому достаточно выгруженного результата и какой процесс делает подписку полезной.

Коммерческое развёртывание в своей инфраструктуре и OpenTelemetry

LangSmith в своей инфраструктуре — дополнение к Enterprise, требующее коммерческого лицензионного ключа. Установка включает сервисы интерфейса и бэкенда, а также ClickHouse, PostgreSQL и Redis; для продакшена руководство рекомендует внешние сервисы хранения. Это корпоративная система, которую предстоит эксплуатировать, а не бесплатная серверная лицензия, подразумеваемая наличием открытого фреймворка.

В руководстве OpenTelemetry описаны трейсы совместимых приложений, стандартные сопоставления атрибутов и разветвление экспорта Collector: один поток спанов направляется в несколько бэкендов. Пользователи LangChain и LangGraph могут включить интегрированный путь с помощью LANGSMITH_OTEL_ENABLED=true вместе с трассировкой. Стандартный HTTP-экспортёр использует базовый адрес https://api.smith.langchain.com/otel, аутентификацию x-api-key и необязательный заголовок Langsmith-Project.

Обратите внимание на форму адреса. Общая переменная базового адреса OTLP позволяет HTTP-экспортёру добавить /v1/traces, а переменная адреса именно для трейсов содержит полный путь. Если добавить путь сигнала в обеих настройках, URL получится неверным. Прежде чем считать экспорт OTel готовым, найдите тот же трейс в выбранном проекте и проверьте модель, входные и выходные данные и связи родительских и дочерних спанов.

Сильные стороны
Что получается хорошо
7 points

  • Для LangChain и LangGraph документирован интегрированный путь трассировки
  • Наборы данных, очереди разметки и оценивание онлайн и офлайн поддерживают определённый процесс улучшения
  • Приём OTel и разветвление экспорта Collector подходят приложениям за пределами одного фреймворка
  • Enterprise даёт лицензионную возможность эксплуатировать бэкенд в своей инфраструктуре
  • Каждый участник проверки на Plus стоит $39/месяц, включая приглашённых пользователей, учитываемых как платные места
  • Включённый объём трейсов общий, а не отдельный для каждого пользователя
  • Продлённое хранение трейсов и специализированные оценщики оплачиваются дополнительно

3. Helicone: когда нужен прежде всего шлюз

Helicone сочетает мониторинг запросов со шлюзом к моделям ИИ — сервисом, который пересылает запросы и применяет маршрутизацию и связанные настройки. Небольшое приложение, которому прежде всего нужно разбирать запросы к провайдерам, управлять резервными маршрутами и группировать расходы на модели, может получить полезные записи на этом уровне. Главное ограничение — разница между шлюзом и агентом целиком: запись запроса к модели всё равно требует контекста приложения, чтобы объяснить поиск данных и работу бизнес-инструментов. Выбирайте Helicone, если шлюз уже предусмотрен архитектурой, а первоочередная задача — мониторинг запросов.

Страница цен Helicone с тарифами Hobby, Pro, Team, Enterprise и калькулятором использования
Helicone

Кому подходит: Продуктовой команде, которой нужны одновременно мониторинг запросов и функции шлюза
Сильная сторона: Шлюз, совместимый с OpenAI, и отдельный путь асинхронной записи журналов
Цена: Pro $79/месяц плюс плата за записанные запросы и хранение по диапазонам
Пробный период: Hobby бесплатный; для Pro и Team указан бесплатный пробный период на 7 дней

Тарифы и ограничения при всплесках нагрузки

На текущей странице цен указаны Hobby за $0, 10,000 запросов/месяц, 1 GB хранения, один пользователь, одна организация и семь дней хранения. Pro стоит $79/месяц, добавляет неограниченное число пользователей, уведомления, отчёты и собственный язык запросов HQL; данные хранятся один месяц. Team стоит $799/месяц и добавляет пять организаций, три месяца хранения, выделенный канал Slack и заявленные на странице возможности по соблюдению требований. Enterprise рассчитывается индивидуально и предусматривает SAML SSO, развёртывание на площадке заказчика и индивидуальные условия договора.

В таблице платных тарифов включены 10,000 бесплатных запросов и 1 GB бесплатного хранения, после чего начисляется плата за использование. Опубликованный лимит приёма Hobby — 10 записей журнала/минуту, тогда как у Pro — 1,000, Team — 15,000, Enterprise — 30,000. Месячного объёма может хватать, но всплеск уже превысит лимит приёма. Обработчику документов из очереди, который отправляет много записей одновременно, нужно проверить пропускную способность наряду с месячным количеством.

Переход с Pro на Team добавляет $720/месяц без использования. Покупайте его ради требований к организациям, хранению и поддержке, которые он закрывает. Сам по себе рост числа запросов не делает этот переход неизбежной следующей статьёй расходов.

Плата за запросы и расхождение по хранению

Калькулятор на странице цен использует ставки по диапазонам: первые 10,000 запросов бесплатны, следующие 20,000 стоят $0.0007 каждый, следующие 60,000 — $0.00035 каждый, а запросы с 90,001 по 250,000 — $0.000175 каждый. При дальнейшем росте объёма опубликованные ставки снижаются до $0.0000875, $0.00004375 и $0.00002 за запрос. Эти данные взяты из собственного калькулятора Helicone, а не из сравнения другого поставщика.

При 200,000 записанных запросов к моделям плата за запросы равна $14 + $21 + $19.25 = $54.25. Вместе с Pro получается $133.25 без хранения. Учитывайте оба вызова модели в примере агента: если назвать нагрузку приложения 100,000 «запросов», этот счётчик будет занижен.

Ставки хранения в калькуляторе начинаются с $3.25/GB за первые 30 GB, затем в более крупных диапазонах действуют $2/GB, $1.25/GB, $0.75/GB и $0.50/GB. Однако первый диапазон калькулятор оплачивает с нуля, хотя таблица тарифа обещает бесплатный гигабайт. При 5 GB учитываемого хранения вычитание включённого объёма даёт $13 за хранение, а расчёт по калькулятору — $16.25. Поэтому итоговая оценка Pro составляет $146.25-$149.50.

Шлюз, асинхронная запись и границы поддержки OTel

В руководстве по запуску шлюза используется совместимый с OpenAI клиент с адресом https://ai-gateway.helicone.ai, автоматической записью запросов и резервными маршрутами. Можно подключить и собственные ключи провайдеров. Расходы на провайдера моделей оплачиваются отдельно от подписки наблюдаемости и записи запросов.

Руководство Proxy versus Async прямо объясняет архитектурный выбор. Интеграция через прокси помещает Helicone на путь запроса и предоставляет функции шлюза: кеширование, управление повторами и собственные ограничения частоты. Асинхронная запись находится вне этого критического пути, но не даёт тех же средств управления прокси. Прежде чем сравнивать сложность настройки, решите, нужно ли пересылать запросы через сервис или наблюдать за ними в фоне.

Для OpenTelemetry у Helicone документирована интеграция OpenLLMetry Async. В текущих примерах используются средства записи @helicone/async и helicone-async. Это подтверждает конкретный описанный путь интеграции; приведённое руководство не содержит конфигурации универсального приёмника OTLP для Collector. Если требование звучит как «заменить только экспортёр Collector», проверяйте именно такой маршрут: интеграция, связанная с OTel, сама по себе не делает сервис взаимозаменяемым бэкендом OTLP.

Развёртывание в своей инфраструктуре поддерживает ручную установку, Docker Compose, Kubernetes и облако. Лицензия репозитория — Apache 2.0. Выделенная поддержка и корпоративные услуги обсуждаются отдельно. У небольшой команды регулярные расходы на эксплуатацию системы могут превысить счёт за телеметрию, даже если лицензия бесплатна.

Внедрение должно помочь ответить на вопрос о работе приложения. Привяжите идентификаторы процесса и клиента, отправьте известный вызов модели, разберите запись и убедитесь, что сессия объединяет нужные вызовы. Затем повторите проверку с повторным запросом или неудачным ответом. Данные шлюза становятся полезными для продакшена, когда по ним можно понять, какая бизнес-операция вызвала дополнительную работу модели.

Сильные стороны
Что получается хорошо
8 points

  • Pro включает неограниченное число пользователей для совместного мониторинга запросов
  • Шлюз и асинхронный путь позволяют решить, нужен ли сервис на пути запроса
  • Плату за запросы по диапазонам можно рассчитать по актуальной странице поставщика
  • Apache 2.0 и документированные варианты развёртывания позволяют работать в своей инфраструктуре
  • Запросы к моделям и полные запуски агента — разные единицы
  • Опубликованный бесплатный объём хранения и калькулятор требуют сверки
  • Асинхронная запись не даёт управления кешированием, повторами и частотой запросов, доступного у шлюза
  • Приведённое руководство не подтверждает универсальный маршрут приёма OTLP из Collector

4. Arize Phoenix: закрытая трассировка с ответственным за инфраструктуру

Arize Phoenix — платформа трассировки, оценивания и экспериментов с приоритетом локального развёртывания, которую можно запустить в своей инфраструктуре без лицензионной платы. Инженер платформы, разбирающий работу ассистента с поиском данных, может изучить вызовы моделей, найденный контекст и действия инструментов, затем собрать сбои в набор данных и сравнить исправленное приложение. Главное условие — ответственность: кто-то должен эксплуатировать сервис и понимать ограничения лицензии. Выбирайте Phoenix, если закрытое и контролируемое развёртывание трассировки и оценивания достаточно важно, чтобы назначить ответственного за инфраструктуру.

Документация Arize Phoenix: трассировка, оценивание, промпты, наборы данных и эксперименты
Arize Phoenix

Кому подходит: Технической команде, которая хочет самостоятельно эксплуатировать бэкенд трассировки и оценивания
Сильная сторона: Трейсы OTLP и инструментация OpenInference вместе с локальными наборами данных и экспериментами
Цена: Развёртывание Phoenix в своей инфраструктуре не требует платы за лицензию; на текущей странице Arize платные тарифы Phoenix не опубликованы
Пробный период: Phoenix в своей инфраструктуре бесплатен в рамках лицензии; у Arize AX есть отдельный бесплатный тариф

К чему относится цена $50: тариф AX и условия Phoenix

На текущей странице цен Arize опубликованы тарифы AX, а Phoenix отдельно описан как платформа с приоритетом локального развёртывания. AX Free включает 25,000 спанов трейсов/месяц, 1 GB принимаемых данных/месяц, хранение 15 дней и неограниченное число пользователей и оцениваний. AX Pro стоит $50/месяц и включает 50,000 спанов, 10 GB принимаемых данных/месяц, хранение 30 дней и неограниченное число пользователей и оцениваний. AX Enterprise рассчитывается индивидуально: объём и хранение согласуются отдельно, доступны SaaS и развёртывание в своей инфраструктуре.

На этой странице нет опубликованной цены платного экземпляра Phoenix или ставок за превышение его объёма. Указание «Phoenix за $50/месяц» смешало бы два продукта. Если нужен сервис Arize с эксплуатацией на стороне поставщика, оценивайте AX с его лимитами спанов и байтов; если нужен Phoenix, закладывайте бюджет на инфраструктуру, которую будете обслуживать.

В смоделированном приложении 500,000 спанов — это в десять раз больше включённого объёма AX Pro. На публичной странице нет ставки превышения для такого случая, поэтому нужен индивидуальный расчёт, а не экстраполяция цены. При пяти спанах на запуск включённый объём AX Free соответствует 5,000 запусков, а Pro — 10,000, если соблюдены также ограничения по байтам и остальные условия.

При таком объёме лицензионная плата за Phoenix в своей инфраструктуре остаётся нулевой. Из этого не следует, что хранение 500,000 спанов ничего не стоит. Выберите политику хранения, оцените размер передаваемых данных, учтите резервные копии и назначьте ответственного за обновления и восстановление. Сценарии «мы уже обслуживаем эту инфраструктуру» и «нам нужна новая закрытая платформа» дадут разные совокупные расходы.

Лицензия: какие условия действуют для бэкенда

Текущая лицензия репозитория бэкенда Phoenix — Elastic License 2.0. Она разрешает использование с установленными ограничениями и запрещает предоставлять существенную функциональность продукта третьим лицам как размещённый или управляемый сервис. Также ограничены обход функций лицензионного ключа и удаление лицензионных уведомлений. Эти условия отличаются от MIT для ядра Langfuse и Apache 2.0 для Helicone.

Учитывайте это в формулировках закупки. «Код доступен», «бесплатно для нашего развёртывания» и «разрешительная лицензия для переупаковки в сервис» — разные утверждения. Здесь Phoenix рекомендуется для трассировки и оценивания вашего приложения; право перепродавать Phoenix как размещённый сервис не подразумевается.

Руководство по развёртыванию указывает, что при установке в своей инфраструктуре у Phoenix нет лицензионной платы, ограничений использования или функций, закрытых тарифом; возможна полностью изолированная работа без внешних соединений. Описаны запуск из терминала, Docker/Compose, Kubernetes/Helm и облачные варианты. Закрытой установке всё равно нужны подходящие для хранимых данных настройки и план восстановления.

OpenTelemetry и процесс оценивания

Phoenix принимает трейсы OTLP и построен вокруг OpenTelemetry и инструментации OpenInference. Документированная запись включает вызовы моделей, поиск данных, инструменты и собственную логику. Для оценивания доступны модели-судьи, программные проверки и разметка людьми. Наборы данных и эксперименты позволяют запускать разные версии приложения на одних входных данных, а инструменты промптов поддерживают версии и повторное выполнение.

В руководстве по настройке трассировки предлагаются phoenix.otel для Python и @arizeai/phoenix-otel для TypeScript, а также организация по проектам и сессиям. Команде с Collector нужно проверить в Phoenix те же реальные семантические поля, которые она использует в других системах. Сохранить ID трейса полезно; сохранить сведения о том, какая операция нашла неверный контекст, — значит получить материал для исправления.

Для ассистента с поиском данных начните с известного сбоя: модель уверенно ответила по нерелевантному документу. Проверьте, содержит ли спан поиска сведения, позволяющие отличить проблему поиска от проблемы генерации ответа. Сохраните входные данные и ожидаемое поведение в наборе данных, измените одну настройку поиска или промпта и сравните результат. Воспроизводимый пример связывает наблюдение за проблемой с предотвращением её повторения.

Сильные стороны
Что получается хорошо
7 points

  • В руководстве не указаны лицензионная плата или верхний предел использования для своей инфраструктуры
  • Документация предусматривает полностью изолированное развёртывание
  • OTLP и OpenInference связывают трассировку с распространёнными способами инструментации
  • Наборы данных, эксперименты и разные виды оценивания помогают проверять регрессии
  • У ELv2 есть ограничения, которые скроет упрощённое описание как разрешительной лицензии
  • За инфраструктуру, хранение, обновления и восстановление отвечает ваша организация
  • Цены и лимиты платного AX не описывают платную подписку Phoenix

5. Braintrust: когда релиз решают по результатам оценивания

Braintrust — платформа оценивания и наблюдаемости для команды, которая принимает решения о релизе по оценённым примерам, наборам данных и экспериментам. Руководитель ИИ-продукта, сравнивающий версии промпта, может изучить трейсы и понять, прошёл ли новый результат те же проверки, что и прежний. Основу бюджета составляют обработанные данные и оценки; сверху добавляются вычисления моделей и продлённое хранение. Выбирайте Braintrust, если у процесса оценивания есть ответственный и результаты влияют на релизы; начинайте со Starter, если его лимиты и возможности подходят.

Тарифы Braintrust: Starter, Pro и Enterprise с учётом обработанных данных и оценок
Braintrust

Кому подходит: Команде ИИ-продукта, которая поддерживает наборы данных для оценивания и критерии выпуска
Сильная сторона: Starter не ограничивает пользователей, проекты, наборы данных, площадки для пробных запусков и эксперименты
Цена: На Starter плата за платформу $0, использование оплачивается; Pro стоит $249/месяц плюс использование
Пробный период: Starter предоставляет постоянный бесплатный объём; для начала не нужна банковская карта

Тарифы и два счётчика использования

На Starter месячная плата за платформу составляет $0; включены 1 GB обработанных данных/месяц, затем $4/GB; 10,000 оценок/месяц, затем $2.50 за 1,000; хранение 14 дней и $10 ежемесячных кредитов на модели. Число пользователей, проектов, наборов данных, площадок для пробных запусков и экспериментов не ограничено. Поэтому потребность команды в общем пространстве оценивания ещё не означает потребности в Pro.

Pro стоит $249/месяц и включает 5 GB обработанных данных, затем $3/GB; 50,000 оценок, затем $1.50 за 1,000; хранение 30 дней, с оплатой дополнительного хранения по $0.50/GB/месяц; и $100 ежемесячных кредитов на модели. Он добавляет собственные графики, среды, ролевое управление доступом и приоритетную поддержку. Enterprise рассчитывается индивидуально: согласуются хранение и экспорт, поддержка и условия размещения у заказчика или поставщика.

Оценка — это оценённый результат, полученный моделью-судьёй, автоматизированной проверкой или собственным программным оценщиком. Плата за хранение или обработку оценки отличается от платы за вычисления, которые её создали. Включённые кредиты на модели имеют собственную область применения; они не компенсируют любые счета провайдеров за ваши приложения.

При заданных 5 GB и 10,000 оценок на Starter получается $16 за превышение объёма данных, без доплаты за оценки. Pro стоит $249 до дополнительного использования. Если сейчас нужны общий набор данных, эксперименты и трейсы в пределах возможностей бесплатного тарифа, переход за $249 должен объясняться функциями или сроком хранения.

Когда более низкие ставки начинают влиять на итог

При 100,000 оценок/месяц и тех же 5 GB обработанных данных Starter стоит $241, а Pro — $324, без использования моделей и продления хранения. Более низкая ставка Pro сама по себе не перекрывает фиксированную плату.

При том же допущении по объёму данных равенство стоимости только по использованию достигается на 183,000 оценок/месяц: оба тарифа стоят $448.50. В расчёт не включены различия в кредитах на модели, хранении и возможностях — они могут оправдать более ранний переход. Это ориентир для бюджета, а не совет откладывать нужное управление доступом.

Практический вопрос — какие проверки оправдывают расходы. Процессу поддержки может понадобиться детерминированная проверка аргументов инструмента на каждом запуске и оценка качества ответа моделью на выборке. У этих проверок разные задачи и разные вычислительные затраты. Поддерживайте известный набор данных для релизов, затем проверяйте выборку из продакшена, чтобы находить сбои, которых набор данных не предусматривал.

Высокая средняя оценка не должна подменять решение о выпуске. Группируйте примеры по процессу и результату, чтобы улучшение простых ответов не скрывало регрессию в сложном действии, важном для клиентов. Это практика оценки качества, а не утверждение, что какая-либо платформа автоматически даст правильные критерии.

Приём OTel и коммерческое размещение контура данных

В интеграции OpenTelemetry документированы экспортёр трейсов OTLP, обработчик спанов Braintrust, экспортёр журналов и пересылка журналов через Collector. Базовый адрес API — https://api.braintrust.dev/otel; аутентификация и заголовок x-bt-parent=project_id:... направляют данные в нужный проект. Адреса для отдельных сигналов включают путь трейсов или журналов. Отдельный пакет @braintrust/otel обеспечивает документированную интеграцию JavaScript.

По инструкциям сопоставления полей проверьте входные и выходные данные и метаданные после приёма. То, что строка журнала и спан приложения оба приняты, не делает их равнозначными записями для оценивания. Убедитесь, какой объект станет входными данными для запланированного эксперимента.

В условиях развёртывания BYOC и установка в своей инфраструктуре доступны только на Enterprise. Это покупка коммерческой платформы, а не открытая лицензия бэкенда. В частности, руководство по архитектуре оставляет контур управления, включающий интерфейс, аутентификацию и управляющие метаданные, в SaaS Braintrust. Контур данных, где находятся трейсы, наборы данных и другие данные ИИ, может работать в вашем облачном аккаунте. Браузер обращается прямо к этому контуру данных.

Для некоторых закупок это решающее различие. Контроль над местом хранения промптов и ответов может удовлетворить требование к размещению данных, но зависимость от контура управления поставщика остаётся. Организации, которой нужны все компоненты продукта без внешних соединений, перед заключением договора следует сопоставить эту архитектуру с документированным изолированным развёртыванием Phoenix.

Сильные стороны
Что получается хорошо
8 points

  • Starter даёт общее пространство оценивания без платы за пользователей
  • Включённые объёмы данных и оценок показывают отдельные части бюджета
  • Pro предоставляет понятное расширение возможностей графиков, сред, доступа и хранения
  • Документированные пути OTel позволяют принимать существующий поток инструментации
  • Большие объёмы передаваемых данных и число оценок создают независимые расходы на использование
  • Более низкие ставки Pro не всегда компенсируют подписку за $249
  • Вычисления моделей-судей и продлённое хранение требуют отдельного бюджета
  • Размещение данных в своей инфраструктуре не переносит туда контур управления SaaS

6. Datadog Agent Observability: для команды, которая уже работает в Datadog

Datadog Agent Observability — нынешнее название поставщика для продукта, который часто ищут как Datadog LLM Observability; лучше всего он подходит команде, уже разбирающей инциденты приложения в Datadog. Тайм-аут агента поддержки может быть связан с вызовом модели, медленным сервисом или проблемой пользовательской сессии. Ценность платформы — в связи записи агента с этим более широким контекстом эксплуатации. На бюджет влияют срок договора, хранение и стоимость других нужных продуктов Datadog. Выбирайте этот вариант, если ответственные за инциденты уже работают в Datadog и общий контекст помогает расследованию.

Цены Datadog Agent Observability и включённые объёмы LLM-спанов на Free и Pro
Datadog Agent Observability

Кому подходит: Команде SRE или платформы, которая связывает сбои ИИ с инцидентами приложения и инфраструктуры
Сильная сторона: Оплата за LLM-спаны, а не за каждую операцию поиска, инструмента или процесса
Цена: Pro $160/месяц при годовом договоре, $200 при помесячной оплате или $240 по ставке on-demand, затем плата за дополнительные LLM-спаны
Пробный период: Free включает 40,000 LLM-спанов/месяц; на странице цен также предлагается регистрация для пробного доступа

Сколько стоит Datadog LLM Observability

На текущей странице цен указаны Free за $0, 40,000 LLM-спанов/месяц, хранение трейсов 15 дней, неограниченный контекст и оценивания и доступ ко всем функциям. Pro включает 100,000 LLM-спанов/месяц, также с хранением трейсов 15 дней. Базовая цена — $160/месяц при годовой оплате, $200 при помесячной оплате или $240 по ставке on-demand.

Дополнительные LLM-спаны стоят $3.50 за 10,000 по годовой ставке, $4.20 при помесячной оплате или $5 по ставке on-demand. Для 200,000 LLM-спанов расчётные итоги составляют соответственно $195, $242 и $290. Сравнивайте условия договора явно: цена, вынесенная в заголовок для годовой оплаты, отличается от помесячного счёта.

Оплачиваемая единица — вызов модели, а не каждая операция трейса. По данным поставщика, спаны инструментов, поиска данных и окружающего процесса не тарифицируются как LLM-спаны. При двух вызовах модели на запуск объём Free соответствует 20,000 полных запусков при соблюдении остальных условий тарифа. Расширение инструментации инструментов не обязательно увеличит число платных LLM-спанов, а цикл рассуждений с повторными вызовами модели увеличит.

Продлённое хранение доступно, но публичная страница не даёт ставки для его расчёта в этом сравнении. Запросите цену, если нужно разбирать более старые инциденты. Запись со всей инструментацией, срок хранения которой истёк, уже не поможет при последующем споре с клиентом.

Datadog AI Observability в существующей системе эксплуатации

Agent Observability приобретается отдельно; по словам поставщика, другие подписки Datadog не требуются. Страница цен также описывает дополнительную пользу сопоставления с APM, мониторингом инфраструктуры и Real User Monitoring, если вы используете эти продукты. При внедрении с нуля закладывайте их в бюджет отдельно: подписка наблюдаемости не включает остальные сервисы Datadog.

На опубликованных тарифах продукт включает наборы данных, эксперименты, оценивание, аннотации и панели. В представлении расходов использование разбито по провайдеру, модели и идентификатору или версии промпта; расходы доступны на трейсах и спанах. Это помогает ответственному за инцидент отличить рост трафика от изменения объёма работы моделей в приложении.

Руководителю платформы стоит проверить эту связь на конкретном примере. Начните с неудачного запуска агента и проследите запрос до сервиса, ответственного за результат инструмента. Проверьте, сохраняется ли идентификатор трейса при переходе между системами и может ли специалист отделить задержку модели от времени, потраченного в других компонентах. Ценность покупки определяется этим процессом; отдельный график расходов её не докажет.

Лицензирование SaaS и OpenTelemetry

Datadog предоставляет продукт как коммерческий SaaS по договору подписки. В условиях указано, что размещённый сервис регулируется MSA. Текущая страница продукта не предлагает бэкенд Agent Observability для установки в своей инфраструктуре. Самостоятельный запуск Datadog Agent или OTel Collector не означает, что вы размещаете у себя хранилище, интерфейс и платформу оценивания.

Руководство OpenTelemetry предусматривает приём трейсов по семантическим соглашениям GenAI версии 1.37 или новее либо по поддерживаемым соглашениям OpenInference. Описан прямой приём без Datadog Agent или SDK Agent Observability. Показанный экспортёр использует OTLP/HTTP protobuf с заголовками dd-api-key и dd-otlp-source=llmobs.

Для внешних оценок есть отдельное требование интеграции: документация требует для спанов OTel тег source:otel и ID трейса и спана в виде строк с десятичными числами. Исходные ID OTel шестнадцатеричные, поэтому перед отправкой их нужно преобразовать. Проверьте одну оценку на известном трейсе: совместимость трассировки сама по себе не гарантирует автоматическую привязку оценок.

Сильные стороны
Что получается хорошо
8 points

  • В опубликованном учёте объёма участвуют только LLM-спаны; спаны инструментов и поиска данных исключены
  • Команда, уже работающая в Datadog, может связать записи агентов с более широким контекстом продакшена
  • Free и Pro включают перечисленные функции оценивания и экспериментов
  • Прямой приём OTel документирован без обязательного Datadog Agent
  • Самая низкая рекламируемая ставка требует годового договора
  • На обоих опубликованных тарифах трейсы хранятся 15 дней
  • Другие сервисы Datadog приобретаются отдельно
  • Продукт представляет собой коммерческий бэкенд у поставщика; сервер наблюдаемости для своей инфраструктуры не предлагается

Что выбрать командам разного размера

Сначала определите, кто должен принимать решения по записям, затем — какой счётчик растёт вместе с приложением. Численность влияет на бюджет, но не отвечает на вопрос об ответственном: это разработчик, руководитель ИИ-продукта или специалист по инцидентам.

Один или два разработчика: Начните с бесплатного объёма, который позволит завершить первую проверку продакшена. Langfuse Hobby даёт общий доступ двум людям, хотя его 50,000 единиц быстро расходуются, если каждый запуск создаёт несколько операций. LangSmith Developer подходит одному пользователю. Braintrust Starter привлекателен, если цель уже состоит в поддерживаемом наборе данных и проверке релиза по оценкам. Phoenix подходит при осознанном решении самостоятельно эксплуатировать бэкенд.

От трёх до десяти человек: Langfuse Core — основной вариант, когда нескольким разработчикам и владельцу продукта нужен регулярный доступ. Braintrust Starter может стоить дешевле, если ограничения данных, оценок, хранения и функций подходят процессу, построенному вокруг оценивания. Helicone Pro оправдывает цену, когда в покупку входят функции шлюза и мониторинга запросов. LangSmith Plus оправдывает оплату пользователей, когда участники проверки активно используют его процесс разработки.

Более широкая группа проверки из разных подразделений: Посчитайте каждого платного пользователя LangSmith, прежде чем добавлять в рабочее пространство специалистов по качеству, продукту или поддержке. Тарифы без ограничений пользователей могут сохранять размер подписки при расширении участия. Объём трейсов, байтов и оценок всё равно придётся контролировать. Другой выбор становится оправданным, когда конкретный процесс платформы экономит больше труда на проверках или предотвращает больше повторных сбоев, чем стоит разница подписок.

Команда SRE или платформы, уже использующая Datadog: Отдайте предпочтение Datadog, если инцидент агента нужно разбирать вместе с сервисами и пользовательскими сессиями. Уже назначенные ответственные и контекст трейсов могут снизить пользу отдельной специализированной консоли. Его более узкий учёт только LLM-спанов также заслуживает внимания, если у агента много операций без вызова модели.

Требование к размещению в закрытой инфраструктуре: У Phoenix и Langfuse существенно различаются лицензии и варианты развёртывания; Helicone добавляет вариант под Apache. Установка LangSmith и Braintrust в своей инфраструктуре предусматривает коммерческие корпоративные условия. Контур данных Braintrust у заказчика всё равно использует контур управления поставщика. Прежде чем выбирать дешёвый тариф, решите, что именно должно оставаться в вашей инфраструктуре.

Правило выбора: платите за процесс, который меняет решение в продакшене, затем прогнозируйте создаваемые этим процессом записи и число участников. Если такое решение назвать нельзя, начните с более ограниченного внедрения.

OpenTelemetry: проверьте маршрут и сохранность полей

Поддержка OpenTelemetry полезна, только если важные поля приложения сохраняются после приёма данных. OTel — стандартная система инструментации; OTLP — протокол передачи её телеметрии. Поток спанов может успешно дойти до бэкенда, но потерять идентификатор модели, использование, контекст клиента или связь инструмента с вызывающей его операцией.

Документированные маршруты различаются. Langfuse принимает HTTP JSON или protobuf по адресу OTLP и указывает, что gRPC не поддерживается. LangSmith принимает трассировку OTel с сопоставлением атрибутов GenAI, OpenInference и других систем, а также описывает разветвление экспорта Collector. Phoenix принимает OTLP и использует инструментацию OpenInference. Braintrust документирует пути приёма трейсов, обработки спанов и журналов. Datadog указывает поддерживаемые соглашения GenAI или OpenInference. Helicone описывает асинхронную интеграцию OpenLLMetry; приведённое руководство не подтверждает наличие универсального приёмника OTLP для Collector.

Чтобы проверить пригодность, сохраните один характерный запуск на всём пути. Убедитесь, что дошли связи родительских и дочерних спанов, имя модели, токены, расходы, политика работы с входными и выходными данными и метаданные релиза. Если участвуют два сервиса, проверьте передачу контекста между ними. Если платформа группирует разговоры в сессии, проверьте идентификатор сессии: общий ID трейса не обязательно охватывает весь разговор.

Внимательно проверьте переменную адреса. Общий базовый адрес и адрес для сигнала трейсов задаются по-разному. Следуйте инструкциям поставщика по региону, аутентификации и пути. Затем проверьте запись в целевом проекте: успешный HTTP-ответ подтверждает приём, но не правильную привязку к бизнес-контексту.

Наконец, проверьте дублирующие пути экспорта. Обработчик обратных вызовов фреймворка и отдельная библиотека автоматической инструментации могут наблюдать один и тот же вызов модели. Прежде чем объявлять о скачке расходов, выясните, выросла ли работа модели или она записана дважды. Сравнение инструментов анализа сбоев поможет связать полученный трейс с конкретным вопросом диагностики.

В каких случаях покупка не оправдана

Избегайте покупки, которая не решает вашу задачу, даже если продукт вошёл в подборку. Ниже — конкретные несоответствия документированным условиям оплаты или эксплуатации.

  • LangSmith Plus только ради общей панели расходов: Для заданной нагрузки команды из пяти человек он стоит $645 без продления хранения и вычислений оценщиков. Платите эту сумму, если процесс улучшения входит в задачу; расширение списка участников проверки должно иметь понятную цель.
  • Braintrust Pro при небольшом объёме оценивания, который подходит Starter: Расчётный счёт Starter — $16 против $249 на Pro. Переход ради функций, хранения или поддержки должен быть осознанным.
  • Бюджет закупки «Phoenix за $50»: Эта цена относится к AX Pro. Для нагрузки из примера опубликованного объёма спанов AX недостаточно, а ставка превышения не указана. Эксплуатируемая вами инфраструктура Phoenix требует другого бюджета.
  • Helicone Hobby для обработчика с резкими всплесками в продакшене: Включённые 10,000 запросов в месяц не отменяют опубликованный лимит приёма 10 записей журнала/минуту. Прежде чем опираться на бесплатный тариф, проверьте характер трафика.
  • Годовая цена Datadog для согласования помесячного бюджета: $160 — базовая цена по годовой ставке; помесячная база составляет $200, а расчётный итог по помесячной ставке — $242.
  • Любое развёртывание в своей инфраструктуре без ответственного: Бесплатная лицензия не назначает того, кто восстановит резервную копию, обновит систему или организует доступ к данным. Коммерческий «контур данных в своей инфраструктуре» тоже не переносит весь продукт в вашу среду автоматически.

График расходов с видимой точностью, но неполными данными об использовании плохо помогает контролировать бюджет. Сравните использование известного запроса по данным провайдера с сохранённой записью и сверьте общий объём с реальным счётом. Платформа наблюдаемости объясняет расходы; политика остановки должна влиять на следующее действие приложения.

С чего начать в понедельник: превратите сбой в проверку релиза

Добавьте инструментацию одного важного процесса и сделайте один известный сбой воспроизводимым, прежде чем расширять внедрение. Подойдёт ассистент поддержки, который повторяет поиск заказа, выбирает неверный документ или готовит необоснованный возврат: ответственный может описать ожидаемое поведение.

Неисправный соединитель переходит из отдельного сбоя в продакшене в сохранённый пример набора данных и средство проверки релиза
Сохраните неудачный пример и проверьте следующий релиз на тех же входных данных.

Назначьте ответственного за процесс, укажите идентификатор релиза и бизнес-результат. Запишите запуск целиком, разберите операции моделей и инструментов и проверьте поля использования. Выясните, что происходит, когда экспортёр работает медленно или короткоживущий обработчик завершается. Первая проверка внедрения — доходят ли записи с контекстом, достаточным для ответа на вопрос ответственного.

Затем поместите известный сбой в набор данных с чётким ожидаемым результатом. Например: «не обещать возврат без подтверждения инструмента» или «сослаться на найденные правила, применимые к этому клиенту». Там, где правило детерминировано, используйте программную проверку; там, где требуется суждение, — проверенные критерии качества. Сохраните входные данные и правило, чтобы последующее изменение промпта или модели проходило ту же проверку.

Явно задайте условие допуска релиза. Успешный средний результат не должен скрывать сбой именно в том действии, которое нужно защитить. Проверьте результат известного сложного случая и разберите трейс, если он не прошёл. Затем исследуйте выборку из продакшена, чтобы найти новые случаи для набора данных.

Перед следующим решением о подписке запишите реальное число трейсов, операций на трейс, вызовов моделей, сохранённых оценок, обработанных или хранимых байтов, участников проверки и нужный срок хранения. Пересчитайте счёт по этим данным. Полезный результат первой недели — исправленный процесс и обоснованный бюджет, за каждый из которых отвечает конкретный человек.

Частые вопросы

Какой инструмент лучше выбрать для наблюдаемости ИИ?

Langfuse — основной вариант для небольшой команды с продакшеном, которой нужны общие трейсы и данные о расходах. Braintrust подходит для решений о релизе по результатам оценивания, Phoenix — для собственного закрытого бэкенда, Datadog — для существующего процесса эксплуатации. Ответственность и требования к развёртыванию определяют, какой специализированный инструмент предпочтительнее базового выбора.

Какие метрики отслеживать при мониторинге LLM?

Отслеживайте токены и расходы провайдера, задержки, ошибки, повторы, результаты поиска данных и работы инструментов, а также итоги оценивания. Группируйте их по клиенту, процессу и релизу. Если сбои и повторы расходуют значимый бюджет, стоимость успешного бизнес-результата полезнее общего числа токенов.

Какие 3 инструмента наблюдаемости выбрать?

Для трёх ролей в продакшене из этого сравнения выбирайте Langfuse для общей трассировки, Braintrust для продуктовой работы вокруг оценивания и Datadog для контекста эксплуатации. Эта подборка построена по задачам и не заявляет замеренного превосходства по всем функциям или вариантам развёртывания.

Какие инструменты мониторинга LLM доступны с открытым кодом?

Ядро Langfuse распространяется под MIT, репозиторий Helicone — под Apache 2.0. Phoenix можно бесплатно развернуть в своей инфраструктуре, но его бэкенд использует Elastic License 2.0 с ограничениями на предоставление размещённого сервиса. Проверяйте фактическую лицензию бэкенда: описание продукта как открытого не гарантирует разрешительных условий.

Что такое инструменты мониторинга LLM?

Они записывают, как выполнялось приложение на большой языковой модели: вызовы моделей и инструментов, поиск данных, время, использование и проверки результата. Полезный итог — понятный неудачный запуск, по которому можно исправить приложение и создать воспроизводимую проверку релиза.

Сколько стоит Langfuse?

Проверено 5 октября 2026 года: Hobby бесплатный, Core стоит $29/месяц, Pro — $199/месяц, Enterprise — $2,499/месяц. Дополнительный модуль Teams для Pro стоит $300/месяц. На платных тарифах отдельно оплачиваются трейсы, наблюдения и оценки; заданная нагрузка в 610,000 единиц обходится в $69.80 на Core.

Можно ли пользоваться Langfuse бесплатно?

Да. Hobby включает 50,000 единиц в месяц, двух пользователей и 30 дней доступа к данным. Ядро под лицензией MIT можно развернуть самостоятельно без платы за программную лицензию, оплачивая и обслуживая инфраструктуру своими силами. Для коммерческих корпоративных функций действуют отдельные условия.

Чем заменить Langfuse?

LangSmith подходит для доработки агентов на LangChain или LangGraph; Helicone — для мониторинга запросов через шлюз; Phoenix — для закрытого бэкенда; Braintrust — для наборов данных и релизов по результатам оценивания; Datadog — для инцидентов агентов в существующей системе эксплуатации. Перед сменой платформы сравните фактическую единицу оплаты и требования к хранению.

Можно ли запустить Langfuse локально?

Да. Langfuse документирует развёртывание на Docker и предоставляет руководства для ядра под MIT. Локальный запуск сам по себе не обеспечивает резервные копии для продакшена, доступность или ответственность за обновления. Определите эти требования, если установка станет сервисом трассировки в продакшене.

Получите чек-лист аудита бизнес-процессов с ИИ, чтобы определить процесс, ответственного, результат и точку контроля перед расширением набора инструментов для продакшена.

Последнее обновление
5 окт. 2026 г.
Категория
Build

Сделать этот сайт предпочтительным в Google

Добавить omidsaffari.com как предпочтительный источник в Google Поиске

Отметьте omidsaffari.com как предпочтительный источник — и Google будет поднимать его для вас в Top Stories, AI Overviews и AI Mode.

Похожие статьи
Как пользоваться OpenCode: от установки до проверенного кода

Как пользоваться OpenCode: от установки до проверенного кода

Установите OpenCode, подключите модель и выполните первую задачу с проверкой кода. Разберитесь в AGENTS.md, плагинах, оплате API и стоимости OpenCode Zen.4 окт. 2026 г.Build
Тарифы Netlify в 2026 году: сколько стоит хостинг на практике

Тарифы Netlify в 2026 году: сколько стоит хостинг на практике

Разбираем тарифы Netlify Free, Personal и Pro, расход кредитов и месячный бюджет для сайта, приложения Next.js и агентства с 10 клиентскими проектами.4 окт. 2026 г.Build
Обзор Softr: какой тариф выбрать для портала и CRM

Обзор Softr: какой тариф выбрать для портала и CRM

Обзор Softr для клиентских порталов и CRM: тарифы, лимиты пользователей и записей, функции ИИ и правила доступа. Узнайте, какой план подходит вашему бизнесу.4 окт. 2026 г.Build
Альтернативы Claude Code в 2026 году: расходы и выбор ИИ-агента

Альтернативы Claude Code в 2026 году: расходы и выбор ИИ-агента

Сравниваем OpenCode, Codex CLI, Pi и Gemini CLI с Claude Code: цены, расходы на модели, лимиты подписок и затраты на переход для разработчиков и команд.4 окт. 2026 г.Build
MCP-шлюз: зачем он команде и сколько стоит эксплуатация

MCP-шлюз: зачем он команде и сколько стоит эксплуатация

Когда команде нужен MCP-шлюз, как он управляет доступом к инструментам и во сколько обходятся Cloudflare, Docker и Lasso с учётом эксплуатации и журналов.4 окт. 2026 г.Build
Цены OpenAI API в 2026 году: GPT-6.1 Sol и три бюджета

Цены OpenAI API в 2026 году: GPT-6.1 Sol и три бюджета

Цены OpenAI API для GPT-6.1 Sol, Luna и Astra: токены, поиск, контейнеры, Batch и три примера месячного бюджета. Как выбрать модель и учесть все расходы.3 окт. 2026 г.Build
Настройка Pi Coding Agent 1.0: от установки до первой задачи

Настройка Pi Coding Agent 1.0: от установки до первой задачи

Установите Pi 1.0, подключите аккаунт модели и выполните первую задачу с AGENTS.md. Пошаговая настройка, расчёт расходов и ограничения ИИ-агента в терминале.3 окт. 2026 г.Build
ИИ-агенты без кода: 8 конструкторов для бизнеса в 2026 году

ИИ-агенты без кода: 8 конструкторов для бизнеса в 2026 году

Сравниваем восемь конструкторов ИИ-агентов: цены, лимиты, интеграции и условия работы без кода. Узнайте, какой сервис подходит вашей команде и задачам.1 окт. 2026 г.Build
Рассылка

Одно письмо, каждое воскресенье.Работающие системы, а не горячие мнения.

Еженедельно. Без спама. Отписка в любой момент.