LLM observability 툴 비교: 2026년 팀 규모별 비용과 선택 기준
LLM observability 툴을 팀 규모별로 비교합니다. 월 100,000회 실행을 기준으로 Langfuse, LangSmith, Helicone, Phoenix, Braintrust, Datadog의 비용과 무료 한도, 셀프 호스팅, OpenTelemetry 지원을 살펴봅니다.

소규모 프로덕션 팀이 LLM observability 툴을 처음 도입한다면 트레이싱·평가 플랫폼인 Langfuse가 가장 무난한 선택입니다. 아래에서 계산한 월 100,000회 실행 워크로드는 모델과 평가용 연산 비용을 제외하면 Core에서 월 $69.80입니다. 다만 평가 중심의 릴리스, 게이트웨이, 사내 인프라 배포, 기존 Datadog 환경과 연결한 장애 분석이 필요하다면 적합한 툴도 달라집니다.
LLM observability 툴, 용도별로 무엇을 선택할까요?
프로덕션 대시보드를 함께 보려면 Langfuse, LangChain 중심으로 에이전트를 개선하려면 LangSmith, 게이트웨이에서 요청을 모니터링하려면 Helicone부터 검토하면 됩니다. 직접 운영하는 사내 배포에는 Arize Phoenix, 평가를 통한 릴리스 판단에는 Braintrust, 애플리케이션 스택 전반에 걸친 프로덕션 장애에는 Datadog Agent Observability가 맞습니다. 실패 기록을 확인하는 사람마다 요금을 내는 플랫폼에서는 팀 규모가 특히 중요한 비용 변수가 됩니다.
트레이스(trace)는 애플리케이션의 한 번의 실행을 기록합니다. 스팬(span)은 그 안의 개별 작업으로, 모델 호출이나 검색, 툴 호출이 여기에 해당합니다. 평가(evaluation, 줄여서 eval)는 결과가 정해진 규칙이나 품질 기준을 충족했는지 확인합니다. 잘못된 행동을 하고도 그럴듯한 답을 내놓은 에이전트를 설명하려면 이 세 가지가 모두 필요합니다.
가격은 2026년 10월 5일 각 공급업체의 공식 요금 페이지에서 확인했습니다. 달러 표기는 모두 USD입니다. 별도로 포함한다고 명시한 경우를 제외하면 시작 가격에는 추가 사용량과 모델 제공업체 요금이 들어 있지 않습니다. 비교 근거는 당시 요금과 문서이며, 직접 사용해 성능 순위를 매긴 결과는 아닙니다.
출처: Langfuse 요금, LangSmith 요금, Helicone 요금, Arize 요금, Braintrust 요금, Datadog 요금.
비교의 핵심은 기본료 뒤에 붙는 사용량 단위입니다. 애플리케이션 트레이스에 과금하는 플랫폼과 모델 호출, 관측 기록, 평가 점수, 기가바이트마다 과금하는 플랫폼은 같은 실행에서도 서로 다른 사용량을 집계합니다. 구독료를 비교하기 전에 애플리케이션이 어떤 기록을 얼마나 생성하는지부터 추산해야 합니다.
에이전트를 월 100,000회 실행하면 비용은 얼마일까요?
아래 조건에서 같은 에이전트를 운영하는 다섯 명의 팀은 Langfuse에 $69.80, LangSmith에 $645를 낼 수 있습니다. 이 금액이 제품의 품질을 나타내지는 않습니다. 차이는 이벤트 집계 방식, 기본 제공량, 사용자 요금에서 발생합니다.
계산에 사용할 프로덕션 워크로드를 다음과 같이 가정합니다.
- 월 100,000회의 완전한 에이전트 실행, 실행당 트레이스 하나를 생성합니다.
- 실행당 관측 작업 다섯 개: 루트 워크플로, 모델 호출 두 번, 검색 한 번, 툴 호출 한 번입니다.
- 총 200,000회의 모델 호출과 500,000개의 관측 작업이 발생합니다.
- 외부에서 코드 평가로 계산한 점수 10,000개를 저장합니다. 표본으로 뽑은 실행마다 점수 하나를 기록하며, 추가 모델 호출이나 평가기 트레이스는 이 시나리오에서 제외합니다.
- 대시보드 접근이 필요한 사용자 다섯 명입니다.
- Braintrust에서 처리하는 데이터 5 GB, 그리고 별도로 Helicone에서 계량하는 스토리지 5 GB를 가정합니다. 두 업체의 바이트 집계 방식은 서로 바꿔 쓸 수 없으므로 독립적인 가정입니다.
요청을 읽고 주문을 조회한 뒤 주문 관리 툴을 호출하고, 모델에 최종 응답 작성을 맡기는 고객 지원 에이전트와 비슷한 구성입니다. 수치는 예산 계산을 위한 가정이며 실제 배포된 애플리케이션의 측정값은 아닙니다. 재시도나 분기가 있거나 플랫폼 안에서 평가기를 실행하면 생성되는 기록도 달라집니다.

위 금액은 앞서 링크한 업체별 공식 요율로 계산했습니다. LangSmith는 당시 가격 툴팁에 나온 기본 트레이스당 $0.005와 조직 전체에 제공되는 트레이스 10,000개를 적용했습니다. Helicone의 범위는 공식 페이지 안의 불일치를 그대로 반영합니다. 플랜 표에는 1 GB 무료라고 쓰여 있지만 계산기는 첫 기가바이트부터 스토리지에 과금합니다. Phoenix에는 사용량에 비례하는 라이선스 요금이 없으며, 인프라 운영비는 실제 배포 규모를 기준으로 산정해야 합니다.
트레이스가 더 긴 에이전트에도 이 금액이 그대로 적용된다고 보면 안 됩니다. 모델을 두 번 호출하던 워크플로가 반복 추론 루프로 바뀌면 Datadog과 Helicone의 모델 작업량이 늘어납니다. 관측 기록과 저장할 점수를 추가하면 Langfuse 유닛이 증가합니다. 트레이스 수가 같아도 더 큰 문서를 전송하면 Braintrust의 처리 바이트가 늘어납니다. 모델 제공업체 지출을 고객이나 기능별로 귀속하는 방법은 에이전트 토큰 추적 툴 비교에서 더 자세히 다룹니다.
어떤 기준으로 툴을 선정했을까요?
소규모 프로덕션 팀이 도입 이유를 설명할 수 있는 선택을 먼저 두고, 특정 운영 방식에서 가치가 커지는 툴을 뒤에 배치했습니다. 개발자와 AI 담당자가 함께 일하는 팀은 잘못된 결과를 디버깅하고, 고객별 비용을 추적하고, 실패 사례를 릴리스 검증으로 바꿔야 합니다. 이 가운데 한 가지 역할에 집중한 제품도 해당 업무에는 가장 적합할 수 있습니다.
추천은 다음 다섯 가지 기준을 따릅니다.
- 이해할 수 있는 과금 단위. 구매자가 트레이스, 작업, 사용자, 평가 점수, 데이터량 중 무엇에 따라 청구액이 늘어나는지 파악할 수 있어야 합니다. 무료 제공량과 그다음 한도도 포함합니다.
- 분석에 쓸 수 있는 프로덕션 기록. 실패한 답변을 그 결과를 만든 모델 호출, 검색, 툴 작업과 연결할 수 있어야 합니다.
- 개선으로 이어지는 워크플로. 기록이 로그로만 남지 않고 평가, 데이터셋, 실험, 리뷰 판단에 쓰일 수 있어야 합니다.
- 명확한 배포 범위. 무료 셀프 호스팅, 상용 Enterprise 라이선스, 고객 소유 데이터 플레인을 구분해서 설명해야 합니다.
- 문서에 명시된 계측 방식. OpenTelemetry 지원은 공급업체의 당시 연동 문서를 기준으로 판단했습니다. 문서에 나와 있는 경우 프로토콜과 필드 매핑도 확인했습니다.
여섯 제품은 범용 트레이싱 플랫폼, 프레임워크 중심 개발 워크플로, 게이트웨이, 사내에서 운영하는 로컬 우선 플랫폼, 평가 플랫폼, 운영 도구 모음이라는 서로 다른 선택지를 대표합니다. 목록을 더 늘려도 이 글이 다루는 예산과 운영 책임 결정에는 큰 도움이 되지 않습니다. 수집 속도, 인터페이스 사용성, 가동률, 평가 정확도를 직접 측정해 비교한 주장은 하지 않습니다.
여기서 ‘무료’는 활용 가능한 기본 제공량을 뜻하며, 청구액이 계속 0이라는 보장은 아닙니다. Braintrust Starter와 LangSmith Developer도 사용료가 발생할 수 있습니다. Phoenix는 라이선스 비용이 없어도 데이터베이스 유지보수와 온콜 업무의 부담이 클 수 있습니다. 완료하려는 실험에 한도가 맞는 플랜이 적절한 무료 플랜입니다.
프로덕션 적합성으로 살펴본 여섯 가지 툴
1. Langfuse: 소규모 프로덕션 팀의 기본 선택
Langfuse는 소규모 프로덕션 팀에 공유 트레이싱, 토큰·비용 추적, 프롬프트 관리, 평가 기능을 제공하며 Core에서 사용자별 요금을 받지 않습니다. SaaS 고객 지원 어시스턴트의 모델 호출에 고객, 워크플로, 릴리스 정보를 붙이면 비용이 많이 든 실패와 성공한 실행을 함께 살펴볼 수 있습니다. 예산을 좌우하는 주된 변수는 저장 기록의 수입니다. 에이전트가 한 번 실행될 때 트레이스 하나와 여러 관측 기록, 평가 점수가 생길 수 있습니다. 트레이스와 비용을 함께 보고, 나중에 셀프 호스팅으로 옮길 수 있는 경로도 확보하려는 팀에 적합합니다.

추천 대상: 개발자와 AI 담당자가 같은 프로덕션 실행을 확인해야 하는 소규모 또는 성장 중인 제품팀
주요 강점: Core 사용자 무제한, 트레이스 단위 비용 정보, MIT 라이선스 코어의 셀프 호스팅
요금: Core 월 $29부터 시작; 유료 Cloud 플랜에는 유닛 단위 사용료 추가
무료 체험: 무료 Hobby는 신용카드가 필요 없으며, 기간 제한 체험 대신 지속적인 기본 제공량을 제공
플랜별 요금과 선택을 바꾸는 한도
공식 요금 페이지에 따르면 Hobby는 $0이며 월 50,000유닛, 사용자 두 명, 30일간 데이터 접근을 제공합니다. Core는 월 $29로 100,000유닛, 사용자 무제한, 90일간 데이터 접근을 포함합니다. Pro는 월 $199이며 기본 유닛은 같지만 3년간 데이터 접근, 보존 관리, 더 높은 전송량 한도를 제공합니다. Pro의 선택 사항인 Teams 애드온은 월 $300이며 기업용 SSO, 정책 강제 적용, 세분화된 접근 제어를 추가합니다. Enterprise는 월 $2,499로 100,000유닛, 감사 로그, SCIM, 계약상 서비스 보장을 포함합니다. 연간 약정에서는 별도 사용량 요율을 적용할 수 있습니다.
유료 Cloud 사용료는 구간별 누진 방식입니다. 100,000유닛부터 백만 유닛까지는 100,000유닛당 $8, 백만부터 천만 유닛까지는 100,000유닛당 $7, 천만부터 오천만 유닛까지는 100,000유닛당 $6.50입니다. 낮은 요율은 해당 구간의 유닛에만 적용합니다. 다음 구간에 들어갔다고 앞 구간의 요금까지 소급해서 내려가지는 않습니다.
수집 요청 한도는 Core가 분당 4,000건, Pro가 분당 20,000건입니다. 이는 데이터를 수집하는 요청 수이며 과금 유닛의 정의와는 다릅니다. 배치 하나에 저장 이벤트 여러 개를 담을 수 있습니다. 월 유닛 예산과 익스포터가 만드는 순간 트래픽을 함께 확인해야 합니다.
Langfuse 트레이스 요금에는 관측 기록과 평가 점수도 포함됩니다
Langfuse의 트레이스는 실행 기록이지만, 과금 공식은 트레이스 + 관측 기록 + 평가 점수입니다. 이 글의 워크로드에서는 100,000 + 500,000 + 10,000 = 610,000유닛입니다. 따라서 Core 비용은 $29 + 5.1 × $8 = 월 $69.80이며, 같은 양을 Pro에 저장하면 월 $239.80입니다.
이 과금 방식은 계측 설계에도 영향을 줍니다. 검색과 환불 툴 작업은 기록을 늘리지만 실패를 설명하는 중요한 근거입니다. 요금을 줄이려고 이 기록을 빼면 실패 원인을 파악하지 못할 수 있습니다. 비용이 크거나 피해를 일으킬 수 있는 결과를 진단할 근거는 유지하면서, 가치가 낮은 성공 실행에는 의도적으로 설계한 샘플링 정책을 적용하는 편이 좋습니다.
호스팅, 라이선스, OpenTelemetry 지원
셀프 호스팅 Open Source는 MIT 라이선스로 소프트웨어 라이선스 비용이 없으며, 사용량 제한 없이 핵심 트레이싱, 평가, 데이터셋, 프롬프트 관리 API를 제공합니다. 셀프 호스팅 Enterprise는 상용 라이선스와 개별 견적을 적용합니다. 당시 요금 페이지에는 관련 ClickHouse 상용 플랜 요금에 Langfuse Enterprise 요금이 추가된다고 명시되어 있습니다. Cloud 구독과 Enterprise 셀프 호스팅 견적은 서로 다른 구매입니다.
OpenTelemetry 문서는 HTTP/JSON 또는 HTTP/protobuf 기반 OTLP를 지원하며, gRPC는 지원하지 않는다고 명시합니다. 기본 엔드포인트는 /api/public/otel이고 프로젝트의 공개 키와 비밀 키로 Basic 인증을 합니다. 현재 v4 경로로 직접 수집할 때 실시간 처리를 하려면 x-langfuse-ingestion-version: 4 헤더가 필요합니다. 문서는 이 헤더가 없으면 최대 10분 지연될 수 있다고 안내합니다. 사용자, 세션, 릴리스 등의 트레이스 속성도 필터링·집계할 스팬에 전파해야 합니다.
이미 gRPC로 Collector에 데이터를 보내는 플랫폼팀에는 이 조건이 중요한 연동 제약입니다. Collector가 한 프로토콜로 수신하고 다른 프로토콜로 내보낼 수는 있지만, Langfuse로 향하는 마지막 구간은 문서의 HTTP 엔드포인트와 속성 매핑에 맞아야 합니다. 페이로드가 수락되었더라도 고객 메타데이터가 빠졌다면 연동이 끝난 것은 아닙니다.
Langfuse Python 연동은 공식 SDK 경로부터 시작하세요
공급업체는 Langfuse 필드, 속성 전파, 데이터 내보내기를 처리하는 자체 Python SDK 사용을 권장합니다. 당시 트레이싱 빠른 시작 가이드에 따라 프로젝트 인증 정보와 선택한 리전 또는 자체 배포의 LANGFUSE_HOST를 설정하고, 업무 작업 전체를 현재 관측 컨텍스트로 감싸면 됩니다. 검색과 툴 작업도 그 안에 넣어야 잘못된 응답의 원인이 트레이스에 남습니다.
가능하면 모델 제공업체가 보고한 사용량을 활용해야 합니다. Langfuse 비용 추적은 모델 가격에서 추정한 값보다 수집된 비용을 우선하며, Project Settings > Models에서 사용자 정의 모델 정보를 설정할 수 있습니다. 제공업체와 협상한 요율을 쓰거나 공개 가격이 없는 내부 모델을 운영할 때 중요합니다. 화면의 추정 비용이 관리하려는 실제 계약 요율과 맞아야 합니다.
Langfuse LangChain 연동은 요청 전체의 컨텍스트를 유지해야 합니다
LangChain 연동은 호출의 callbacks에 전달하는 콜백 핸들러를 사용합니다. 바깥 요청에 트레이스 컨텍스트를 부여한 뒤 체인을 그 하위에 넣으면 됩니다. 문서는 백그라운드 큐에 쌓인 이벤트도 별도로 짚습니다. 수명이 짧은 프로세스는 종료 전에 익스포터를 플러시하거나 종료 처리를 해야 합니다. JavaScript 서버리스 환경에서는 가이드에 따라 백그라운드 콜백이 끝날 때까지 기다려야 합니다.
첫 도입 범위는 직접 기록을 확인할 수 있을 정도로 작게 잡는 편이 좋습니다.
프로덕션 트레이싱 프로젝트를 하나 만듭니다
Cloud 리전 또는 셀프 호스팅 주소를 선택하고 프로젝트 키를 만든 뒤, 공식 빠른 시작 가이드에 따라 호스트를 설정합니다. 프로덕션 기록과 개발 기록을 구분할 수 있게 구성합니다.
업무 작업 전체를 하나의 트레이스로 기록합니다
요청의 루트, 모델 호출, 검색, 툴을 계측합니다. 적절한 스팬에 고객, 워크플로, 릴리스, 결과 메타데이터를 붙이고 필요한 트레이스 속성이 전파되는지 확인합니다.
모델 제공업체 응답과 비용을 대조합니다
완료된 트레이스를 열어 모델 식별 정보, 사용량, 비용을 확인합니다. 공개 요율로 추정한 값이 계약 조건과 다르면 사용자 정의 모델 가격을 설정합니다.
평가 점수를 저장하고 사용량 집계를 확인합니다
결과를 알고 있는 사례를 채점하고 의도한 실행에 점수가 연결되는지 확인합니다. 이어서 트레이스, 관측 기록, 평가 점수의 개수를 Usage Management 대시보드와 비교합니다. 수명이 짧은 워커가 종료되기 전에는 익스포터를 플러시합니다.
- Core에서는 리뷰에 필요한 사람이 추가 사용자 구독료 없이 참여할 수 있습니다
- 모델 호출, 툴, 검색, 비용, 평가 점수를 한 기록으로 연결할 수 있습니다
- 수집된 비용과 사용자 정의 모델 정보로 협상 요율이나 비공개 가격을 반영할 수 있습니다
- MIT 코어 셀프 호스팅으로 자체 인프라에서 운영할 수 있습니다
- 트레이스, 관측 기록, 저장된 평가 점수가 모두 Cloud 기본 제공량을 사용합니다
- 사용량이 같아도 Pro와 Teams 애드온으로 고정 비용이 커질 수 있습니다
- OTel 수신기는 HTTP 내보내기와 올바른 속성 전파가 필요합니다
2. LangSmith: LangChain 중심의 개선 워크플로에 적합
LangSmith는 LangChain이나 LangGraph로 에이전트를 개발하고 검토하는 팀을 위한 트레이싱·평가 플랫폼이며, 다른 프레임워크의 계측 방법도 문서로 제공합니다. 개발 책임자는 프로덕션 실패를 데이터셋, 온라인·오프라인 평가, 사람의 리뷰, 프롬프트 수정으로 연결할 수 있습니다. 구매 시 확인할 비용 변수는 사용자 수와 트레이스입니다. 리뷰어를 더 초대하면 구독료가 늘고 트레이스 사용량에는 별도로 과금합니다. 모든 리뷰어에게 유료 계정을 제공할 만큼 개발·평가 워크플로의 가치가 큰 팀에 적합합니다.

추천 대상: LangChain 또는 LangGraph 중심으로 에이전트 개선 작업을 운영하는 개발팀
주요 강점: 트레이싱, 데이터셋, 주석 작업 큐, 온라인·오프라인 평가를 같은 제품에서 제공
요금: Plus 사용자당 월 $39, 트레이스와 다른 제품 사용료는 별도
무료 체험: Developer는 사용자 한 명에게 지속적인 무료 제공량을 주며, 포함된 트레이스를 초과하면 사용료 발생
LangSmith 가격: 플랜별 요금과 조직 공용 트레이스 한도
Developer는 사용자당 월 $0이며 사용자 한 명, 월 5,000개의 기본 트레이스를 제공합니다. 초과분은 사용량에 따라 과금합니다. Plus는 사용자당 월 $39로 유료 사용자를 추가할 수 있으며 월 기본 트레이스 총 10,000개를 포함합니다. 요금 계산기는 이 제공량을 조직 전체가 공유한다고 명시합니다. Enterprise는 개별 견적으로 하이브리드·셀프 호스팅 배포, 보안 제어, 지원 조건을 제공합니다.
당시 페이지의 가격 툴팁에는 기본 트레이스당 0.005 LangChain Standard Units, 장기 보존 트레이스 업그레이드당 0.0025라고 나와 있습니다. LSU 하나는 $1이므로 각각 기본 트레이스당 $0.005, 업그레이드당 $0.0025입니다. 기본 보존 기간은 14일, 장기 보존 기간은 180일입니다. 오늘 확인한 가격으로 예산을 짤 때는 기억하고 있던 예전 트레이스 단가를 쓰면 안 됩니다.
Plus 사용자 다섯 명과 기본 트레이스 100,000개라면 사용자 요금 $195 + 추가 트레이스 $450 = 월 $645입니다. 트레이스 10,000개를 장기 보존으로 업그레이드하면 $25가 추가되어 평가 연산과 다른 제품 사용료를 제외한 금액이 $670이 됩니다. 장기 보존은 기록을 더 오래 남기는 유료 업그레이드이며 Plus를 구매하면 자동으로 무료 제공되는 기능이 아닙니다.
Tuned Evaluators에는 별도 과금 단위가 있습니다. 성공한 Perceived Error 평가 실행당 0.015 LSU입니다. 페이지의 툴팁은 Tuned Evaluator가 피드백을 추가할 경우 해당 트레이스도 장기 보존으로 업그레이드한다고 설명합니다. Deployment, Engine, Fleet, Sandboxes에는 각각 다른 사용량 규칙이 있습니다. 관측 기능만 구매한다면 예산도 그 서비스 범위에 맞춰야 합니다. 사용자 구독 하나에 에이전트 런타임 전체가 포함된다고 보면 안 됩니다.
사용자 수에 따라 추천이 달라지는 이유
개발자 다섯 명이 트레이스를 보는 경우와 그 다섯 명에 제품·품질 리뷰 담당자가 추가되는 경우는 다릅니다. 기본 트레이스가 동일한 100,000개여도 Plus 사용자 열다섯 명이면 월 $1,035입니다. 사용자 요금이 $585로 늘고 추가 트레이스 요금은 $450로 유지되기 때문입니다. 사용자 수를 늘려도 조직 공용 무료 트레이스가 그만큼 늘어나지는 않습니다.
각 리뷰어가 기록을 살펴보고 프롬프트, 데이터셋, 릴리스 판단을 꾸준히 개선한다면 비용을 정당화할 수 있습니다. 대부분이 비용 대시보드를 가끔 확인하기만 한다면 도입 근거는 약해집니다. 원본 기록을 직접 봐야 하는 사람, 내보낸 결과로 충분한 사람, 구독을 실제 성과로 연결하는 워크플로를 구분해야 합니다.
상용 셀프 호스팅과 OpenTelemetry 지원
셀프 호스팅 LangSmith는 상용 라이선스 키가 필요한 Enterprise 애드온입니다. 설치 구성에는 프런트엔드·백엔드 서비스와 ClickHouse, PostgreSQL, Redis가 들어가며, 가이드는 프로덕션용 외부 스토리지 서비스 사용을 권장합니다. 직접 운영해야 하는 기업용 설치 환경입니다. 기반 프레임워크가 오픈소스라는 이유로 서버 라이선스도 무료라고 추정해서는 안 됩니다.
OpenTelemetry 가이드는 호환 애플리케이션의 트레이스, 표준 속성 매핑, 하나의 스팬 스트림을 여러 백엔드로 보내는 Collector 팬아웃을 설명합니다. LangChain·LangGraph 사용자는 트레이싱과 함께 LANGSMITH_OTEL_ENABLED=true를 설정해 통합 경로를 켤 수 있습니다. 표준 HTTP 익스포터는 기본 엔드포인트 https://api.smith.langchain.com/otel과 x-api-key 인증을 사용하며, 선택적으로 Langsmith-Project 헤더를 지정합니다.
엔드포인트 형식을 주의해서 설정해야 합니다. 공용 OTLP 기본 변수에는 HTTP 익스포터가 /v1/traces를 붙이지만, 트레이스 전용 변수에는 전체 경로를 넣습니다. 두 곳에 모두 신호 경로를 추가하면 URL이 잘못됩니다. 선택한 프로젝트에서 같은 트레이스를 확인하고 모델, 입력, 출력, 부모·자식 구조가 맞는지 검증한 뒤 OTel 내보내기가 완료되었다고 판단해야 합니다.
- LangChain과 LangGraph에 통합 트레이싱 경로가 문서화되어 있습니다
- 데이터셋, 주석 작업 큐, 온라인·오프라인 평가로 명확한 개선 워크플로를 구성할 수 있습니다
- OTel 수집과 Collector 팬아웃을 통해 특정 프레임워크 밖의 애플리케이션도 지원합니다
- Enterprise 라이선스로 자체 인프라에서 백엔드를 운영할 수 있습니다
- 계정으로 집계되는 초대 사용자를 포함해 Plus 리뷰어마다 월 $39가 듭니다
- 기본 트레이스 제공량은 사용자별이 아니라 조직 전체가 공유합니다
- 장기 트레이스 보존과 특수 평가기 사용에는 별도 요금이 붙습니다
3. Helicone: 게이트웨이 도입이 핵심인 팀에 적합
Helicone은 요청 관측 기능과 AI 게이트웨이를 결합합니다. 게이트웨이는 모델 요청을 전달하면서 라우팅 등 관련 제어를 적용하는 서비스입니다. 모델 제공업체로 보내는 요청을 확인하고, 폴백을 관리하고, 모델 비용을 묶어 보는 것이 주된 요구인 소규모 애플리케이션이라면 이 접점에서 유용한 기록을 얻을 수 있습니다. 확인할 한계는 게이트웨이와 에이전트 전체의 차이입니다. 모델 요청 기록만으로 검색과 업무 툴을 설명하려면 애플리케이션 컨텍스트가 더 필요합니다. 이미 게이트웨이를 설계에 포함했고 당장 요청 모니터링이 필요한 팀에 적합합니다.

추천 대상: 게이트웨이 기능과 요청 모니터링을 함께 도입하는 제품팀
주요 강점: OpenAI 호환 게이트웨이와 별도의 비동기 로깅 경로
요금: Pro 월 $79 + 구간별 기록 요청·스토리지 사용료
무료 체험: Hobby는 무료; Pro와 Team에 7일 무료 체험 명시
순간 트래픽 한도까지 확인해야 하는 플랜별 요금
당시 요금 페이지에 따르면 Hobby는 $0이며 월 요청 10,000건, 스토리지 1 GB, 사용자 한 명, 조직 한 개, 7일 보존을 제공합니다. Pro는 월 $79로 사용자 무제한, 알림, 보고서, 쿼리 언어 HQL을 추가하며 보존 기간은 한 달입니다. Team은 월 $799로 조직 다섯 개, 3개월 보존, 전용 Slack 채널, 명시된 규정 준수 기능을 추가합니다. Enterprise는 개별 견적으로 SAML SSO, 온프레미스 배포, 맞춤 계약 조건을 제공합니다.
유료 플랜 표에는 무료 요청 10,000건, 무료 스토리지 1 GB가 포함되며 초과분에 사용료가 붙습니다. 공개된 수집 한도는 Hobby 분당 로그 10건, Pro 1,000건, Team 15,000건, Enterprise 30,000건입니다. 월 제공량은 충분해 보여도 순간적으로 몰리는 요청이 수집 한도를 넘을 수 있습니다. 큐 기반 문서 처리 작업이 기록을 한꺼번에 내보낸다면 월 건수뿐 아니라 처리량도 확인해야 합니다.
Pro에서 Team으로 올리면 사용료 전 월 $720가 추가됩니다. 조직 구성, 보존 기간, 지원 요구 때문에 필요할 때 선택해야 합니다. 요청 수가 증가한다는 이유만으로 이 업그레이드가 다음 필수 비용이 되는 것은 아닙니다.
요청 요금 계산과 스토리지 표기의 불일치
공식 가격 계산기는 구간별 요청 요율을 적용합니다. 첫 10,000건은 무료, 다음 20,000건은 건당 $0.0007, 다음 60,000건은 건당 $0.00035, 90,001건부터 250,000건까지는 건당 $0.000175입니다. 이후 공개 구간에서는 사용량이 늘어남에 따라 건당 $0.0000875, $0.00004375, $0.00002로 내려갑니다. 이는 다른 업체의 비교 자료가 아니라 Helicone의 자체 계산기에서 가져온 값입니다.
모델 요청 200,000건을 기록하면 요청 요금은 $14 + $21 + $19.25 = $54.25입니다. Pro 기본료를 더하면 스토리지 전 $133.25가 됩니다. 예시 에이전트의 모델 호출 두 번을 모두 세야 합니다. 애플리케이션 실행을 단순히 100,000건의 ‘요청’으로 잡으면 이 과금 단위를 적게 계산하게 됩니다.
계산기의 스토리지 요율은 첫 30 GB에 GB당 $3.25이며, 이후 더 큰 구간에서는 GB당 $2, $1.25, $0.75, $0.50입니다. 하지만 플랜 표에 무료 기가바이트가 명시되어 있는데도 계산기는 0부터 첫 구간 요금을 적용합니다. 계량 스토리지 5 GB에서 무료 제공량을 차감하면 $13, 계산기를 따르면 $16.25입니다. 따라서 예시의 Pro 총액은 $146.25-$149.50입니다.
게이트웨이, 비동기 로깅, 문서로 확인되는 OTel 지원 범위
게이트웨이 빠른 시작 가이드는 https://ai-gateway.helicone.ai를 가리키는 OpenAI 호환 클라이언트를 사용하며 자동 로깅과 폴백을 제공합니다. 자체 모델 제공업체 키도 사용할 수 있습니다. 모델 제공업체 지출은 관측 기능 구독료와 기록 요청 요금에서 별도입니다.
Proxy와 Async 비교 가이드는 아키텍처상 선택을 명확히 설명합니다. Proxy 연동에서는 Helicone이 요청 경로에 들어가 캐싱, 재시도 제어, 사용자 정의 호출 제한 등의 게이트웨이 기능을 제공합니다. Async 로깅은 핵심 요청 경로 밖에서 동작하지만 같은 프록시 제어 기능을 제공하지 않습니다. 설정 수고를 비교하기 전에 요청을 직접 전달할지, 백그라운드에서 관찰할지 먼저 정해야 합니다.
OpenTelemetry에 대해서는 OpenLLMetry Async 연동이 문서화되어 있습니다. 당시 예시는 @helicone/async와 helicone-async 로거를 사용합니다. 이는 문서에 나온 연동 경로의 근거이며, 해당 가이드에는 범용 OTLP Collector 수신기 설정이 없습니다. 요구 사항이 ‘Collector 익스포터만 변경’이라면 그 경로를 직접 검증해야 합니다. OTel 관련 연동이 있다는 이유만으로 바로 교체할 수 있는 OTLP 백엔드라고 보면 안 됩니다.
셀프 호스팅은 수동 설치, Docker Compose, Kubernetes, 클라우드 배포를 지원합니다. 저장소의 라이선스는 Apache 2.0입니다. 전담 지원과 기업용 서비스는 별도로 협의해야 합니다. 소규모 팀에서는 소프트웨어 라이선스가 무료여도 스택을 지속적으로 운영하는 비용이 텔레메트리 요금을 넘을 수 있습니다.
도입은 요청 하나가 화면에 보이는 데서 끝나지 않고 애플리케이션의 실제 질문에 답해야 합니다. 워크플로와 고객 식별자를 붙여 결과를 알고 있는 모델 호출을 전송하고 기록을 확인합니다. 세션이 의도한 호출들을 묶는지도 검증합니다. 이후 재시도나 실패 응답으로 같은 검사를 반복합니다. 어떤 업무 작업이 추가 모델 사용을 일으켰는지 알 수 있어야 게이트웨이 화면이 프로덕션 분석의 근거가 됩니다.
- Pro는 요청 모니터링을 함께 수행하는 사용자를 무제한으로 지원합니다
- 게이트웨이와 비동기 경로 중에서 요청 경로에 맞는 방식을 선택할 수 있습니다
- 공식 요금 페이지로 구간별 요청 요금을 계산할 수 있습니다
- Apache 2.0 라이선스와 문서화된 배포 방법으로 셀프 호스팅할 수 있습니다
- 모델 요청과 완전한 에이전트 실행은 서로 다른 과금 단위입니다
- 공개된 스토리지 제공량과 계산기 사이의 차이를 확인해야 합니다
- 비동기 로깅에는 게이트웨이의 캐싱, 재시도, 호출 제한 제어가 없습니다
- 인용한 연동 가이드만으로는 범용 Collector-to-OTLP 수집 경로를 확인할 수 없습니다
4. Arize Phoenix: 인프라 담당자가 있는 사내 트레이싱 환경에 적합
Arize Phoenix는 라이선스 비용 없이 자체 인프라에서 실행할 수 있는 로컬 우선 트레이싱·평가·실험 플랫폼입니다. 검색 기반 어시스턴트를 분석하는 플랫폼 엔지니어는 모델 호출, 검색한 컨텍스트, 툴 작업을 확인한 뒤 실패 사례를 데이터셋으로 모아 수정한 애플리케이션과 비교할 수 있습니다. 핵심 조건은 운영 책임입니다. 서비스를 운영하고 라이선스 범위를 이해하는 담당자가 있어야 합니다. 직접 통제하는 사내 트레이싱·평가 환경이 필요하고 인프라 책임자를 배정할 수 있는 팀에 적합합니다.

추천 대상: 트레이싱·평가 백엔드를 직접 운영하려는 기술팀
주요 강점: OTLP 트레이스와 OpenInference 계측, 로컬 데이터셋과 실험
요금: Phoenix 셀프 호스팅 라이선스 비용 없음; 당시 Arize 요금 페이지에 Phoenix 유료 플랜 미공개
무료 체험: 셀프 호스팅 Phoenix는 라이선스 조건 안에서 무료 사용 가능; Arize AX의 무료 플랜은 별도
월 $50는 Phoenix가 아니라 AX 요금입니다
당시 Arize 요금 페이지는 AX의 가격을 제시하고 Phoenix는 로컬 우선 플랫폼으로 별도 소개합니다. AX Free는 월 트레이스 스팬 25,000개, 월 수집 데이터 1 GB, 15일 보존, 사용자·평가 무제한을 포함합니다. AX Pro는 월 $50로 스팬 50,000개, 월 수집 데이터 10 GB, 30일 보존, 사용자·평가 무제한을 제공합니다. AX Enterprise는 개별 견적으로 사용량과 보존 기간을 조정하고 SaaS 또는 셀프 호스팅 배포를 지원합니다.
해당 페이지에는 유료 Phoenix 인스턴스 가격이나 Phoenix 초과 사용량 요율이 공개되어 있지 않습니다. Phoenix를 ‘월 $50’라고 부르면 두 제품을 섞게 됩니다. 관리형 Arize 제품을 구매하려면 AX의 스팬·바이트 한도로 검토하고, Phoenix를 선택한다면 직접 운영할 인프라의 예산을 잡아야 합니다.
예시 애플리케이션의 스팬 500,000개는 AX Pro 기본 제공량의 열 배입니다. 공식 페이지에는 이 경우의 초과 요율이 없으므로 가격을 외삽하기보다 견적을 받는 것이 맞습니다. 실행당 스팬 다섯 개라면 AX Free의 스팬 한도는 5,000회 실행, Pro는 10,000회 실행에 해당합니다. 바이트를 비롯한 다른 한도도 충족한다는 가정입니다.
셀프 호스팅 Phoenix의 소프트웨어 라이선스 비용은 이 사용량에서도 0입니다. 그렇다고 저장된 스팬 500,000개를 무료로 보존할 수 있다는 뜻은 아닙니다. 저장 정책을 정하고 페이로드 크기를 추산하며, 백업을 포함하고 업그레이드·복구 담당자를 지정해야 합니다. ‘이미 해당 인프라를 운영 중’인 경우와 ‘새 사내 플랫폼이 필요’한 경우의 총비용은 다릅니다.
백엔드 라이선스 조건을 직접 확인해야 합니다
Phoenix 백엔드의 당시 저장소 라이선스는 Elastic License 2.0입니다. 제한 조건을 따르는 사용은 허용하지만, 제품 기능의 상당 부분을 제삼자에게 호스팅·관리형 서비스로 제공하는 것은 금지합니다. 라이선스 키 기능을 우회하거나 라이선스 고지를 제거하는 것도 제한합니다. Langfuse의 MIT 코어, Helicone의 Apache 2.0과는 허용 범위가 다릅니다.
구매 검토 문구에서도 이 차이를 반영해야 합니다. ‘코드를 볼 수 있다’, ‘우리 배포에서는 무료다’, ‘서비스로 다시 제공할 수 있는 허용적 라이선스다’는 각각 다른 주장입니다. 이 글은 애플리케이션의 트레이싱·평가용으로 Phoenix를 운영하는 경우를 추천하며, Phoenix를 호스팅 제품으로 재판매할 권리가 있다고 가정하지 않습니다.
셀프 호스팅 가이드는 셀프 호스팅에 라이선스 비용, 사용량 한도, 기능 제한이 없고 완전히 망이 분리된 에어갭 환경에서도 실행할 수 있다고 설명합니다. 터미널, Docker/Compose, Kubernetes/Helm, 클라우드 배포 방법을 문서로 제공합니다. 사내 설치라도 저장하는 데이터에 맞는 설정과 복구 계획은 필요합니다.
OpenTelemetry와 평가 워크플로
Phoenix는 OTLP 트레이스를 수신하며 OpenTelemetry와 OpenInference 계측을 기반으로 합니다. 문서에 설명된 기록에는 모델 호출, 검색, 툴, 사용자 정의 로직이 포함됩니다. 평가에는 모델 기반 심사, 코드 검사, 사람의 라벨을 사용할 수 있습니다. 데이터셋과 실험으로 같은 입력에 여러 애플리케이션 버전을 실행할 수 있으며, 프롬프트 도구는 버전 관리와 재실행을 지원합니다.
트레이싱 설정 가이드는 Python용 phoenix.otel, TypeScript용 @arizeai/phoenix-otel과 프로젝트·세션 구성을 제공합니다. Collector 기반으로 운영하는 팀은 다른 시스템에서 쓰는 실제 의미 필드가 Phoenix에도 보존되는지 확인해야 합니다. 트레이스 ID를 유지하는 것도 유용하지만, 어느 작업이 잘못된 컨텍스트를 검색했는지 남아 있어야 실제 조치로 이어집니다.
검색 기반 어시스턴트라면 이미 알고 있는 실패부터 시작하면 됩니다. 관련 없는 문서를 바탕으로 모델이 확신에 찬 답을 낸 사례를 고릅니다. 검색 문제와 답변 생성 문제를 구분할 근거가 검색 스팬에 남는지 확인합니다. 입력과 기대 동작을 데이터셋에 보존하고 검색이나 프롬프트 설정 하나를 바꿔 결과를 비교합니다. 반복할 수 있는 사례가 있어야 문제 관찰에서 재발 방지로 나아갈 수 있습니다.
- 셀프 호스팅 가이드에 소프트웨어 라이선스 비용과 사용량 상한이 없다고 명시되어 있습니다
- 문서에서 에어갭 배포를 지원합니다
- OTLP와 OpenInference로 일반적인 계측 경로를 연결할 수 있습니다
- 데이터셋, 실험, 여러 평가 방식으로 회귀 검증을 수행할 수 있습니다
- ELv2의 제한은 단순히 ‘허용적 라이선스’라고 표현하면 드러나지 않습니다
- 인프라, 보존, 업그레이드, 복구는 조직이 책임져야 합니다
- 유료 AX의 한도와 가격은 Phoenix 유료 구독을 뜻하지 않습니다
5. Braintrust: 평가 결과로 릴리스를 결정하는 팀에 적합
Braintrust는 평가 점수가 있는 사례, 데이터셋, 실험을 근거로 릴리스를 결정하는 팀을 위한 평가·관측 플랫폼입니다. 제품의 AI 책임자는 프롬프트 수정 전후를 비교하면서 트레이스를 확인하고 새 출력이 이전 버전과 같은 검사를 통과했는지 판단할 수 있습니다. 예산은 처리 데이터와 평가 점수에 따라 달라지며 모델 연산과 장기 보존 비용이 추가됩니다. 평가 워크플로에 담당자가 있고 그 결과가 실제 출시 내용에 영향을 주는 팀에 적합합니다. 한도와 기능이 맞으면 Starter부터 시작하면 됩니다.

추천 대상: 평가 데이터셋과 릴리스 기준을 지속적으로 관리하는 AI 제품팀
주요 강점: Starter에서 사용자, 프로젝트, 데이터셋, 플레이그라운드, 실험 무제한
요금: Starter 플랫폼 기본료 $0에 사용료 추가; Pro 월 $249 + 사용료
무료 체험: Starter는 지속적인 무료 제공량을 주며 시작 시 신용카드 불필요
플랜별 요금과 두 가지 사용량 단위
Starter의 월 플랫폼 기본료는 $0입니다. 월 처리 데이터 1 GB를 포함하고 초과분은 GB당 $4, 월 평가 점수 10,000개를 포함하고 초과분은 1,000개당 $2.50입니다. 14일 보존과 월 모델 크레딧 $10도 제공합니다. 사용자, 프로젝트, 데이터셋, 플레이그라운드, 실험은 무제한입니다. 따라서 팀이 공유 평가 공간을 필요로 하더라도 곧바로 Pro가 필요한 것은 아닙니다.
Pro는 월 $249로 처리 데이터 5 GB를 포함하고 초과분은 GB당 $3, 평가 점수 50,000개를 포함하고 초과분은 1,000개당 $1.50입니다. 30일 보존을 제공하며 보존 기간 연장에는 GB당 월 $0.50를 과금합니다. 월 모델 크레딧 $100도 포함합니다. 사용자 정의 차트, 환경, 역할 기반 접근 제어, 우선 지원을 추가합니다. Enterprise는 개별 견적으로 보존·내보내기 조건, 지원, 온프레미스 또는 호스팅 배포를 협의합니다.
평가 점수는 모델 심사, 자동 평가, 사용자 정의 코드 채점기 중 어떤 방식이든 출력에 대한 평가 결과를 뜻합니다. 점수를 저장·처리하는 요금과 점수를 계산하는 연산 비용은 다릅니다. 포함된 모델 크레딧에도 적용 범위가 있으며, 모든 애플리케이션의 모델 제공업체 청구액을 돌려주는 것은 아닙니다.
가정한 5 GB와 점수 10,000개에서는 Starter의 데이터 초과료가 $16이며 점수 초과료는 없습니다. Pro는 추가 사용료 전 $249입니다. 당장 필요한 것이 무료 플랜의 기능 범위 안에 있는 공유 데이터셋, 실험, 트레이스라면 $249 업그레이드에는 기능이나 보존 기간상의 이유가 있어야 합니다.
Pro의 낮은 단가가 유리해지는 시점
같은 처리 데이터 5 GB에 월 평가 점수 100,000개라면 모델 사용과 보존 기간 연장 전 비용은 Starter $241, Pro $324입니다. Pro의 단가가 낮아도 고정 비용을 자동으로 상쇄하지는 못합니다.
같은 바이트 조건에서 사용료만 비교한 손익분기점은 월 점수 183,000개이며, 두 플랜 모두 $448.50가 됩니다. 이 계산은 서로 다른 모델 크레딧, 보존 기간, 기능을 제외합니다. 이 차이 때문에 더 일찍 업그레이드하는 편이 적절할 수도 있습니다. 이는 예산상 기준점이며 필요한 접근 제어 도입을 미루라는 권고는 아닙니다.
운영에서는 어떤 검사가 그 비용을 정당화하는지 판단해야 합니다. 고객 지원 워크플로에는 실행마다 결정론적인 툴 인수 검사가 필요하고, 표본에는 모델 기반 답변 품질 검토가 필요할 수 있습니다. 두 검사는 목적과 연산 비용이 다릅니다. 릴리스용으로 이미 확인한 사례의 데이터셋을 관리하고, 프로덕션을 샘플링해 그 데이터셋이 예상하지 못한 실패를 찾아야 합니다.
평균 점수가 높다는 이유만으로 릴리스 판단이 끝났다고 보면 안 됩니다. 사례를 워크플로와 결과별로 묶어 쉬운 답변의 개선이 고객에게 중요한 어려운 행동의 회귀를 가리지 않게 해야 합니다. 이는 평가를 설계하고 검토하는 방식에 관한 원칙이며, 어떤 플랫폼이 올바른 평가 기준을 자동으로 제공한다는 주장은 아닙니다.
OTel 수집과 상용 데이터 플레인 호스팅
OpenTelemetry 연동 문서는 OTLP 트레이스 익스포터, Braintrust 스팬 프로세서, 로그 익스포터, Collector를 통한 로그 전달을 설명합니다. 기본 API 엔드포인트는 https://api.braintrust.dev/otel이며 인증과 x-bt-parent=project_id:... 헤더로 대상 프로젝트를 지정합니다. 신호별 전용 엔드포인트에는 트레이스 또는 로그 경로가 포함됩니다. 별도 @braintrust/otel 패키지는 문서에 설명된 JavaScript 연동을 지원합니다.
연동 문서의 필드 매핑 지침에 따라 수집 후 입력, 출력, 메타데이터를 검증해야 합니다. 로그 한 줄과 애플리케이션 스팬이 모두 수락된다고 같은 평가 기록이 되는 것은 아닙니다. 실행하려는 실험의 입력으로 어떤 객체가 쓰일지 확인해야 합니다.
배포 플랜은 BYOC와 셀프 호스팅을 Enterprise에 한정합니다. 오픈소스 백엔드 라이선스가 아니라 상용 플랫폼 구매입니다. 더 구체적으로 아키텍처 가이드에 따르면 UI, 인증, 관리 메타데이터를 포함하는 컨트롤 플레인은 Braintrust의 SaaS에 남습니다. 트레이스, 데이터셋, 기타 AI 데이터를 저장하는 데이터 플레인은 자체 클라우드 계정에서 실행할 수 있습니다. 브라우저는 이 데이터 플레인과 직접 통신합니다.
일부 구매 결정에서는 이 차이가 핵심입니다. 프롬프트와 출력의 저장 위치를 직접 관리하면 데이터 위치 요건을 충족할 수 있지만 공급업체 컨트롤 플레인에 대한 의존성은 남습니다. 제품의 모든 구성 요소를 오프라인으로 운영해야 하는 조직이라면 계약 전에 이 구조를 Phoenix의 문서화된 에어갭 배포와 비교해야 합니다.
- Starter에서 사용자별 요금 없이 공유 평가 공간을 운영할 수 있습니다
- 처리 데이터와 점수 제공량이 별도 예산 항목을 명확히 보여줍니다
- Pro는 차트, 환경, 접근 제어, 보존 기능의 업그레이드를 제공합니다
- 문서화된 OTel 경로로 기존 계측 스트림을 수신할 수 있습니다
- 큰 페이로드와 많은 평가 점수에는 각각 사용료가 발생합니다
- Pro의 낮은 단가가 구독료 $249를 항상 상쇄하지는 않습니다
- 모델 심사 연산과 장기 보존에는 별도 예산이 필요합니다
- 데이터 저장소를 셀프 호스팅해도 SaaS 컨트롤 플레인이 자체 인프라로 옮겨지지는 않습니다
6. Datadog Agent Observability: 기존 운영 환경과 함께 분석할 때 적합
Datadog Agent Observability는 흔히 Datadog LLM Observability로 검색하는 제품의 현재 공식 명칭이며, 이미 Datadog에서 애플리케이션 장애를 분석하는 팀에 가장 잘 맞습니다. 고객 지원 에이전트의 타임아웃은 모델 호출, 느린 서비스, 사용자 세션 문제에서 비롯될 수 있습니다. 이 플랫폼의 가치는 에이전트 기록을 더 넓은 운영 맥락과 연결하는 데 있습니다. 구매 시에는 약정 방식과 보존 기간, 함께 필요한 다른 Datadog 제품 비용을 확인해야 합니다. 장애 담당자가 이미 Datadog을 사용하고, 함께 보는 컨텍스트가 실제 조사에 도움이 되는 경우에 적합합니다.

추천 대상: AI 실패를 애플리케이션·인프라 장애와 연결하는 SRE 또는 플랫폼팀
주요 강점: 검색, 툴, 워크플로의 모든 작업 대신 LLM 스팬에 과금
요금: Pro 연간 약정 기준 월 $160, 월 단위 $200, 온디맨드 $240; 추가 LLM 스팬은 별도
무료 체험: Free에 월 LLM 스팬 40,000개 포함; 요금 페이지에서 체험 신청도 제공
Datadog LLM Observability 가격과 약정별 차이
당시 요금 페이지에 따르면 Free는 $0이며 월 LLM 스팬 40,000개, 트레이스 15일 보존, 컨텍스트·평가 무제한, 전체 기능 접근을 제공합니다. Pro는 월 LLM 스팬 100,000개를 포함하고 동일하게 트레이스 15일 보존을 제공합니다. 기본료는 연간 청구 기준 월 $160, 월 단위 $200, 온디맨드 $240입니다.
추가 LLM 스팬 요금은 연간 요율에서 10,000개당 $3.50, 월 단위 $4.20, 온디맨드 $5입니다. 예시의 LLM 스팬 200,000개에서는 총액이 각각 $195, $242, $290입니다. 약정 조건을 명확히 구분해야 합니다. 대표 가격으로 제시한 연간 요율이 월 단위 청구액은 아닙니다.
과금 단위는 트레이스의 모든 작업이 아니라 모델 호출입니다. 공급업체는 툴, 검색, 그 주변 워크플로 스팬을 LLM 스팬으로 과금하지 않는다고 설명합니다. 실행당 모델 호출 두 번이라면 Free 제공량은 다른 플랜 조건도 충족한다는 전제에서 완전한 실행 20,000회에 해당합니다. 툴 계측을 늘려도 유료 LLM 스팬이 늘어나지 않을 수 있지만, 모델을 반복 호출하는 추론 루프는 과금량을 늘립니다.
보존 기간 연장은 가능하지만 이 비교에 사용할 공개 연장 요율은 페이지에 없습니다. 오래된 장애를 조사해야 한다면 그 요구 사항의 견적도 받아야 합니다. 기록을 완전하게 계측했더라도 이미 만료되었다면 이후 고객 분쟁의 근거로 쓸 수 없습니다.
Datadog AI Observability와 기존 운영 스택 연결하기
Agent Observability는 단독 구매가 가능하며 공급업체는 다른 Datadog 구독이 필수는 아니라고 명시합니다. 요금 페이지는 APM, 인프라 모니터링, Real User Monitoring을 함께 사용할 때 데이터를 연관 분석하는 추가 가치도 설명합니다. 처음 도입하는 팀은 관측 기능 구독에 나머지 Datadog 제품까지 포함된다고 생각하지 말고 별도 예산을 잡아야 합니다.
공개된 플랜 전반에 데이터셋, 실험, 평가, 주석, 대시보드가 포함됩니다. 비용 화면은 제공업체, 모델, 프롬프트 식별자 또는 버전별로 사용량을 나누며 트레이스와 스팬에서도 비용을 확인할 수 있습니다. 장애 담당자는 이를 통해 트래픽 증가와 애플리케이션이 수행하는 모델 작업의 변화를 구분할 수 있습니다.
플랫폼 책임자는 적합성 검증에서 연관 분석을 구체적으로 확인해야 합니다. 실패한 에이전트 실행에서 시작해 요청을 따라가며 툴 응답을 담당한 서비스를 찾습니다. 경계를 넘어가도 트레이스 식별 정보가 유지되는지, 운영자가 모델 지연과 다른 곳에서 소비한 시간을 구분할 수 있는지 확인합니다. 구매하려는 것은 이 워크플로이며, 지출 그래프 하나만으로 그 가치를 입증할 수는 없습니다.
SaaS 라이선스와 OpenTelemetry 지원
Datadog은 구독 계약에 따른 상용 SaaS로 이 제품을 제공합니다. 약관에는 호스팅 서비스에 MSA가 적용된다고 명시되어 있습니다. 당시 제품 요금 페이지에는 셀프 호스팅 Agent Observability 백엔드가 없습니다. Datadog Agent나 OTel Collector를 직접 실행한다고 저장소, 인터페이스, 평가 플랫폼까지 직접 호스팅하는 것은 아닙니다.
OpenTelemetry 가이드는 GenAI 시맨틱 규약 1.37 이상 또는 지원되는 OpenInference 규약을 따르는 트레이스를 수신합니다. Datadog Agent나 Agent Observability SDK 없이 직접 수집하는 경로가 문서화되어 있습니다. 예시 익스포터는 OTLP/HTTP protobuf와 dd-api-key, dd-otlp-source=llmobs 헤더를 사용합니다.
외부 평가는 구체적인 연동 조건이 있습니다. 문서는 OTel 스팬에 source:otel 태그와 10진수 문자열 형식의 트레이스·스팬 ID를 요구합니다. 기본 OTel ID는 16진수이므로 전송 전에 변환해야 합니다. 트레이싱이 호환되면 평가도 자동으로 연결된다고 가정하지 말고, 확인된 트레이스에 평가 하나를 붙여 검증해야 합니다.
- 공개된 사용량 과금은 LLM 스팬만 집계하며 툴·검색 스팬은 제외합니다
- 기존 Datadog 운영자가 에이전트 기록을 프로덕션 전반의 맥락과 연결할 수 있습니다
- Free와 Pro에 명시된 평가·실험 기능이 포함됩니다
- Datadog Agent 없이 직접 OTel 데이터를 수집하는 방법이 문서화되어 있습니다
- 가장 낮게 제시된 요율은 연간 약정이 필요합니다
- 공개된 두 플랜 모두 트레이스 보존 기간이 15일입니다
- 다른 Datadog 서비스는 별도로 구매해야 합니다
- 직접 호스팅하는 관측 서버가 아니라 호스팅형 상용 백엔드입니다
팀 규모에 따라 어떤 툴이 적합할까요?
먼저 기록을 보고 조치할 사람이 누구인지 정하고, 애플리케이션이 커질 때 어떤 과금 단위가 늘어나는지 살펴봐야 합니다. 인원수는 예산의 입력값입니다. 담당자가 개발자인지, AI 제품 책임자인지, 장애 대응자인지를 파악하는 일을 대신해 주지는 않습니다.
개발자 한두 명: 첫 프로덕션 리뷰를 마칠 수 있는 무료 제공량부터 선택하면 됩니다. Langfuse Hobby는 두 사람이 화면을 공유하기에 맞지만 실행 한 번에 여러 작업을 기록하면 50,000유닛이 빠르게 소진됩니다. LangSmith Developer는 사용자 한 명에게 맞습니다. 이미 데이터셋 관리와 평가 점수 기반 릴리스 검증이 목표라면 Braintrust Starter가 매력적입니다. 백엔드를 직접 운영하기로 분명히 결정했다면 Phoenix가 맞습니다.
세 명에서 열 명: 여러 개발자와 제품 담당자가 일상적으로 접근해야 한다면 Langfuse Core가 기본 선택입니다. 평가 중심 워크플로에서 데이터, 점수, 보존 기간, 기능 한도가 맞으면 Braintrust Starter의 비용이 더 낮을 수 있습니다. 게이트웨이와 요청 모니터링을 함께 구매한다면 Helicone Pro의 요금이 타당합니다. 리뷰어들이 개발 워크플로를 적극적으로 활용한다면 LangSmith Plus의 사용자 요금을 정당화할 수 있습니다.
여러 직무가 참여하는 더 큰 리뷰 그룹: 품질, 제품, 고객 지원 담당자를 워크스페이스에 추가하기 전에 유료 LangSmith 사용자를 모두 세어야 합니다. 사용자 무제한 플랜은 참여자가 늘어도 구독료를 일정하게 유지할 수 있습니다. 다만 트레이스, 바이트, 평가 점수의 양은 계속 관리해야 합니다. 특정 플랫폼의 워크플로가 구독료 차이보다 더 큰 리뷰 수고를 줄이거나 반복 실패를 예방한다면 선택은 달라집니다.
이미 Datadog을 쓰는 SRE·플랫폼팀: 에이전트 장애를 서비스·사용자 세션과 함께 조사해야 한다면 Datadog을 우선 검토하면 됩니다. 기존 운영 책임과 트레이스 컨텍스트가 갖춰져 있으면 별도 전문 콘솔의 효용이 줄어들 수 있습니다. 모델 외 작업이 많은 에이전트에서는 LLM만 집계하는 더 낮은 사용량 단위도 살펴볼 필요가 있습니다.
사내 호스팅 요건이 있는 팀: Phoenix와 Langfuse는 라이선스와 배포 선택지가 상당히 다르며, Helicone에는 Apache 라이선스 선택지가 있습니다. LangSmith와 Braintrust의 셀프 호스팅에는 상용 Enterprise 계약이 필요합니다. Braintrust의 고객 소유 데이터 플레인도 공급업체 컨트롤 플레인을 사용합니다. 어느 플랜이 저렴한지 판단하기 전에 자체 인프라 안에 무엇이 남아 있어야 하는지 정해야 합니다.
원칙은 명확합니다. 프로덕션 판단을 바꾸는 워크플로에 비용을 지불하고, 그 워크플로가 만드는 기록과 사용자 수를 예측해야 합니다. 어떤 판단이 달라지는지 설명할 수 없다면 도입 범위를 더 좁게 시작하면 됩니다.
OpenTelemetry 지원은 전송 경로와 필드까지 확인해야 합니다
OpenTelemetry 지원은 애플리케이션의 중요한 필드가 수집 후에도 남아 있을 때 의미가 있습니다. OTel은 표준 계측 체계이고 OTLP는 그 텔레메트리를 보내는 프로토콜입니다. 스팬 스트림이 정상적으로 전달되어도 백엔드에 모델 식별 정보, 사용량, 고객 컨텍스트, 툴과 호출자의 관계가 빠질 수 있습니다.
문서에 나온 경로는 제품마다 다릅니다. Langfuse는 OTLP 엔드포인트에서 HTTP JSON 또는 protobuf를 수신하며 gRPC 미지원을 명시합니다. LangSmith는 GenAI, OpenInference 등 속성을 매핑한 OTel 트레이싱을 지원하고 Collector 팬아웃을 설명합니다. Phoenix는 OTLP를 수신하고 OpenInference 계측을 사용합니다. Braintrust에는 트레이스, 스팬 프로세서, 로그 수집 경로가 문서화되어 있습니다. Datadog은 지원하는 GenAI·OpenInference 규약을 지정합니다. Helicone은 OpenLLMetry 비동기 연동을 문서로 제공하지만, 인용한 가이드에서 범용 Collector OTLP 수신기를 확인할 수는 없습니다.
적합성을 검증하려면 대표 실행 하나를 전체 경로에서 보존해야 합니다. 부모·자식 관계, 모델명, 토큰, 비용, 입력·출력 정책, 릴리스 메타데이터를 확인합니다. 두 서비스가 참여한다면 서비스 경계를 넘어 컨텍스트가 전달되는지도 봐야 합니다. 플랫폼이 대화를 세션으로 묶는 경우에는 세션 식별자를 검증해야 합니다. 같은 트레이스 ID가 대화 전체를 포괄한다고 가정해서는 안 됩니다.
엔드포인트 변수를 주의해서 확인해야 합니다. 공용 기본 엔드포인트와 트레이스 신호 전용 엔드포인트는 설정 형식이 다릅니다. 공급업체의 리전, 인증, 경로 지침을 따른 뒤 대상 프로젝트의 기록을 확인합니다. 성공한 HTTP 응답은 수락을 뜻할 뿐, 업무별 귀속이 정확하다는 증거는 아닙니다.
마지막으로 중복 내보내기 경로를 확인해야 합니다. 프레임워크 콜백과 별도 자동 계측 라이브러리가 같은 모델 호출을 관측할 수 있습니다. 비용 급증으로 판단하기 전에 실제 모델 작업이 늘었는지, 같은 작업을 두 번 기록했는지 확인해야 합니다. 실패 분석 툴 비교는 이렇게 얻은 트레이스를 구체적인 디버깅 질문과 연결하는 데 도움이 됩니다.
피해야 할 구매 선택
후보 목록에 있는 제품이어도 하려는 업무와 맞지 않는 구매는 피해야 합니다. 다음은 문서에 명시된 과금·운영 방식과 요구 사항이 맞지 않는 구체적인 경우입니다.
- 공유 비용 화면만을 위한 LangSmith Plus: 예시의 다섯 명 워크로드는 보존 업그레이드와 평가 연산 전 $645입니다. 개선 워크플로가 업무에 포함될 때 지불할 비용이며, 리뷰어를 늘리는 목적도 명확해야 합니다.
- Starter 한도 안의 가벼운 평가를 위한 Braintrust Pro: 예시 비용은 Starter $16, Pro $249입니다. 기능, 보존 기간, 지원 업그레이드를 명확한 이유로 구매해야 합니다.
- ‘Phoenix $50’로 잡은 도입 예산: 그 가격은 AX Pro의 요금입니다. 예시 사용량에서는 AX의 공개 스팬 제공량이 부족하고 초과 요율도 공개되어 있지 않습니다. 직접 운영하는 Phoenix 인프라는 별도 예산입니다.
- 요청이 순간적으로 몰리는 프로덕션 워커의 Helicone Hobby: 월 요청 10,000건 제공이 공개된 분당 로그 10건의 수집 한도를 없애지는 않습니다. 무료 플랜에 의존하기 전에 트래픽 형태를 확인해야 합니다.
- 월 예산 승인에 사용한 Datadog 연간 대표 가격: $160은 연간 요율의 기본료입니다. 월 단위 기본료는 $200이고 예시의 월 요율 총액은 $242입니다.
- 담당자 없는 셀프 호스팅: 무료 라이선스가 백업 복구, 업그레이드, 데이터 접근의 책임자를 정해 주지는 않습니다. 상용 ‘셀프 호스팅 데이터 플레인’도 제품 전체를 자동으로 자체 환경에 옮겨 주지는 않습니다.
숫자가 정밀해 보여도 사용량이 빠진 비용표는 예산 관리에 도움이 되지 않습니다. 확인된 요청의 제공업체 사용량을 저장 기록과 대조하고, 합계를 실제 청구서와 맞춰야 합니다. 관측 플랫폼은 지출을 설명하지만, 중단 정책은 애플리케이션의 다음 행동에 실제로 영향을 줘야 합니다.
첫 실행 과제: 실패한 실행을 릴리스 테스트로 바꾸세요
도입 범위를 넓히기 전에 가치 있는 워크플로 하나를 계측하고, 알고 있는 실패 하나를 재현 가능하게 만들어야 합니다. 주문 조회를 재시도하거나, 잘못된 문서를 선택하거나, 근거 없는 환불 답변을 작성하는 고객 지원 어시스턴트가 좋은 후보입니다. 담당자가 기대 동작을 명확히 설명할 수 있기 때문입니다.

워크플로 담당자, 릴리스 식별자, 업무 결과를 정합니다. 전체 실행을 수집하고 모델·툴 작업을 살펴보며 사용량 필드를 검증합니다. 익스포터가 느리거나 수명이 짧은 워커가 종료될 때 어떻게 되는지도 확인해야 합니다. 첫 도입 검증의 기준은 담당자의 질문에 답할 만큼 충분한 컨텍스트를 담은 기록이 도착하는지입니다.
다음으로 알고 있는 실패를 명확한 기대 결과와 함께 데이터셋에 넣습니다. 기대 결과는 ‘툴 승인 없이 환불을 약속하지 않는다’ 또는 ‘이 고객에게 적용되는 검색된 정책을 인용한다’일 수 있습니다. 결정론적인 규칙에는 코드 검사를 사용하고 판단이 필요한 경우에는 검토된 품질 평가 기준을 사용합니다. 입력과 규칙을 보존해야 나중에 프롬프트나 모델을 바꿔도 같은 테스트를 적용할 수 있습니다.
릴리스 통과 조건을 명시해야 합니다. 평균 점수가 통과했다고 보호하려는 행동의 실패가 가려져서는 안 됩니다. 지정한 어려운 사례의 결과를 검토하고 실패하면 트레이스를 확인합니다. 이후 프로덕션을 샘플링해 데이터셋에 추가할 새 사례를 찾습니다.
다음 구독 결정 전에는 실제 트레이스 수, 트레이스당 작업 수, 모델 호출 수, 저장된 평가 점수, 처리·보존 바이트, 리뷰어 수, 필요한 보존 기간을 기록합니다. 그 수치로 청구액을 다시 계산해야 합니다. 첫 주의 유용한 결과물은 수정된 워크플로와 근거를 설명할 수 있는 예산이며, 각각에 책임자가 있어야 합니다.
자주 묻는 질문
AI 관측에는 어떤 툴이 가장 적합할까요?
프로덕션 트레이스와 비용을 함께 봐야 하는 소규모 팀에는 Langfuse가 기본 선택입니다. 평가로 릴리스를 결정한다면 Braintrust, 사내 백엔드를 직접 운영한다면 Phoenix, 기존 운영 워크플로와 연결하려면 Datadog이 맞습니다. 기본 선택을 다른 전문 툴로 바꿀지는 담당자와 배포 범위에 따라 결정합니다.
LLM에서는 어떤 관측 지표를 봐야 할까요?
토큰과 모델 제공업체 비용, 지연 시간, 오류, 재시도, 검색·툴 결과, 평가 결과를 추적합니다. 고객, 워크플로, 릴리스별로 묶어 확인해야 합니다. 실패한 실행과 재시도가 상당한 지출을 일으킨다면 전체 토큰 수보다 성공한 업무 결과당 비용이 더 유용합니다.
대표적인 관측 툴 3가지를 꼽으면 무엇일까요?
이 비교가 다루는 세 가지 프로덕션 역할을 기준으로, 범용 공유 트레이싱에는 Langfuse, 평가 중심 제품 업무에는 Braintrust, 운영 컨텍스트에는 Datadog을 선택할 수 있습니다. 역할별 후보 목록이며 모든 기능이나 배포에서 측정된 우위를 주장하는 순위는 아닙니다.
LLM 관측에 쓸 수 있는 오픈소스 툴에는 무엇이 있나요?
Langfuse 코어는 MIT 라이선스이고 Helicone 저장소는 Apache 2.0입니다. Phoenix도 무료 셀프 호스팅이 가능하지만 백엔드는 호스팅 서비스 제한이 있는 Elastic License 2.0을 사용합니다. 오픈소스라고 소개하는 모든 제품이 허용적 라이선스라고 생각하지 말고 실제 백엔드 라이선스를 확인해야 합니다.
LLM observability 툴은 어떤 일을 하나요?
대규모 언어 모델 애플리케이션이 어떻게 실행되었는지 기록합니다. 모델 호출, 툴, 검색, 소요 시간, 사용량, 출력 검사가 포함됩니다. 실패한 실행을 설명하고 수정 방향을 정하며 반복 가능한 릴리스 테스트로 바꿀 수 있는 기록이 유용한 결과입니다.
Langfuse 가격은 얼마인가요?
2026년 10월 5일 확인 기준으로 Hobby는 무료, Core 월 $29, Pro 월 $199, Enterprise 월 $2,499입니다. 선택 사항인 Pro Teams 애드온은 월 $300입니다. 유료 플랜에는 트레이스, 관측 기록, 평가 점수의 사용료가 추가됩니다. 이 글에서 가정한 610,000유닛 워크로드는 Core에서 $69.80입니다.
Langfuse를 무료로 사용할 수 있나요?
가능합니다. Hobby에는 월 50,000유닛, 사용자 두 명, 30일간 데이터 접근이 포함됩니다. MIT 라이선스 코어를 소프트웨어 라이선스 비용 없이 직접 호스팅할 수도 있습니다. 다만 인프라 비용과 운영은 직접 부담해야 하며 상용 Enterprise 기능에는 별도 조건이 적용됩니다.
Langfuse 대신 어떤 툴을 선택할 수 있나요?
LangChain·LangGraph 개선 워크플로에는 LangSmith, 게이트웨이 중심 요청 모니터링에는 Helicone, 사내 백엔드에는 Phoenix, 데이터셋과 평가 중심 릴리스에는 Braintrust, 기존 운영 스택에서 발생하는 에이전트 장애에는 Datadog이 맞습니다. 플랫폼을 바꾸기 전에 실제 과금 단위와 필요한 보존 기간을 비교해야 합니다.
Langfuse를 로컬에서 실행할 수 있나요?
가능합니다. Langfuse는 Docker 기반 셀프 호스팅을 문서화하고 MIT 라이선스 코어의 배포 가이드를 제공합니다. 로컬 실행만으로 프로덕션 백업, 가용성, 업그레이드 담당자가 마련되지는 않습니다. 설치 환경을 프로덕션 트레이싱 서비스로 사용할 계획이라면 이 요구 사항도 정해야 합니다.
프로덕션 툴 도입을 확대하기 전에 AI 비즈니스 워크플로 점검 체크리스트를 받아 워크플로, 담당자, 결과, 제어 지점을 정리하세요.
- 마지막 업데이트
- 2026년 10월 5일
- 카테고리
- Build







