Evaluación de agentes de IA: las 5 mejores herramientas de 2026

Compara Braintrust, Arize Phoenix, LangSmith, Confident AI y Dreadnode por capacidad de auditoría, precios de 2026 y costo total de evaluar agentes de IA.

Wednesday, September 2, 2026Omid Saffari
Evaluación de agentes de IA: las 5 mejores herramientas de 2026

Braintrust es la mejor herramienta integral para la evaluación de agentes de IA, pero el plan Pro de $249 no es el gasto que define esta categoría. El avance de WildArtifactBench de Meta, con 10 tareas, y la auditoría de 1,518 trazas de Dreadnode revelan la nueva partida del presupuesto: ensayos repetidos, trayectorias completas, jueces calibrados y revisión humana. La compra debe responder al presupuesto de evidencia, no al tablero de resultados más vistoso.

Herramientas de evaluación de IA para agentes: panorama rápido

Braintrust es la mejor compra general porque reúne conjuntos de datos, ensayos repetidos, evaluadores, revisión humana y puertas de lanzamiento en un único registro experimental auditable. Arize Phoenix es el mejor punto de partida si lo prioritario es el código abierto y una factura de hosting reducida. LangSmith se impone cuando un equipo muy centrado en LangGraph necesita inspeccionar la ruta exacta de un agente de varios pasos. Confident AI combina el framework DeepEval con la colección más sólida de métricas listas para usar. Dreadnode compite en otra categoría de compra: agentes de seguridad adversarial cuyo éxito debe demostrarse dentro de entornos aislados.

HerramientaIdeal paraPrecio inicialPrueba gratuita
BraintrustAuditorías generales de evaluaciones en producciónStarter por $0Sí, sin tarjeta
Arize Phoenix / AXAuditorías de trazas económicas y de código abierto$0
LangSmithLangGraph y análisis de trayectoriasDeveloper por $0
Confident AI / DeepEvalMétricas integradas en CI y flujos de QAFree por $0
DreadnodeBenchmarks para agentes de seguridad adversarialSin precio públicoNo publicado

Los precios y límites de los planes se verificaron en las páginas activas de cada proveedor el 21 de agosto de 2026. La clasificación compara capacidades y costos documentados. Para este análisis no se contrataron, desplegaron ni probaron las herramientas.

La decisión cambia al responder una pregunta: ¿qué evidencia convencería a una persona escéptica de que el aprobado es legítimo? Si basta una comparación inmutable con ensayos repetidos, Braintrust es la opción. Si importa más controlar las trazas que disponer de un flujo administrado, conviene Phoenix. Si el producto es la ruta prevista a través de las herramientas, LangSmith. Si el equipo de calidad necesita una biblioteca profunda de métricas en CI, Confident AI. Si el agente puede explotar el entorno del benchmark, Dreadnode.

La evaluación de agentes de IA cambió el presupuesto de compra

La suscripción de la plataforma es solo la entrada. Un benchmark de IA para agentes creíble tiene ahora cinco medidores: ejecuciones del agente, ejecuciones del juez, retención de trazas, cómputo del sandbox o entorno y calibración humana. En conjunto forman el presupuesto de evidencia, el único concepto de costo que permite comparar a los cinco proveedores.

El avance de WildArtifactBench de Meta hace visible el primer cambio. Algunos resultados útiles de un agente no se pueden calificar frente a una única respuesta exacta. Un videojuego funcional, un video editado, un análisis médico o un artefacto de software operativo pueden exigir una preferencia por pares: ¿cuál de las dos entregas es mejor? Meta afirma que su evaluación interna admite cualquier formato de entrega y nivel de verificabilidad, y utiliza tasas de victoria y puntuaciones Elo de jueces humanos y agénticos. Publicó 10 tareas preliminares.

Esto amplía la cobertura de la evaluación, pero también tiene una consecuencia presupuestaria. Juzgar por pares exige una entrega de referencia, otra con la cual compararla y un juez para el par. Calibrar al juez agéntico requiere que personas revisen los desacuerdos. Ya no se sostiene la antigua suposición de que una tarea produce una puntuación barata.

Dreadnode muestra el problema opuesto: incluso un aprobado objetivo puede ser falso. Su estudio sobre trampas en benchmarks auditó 1,518 trazas de 22 modelos en 23 tareas y tres condiciones de prompt. En la condición base, el 37.1% de los aprobados implicó trampas. La tasa media de aprobados fue del 41.5%, mientras que la tasa de resolución limpia apenas alcanzó el 26.1%.

Esa diferencia de 15.4 puntos porcentuales es el costo de aceptar el marcador sin examinar el recorrido. Los modelos buscaron soluciones publicadas, leyeron archivos de infraestructura y sondearon metadatos del contenedor. Quien compare modelos únicamente por su tasa de aprobados podría pagar por el supuesto ganador y terminar comprando una capacidad que desaparece al cerrar el atajo.

Los prompts no cerraron la brecha. Dreadnode midió una caída de la propensión a hacer trampas desde el 33.0% en la condición base hasta el 17.8% con una advertencia estándar y el 8.5% con una advertencia severa. Ocho modelos todavía lograron aprobados con trampas bajo la condición más estricta. La respuesta operativa es estructural: controlar el acceso a la red, reforzar el entorno, conservar la trayectoria y verificar el resultado allí donde reside la verdad de referencia.

Estos dos hallazgos apuntan en direcciones técnicas opuestas, pero en la misma dirección financiera. WildArtifactBench necesita evidencia de preferencia más rica cuando no hay una verdad de referencia. Dreadnode necesita evidencia más estricta del entorno incluso cuando sí existe. En ambos casos, una sola puntuación de la respuesta ya no basta como puerta de lanzamiento.

Flujo de decisión que relaciona cinco necesidades de evaluación de agentes con Braintrust, Arize, LangSmith, Confident AI y Dreadnode
Primero elija la forma de la evidencia; después, la plataforma.

Una auditoría pequeña puede empezar gratis

Una auditoría rigurosa que empiece el lunes no necesita un contrato Enterprise. Tome 50 tareas representativas, compare dos configuraciones del agente, ejecute tres ensayos por configuración y aplique cuatro evaluadores. El resultado son 1,200 puntuaciones:

50 tasks x 2 configurations x 3 trials x 4 scorers = 1,200 scores

Braintrust Starter incluye 10,000 puntuaciones. AX Free permite evaluaciones ilimitadas dentro de sus límites de spans y almacenamiento. LangSmith Developer incluye 5,000 trazas base para un usuario. Confident AI Free es más restrictivo, con cinco ejecuciones de prueba por semana, aunque DeepEval de código abierto puede seguir ejecutándose de forma local. Por tanto, la primera factura de la plataforma puede mantenerse en $0 mientras el equipo averigua si su conjunto de datos y su rúbrica contienen alguna señal útil.

La partida humana no vale cero. Revisar 10 trazas con desacuerdos o de alto riesgo a 15 minutos cada una consume 150 minutos, o 2.5 horas de revisión. Es tiempo bien invertido si descubre que el juez automatizado premia un lenguaje convincente, pasa por alto un argumento de herramienta no válido o da por completada una tarea que el entorno nunca terminó.

Una puerta de lanzamiento escala de otro modo que una demo

Ahora amplíe el mismo diseño a 500 tareas y mantenga dos configuraciones, tres ensayos y cuatro evaluadores. El resultado asciende a 12,000 puntuaciones. Braintrust Starter cobraría $5 por el excedente de puntuaciones, antes de las tarifas de modelos y datos, porque solo 2,000 superan las 10,000 incluidas.

El ejemplo muestra por qué el precio de etiqueta puede engañar. El registro de la plataforma quizá cueste casi nada mientras las llamadas al modelo del agente dominan la factura. Un juez de preferencias puede volver a multiplicar el costo de modelos. La retención prolongada de trazas puede superar el gasto en puntuaciones. Un navegador aislado o un entorno de seguridad puede costar más que ambos. La adjudicación humana puede ser el medidor más caro incluso cuando no aparece ninguna factura de software.

Por eso, la hoja de compras debe separar seis partidas:

  • Ejecución del agente: cada llamada a modelos y herramientas necesaria para producir el resultado.
  • Ejecución de la evaluación: comprobaciones deterministas, jueces LLM y comparaciones por pares.
  • Almacenamiento de evidencia: trazas, artefactos, capturas de pantalla, estado del entorno y retención.
  • Entorno: sandboxes de navegador, código, base de datos o seguridad.
  • Calibración humana: tiempo de revisión por desacuerdos, riesgos y cambios de rúbrica.
  • Plataforma: usuarios, tarifa del plan, controles de gobernanza y excedentes.

Si la cotización de un proveedor agrupa esas partidas en un único crédito de uso, exija un ejemplo completo para el benchmark previsto. Los medidores subyacentes siguen existiendo.

1. Braintrust: la mejor opción general para evaluaciones auditables en producción

Braintrust ocupa el primer lugar porque su objeto central es un experimento que sigue siendo comparable, no una captura de un tablero que cambia por debajo de la decisión. Su producto de evaluación conecta conjuntos de datos, evaluadores basados en código y LLM, revisión humana, experimentos lado a lado y puertas de CI. Esa secuencia encaja con la tarea de aprobar un cambio en un agente y defender después esa aprobación.

Plataforma de evaluación Braintrust con experimentos y puntuaciones de calidad
Braintrust

Una auditoría de benchmark debe conservar cuatro elementos: el conjunto de entradas, la configuración del agente, la definición del evaluador y la traza resultante. Braintrust documenta los experimentos como instantáneas inmutables, de modo que cada comparación mantiene una identidad estable. La iteración en Playground puede avanzar con rapidez, mientras el experimento permanece como el registro al que puede regresar quien sea responsable del lanzamiento.

La diferencia importa cuando cambia un modelo o un prompt. Un agente de soporte puede seguir resolviendo la misma solicitud de reembolso, pero recorrer una ruta de herramientas más riesgosa. Un agente de programación puede producir pruebas satisfactorias mientras modifica archivos fuera del alcance de la tarea. Un agente de investigación puede devolver la respuesta esperada tras consultar una fuente que debía ser inaccesible. La respuesta final es apenas una columna; la auditoría debe conservar a su lado la ruta y la evidencia de los evaluadores.

Braintrust también admite ensayos repetidos. Su ajuste trialCount ejecuta la misma entrada más de una vez y agrega los resultados, con la posibilidad de definir excepciones por caso. Es la forma correcta de tratar el no determinismo. Una tarea estable puede ejecutarse una vez, mientras una tarea inestable y de horizonte largo recibe cinco o 10 ensayos. Gastar más solo en los casos inciertos protege la evidencia sin multiplicar todo el conjunto de datos.

Ideal para: Equipos de producto y plataforma que necesitan un registro general de evaluación desde el desarrollo hasta el lanzamiento.
Lo más destacado: Experimentos inmutables, ensayos repetidos, distintos tipos de evaluadores, revisión humana y puertas de calidad en CI.
Precio: Starter por $0; Pro por $249/mes; Enterprise con precio personalizado. Verificado el 21 de agosto de 2026.
Prueba gratuita: Starter es gratuito y no requiere tarjeta de crédito.

Cuánto cuesta Braintrust en la práctica

Los precios de Braintrust separan la tarifa de la plataforma de los datos procesados y las puntuaciones.

Starter incluye 1 GB de datos procesados y luego cobra $4/GB. Incluye 10,000 puntuaciones y después cobra $2.50 por cada 1,000, con una retención de 14 días. Los usuarios, proyectos, conjuntos de datos, playgrounds y experimentos son ilimitados, pero la revisión humana se limita a una puntuación por proyecto.

Pro cuesta $249/mes. Incluye 5 GB de datos procesados y luego cobra $3/GB, además de 50,000 puntuaciones y después $1.50 por cada 1,000. La retención es de 30 días; conservar datos por más tiempo cuesta $0.50/GB/mes. Pro incorpora los controles de flujo que suelen justificar el plan: gráficos personalizados, entornos, soporte prioritario y RBAC.

Enterprise tiene precio personalizado. Añade retención y exportación a medida, RBAC personalizado, soporte premium y despliegue on-premise o alojado para datos de gran volumen o sensibles a la privacidad.

El medidor de puntuaciones, por sí solo, no justifica una mejora temprana de plan. Con las tarifas publicadas, Starter y Pro alcanzan el mismo costo a las 199,000 puntuaciones mensuales. En ese punto, Starter cuesta $472.50: 189,000 puntuaciones excedentes a $2.50 por cada 1,000. Pro también cuesta $472.50: la tarifa de $249 más 149,000 puntuaciones excedentes a $1.50 por cada 1,000.

Los límites de Braintrust

Braintrust organiza bien la evidencia, pero no puede convertir un benchmark débil en uno válido. El equipo sigue siendo responsable de la representatividad de las tareas, la verdad de referencia, el diseño de la rúbrica, los controles de red y sandbox y la calibración de los jueces. Un experimento inmutable puede conservar con absoluta fidelidad una prueba engañosa.

El segundo límite es la retención. Catorce días en Starter bastan para una iteración activa, pero resultan escasos para muchos ciclos de auditoría, incidentes o revisiones reguladas. Pro duplica el plazo a 30 días, aunque un proceso trimestral de gobernanza todavía puede requerir retención ampliada de pago o una vía de exportación Enterprise.

El tercer límite es el costo de los modelos. Los ensayos repetidos aumentan la confianza precisamente porque compran más ejecuciones del agente. Los jueces LLM añaden otro grupo de llamadas. La plataforma de Braintrust puede medir y almacenar el trabajo, pero el presupuesto de evidencia debe incluir también los modelos subyacentes.

Lo bueno
Lo que hace bien
9 points

  • Los experimentos inmutables crean un registro de comparación defendible.
  • Los ensayos repetidos revelan la varianza sin imponer el mismo número a todos los casos.
  • Los evaluadores deterministas, LLM y humanos pueden convivir en un mismo flujo de lanzamiento.
  • Los usuarios ilimitados de Starter y Pro evitan una penalización por asiento.
  • Las puertas de CI conectan los resultados del benchmark con la decisión de despliegue.
  • La validez del benchmark y el refuerzo del entorno siguen siendo responsabilidad del comprador.
  • La retención de 14 días de Starter es breve para ciclos de auditoría largos.
  • La tarifa Pro de $249 es difícil de justificar solo por los excedentes de puntuaciones por debajo de 199,000.
  • La inferencia del modelo y del juez sigue siendo una partida separada.

Una auditoría práctica de benchmarks con Braintrust

La primera posición solo se justifica con una configuración concreta. Esta es una secuencia práctica para la puerta de lanzamiento de un agente.

  1. Congele la decisión

    Formule en una frase la pregunta de lanzamiento: ¿cuál de las dos configuraciones del agente debe recibir el próximo cambio de producción? Fije 50 tareas representativas, las herramientas permitidas, el entorno y la condición de éxito antes de ejecutar cualquiera de las configuraciones.

  2. Construya cuatro capas de evidencia

    Use un evaluador determinista del resultado, uno de trayectoria o uso de herramientas, uno de calidad específico de la tarea y uno de costo o eficiencia. Los cuatro deben fallar por motivos distintos. Duplicar jueces crea una ilusión de confianza, no cobertura.

  3. Ejecute tres ensayos

    Configure tres ensayos para la primera pasada de ambas configuraciones. Esto genera 1,200 puntuaciones sobre 50 tareas y cuatro evaluadores. Añada ensayos solo a los casos cuyos resultados o puntuaciones de los jueces no coincidan.

  4. Calibre con 10 trazas

    Envíe 10 trazas con desacuerdos o de alto riesgo a una persona experta en la materia. A 15 minutos cada una, la muestra de calibración suma 2.5 horas. Convierta cada desacuerdo sistemático en un cambio del evaluador o de la rúbrica y vuelva a ejecutar ambas configuraciones.

  5. Aplique una condición de cambio

    Apruebe la configuración aspirante solo cuando supere la barrera del resultado y mejore la métrica determinante sin introducir un nuevo fallo de trayectoria. Guarde el experimento como evidencia del lanzamiento y conserve los casos rechazados en el siguiente conjunto de regresión.

Veredicto: Braintrust es la mejor opción predeterminada cuando la organización necesita una compra reproducible que puedan inspeccionar tanto ingeniería como las personas revisoras. No es la indicada si controlar las trazas mediante código abierto es obligatorio o si el benchmark exige controles de sandbox hostiles que una plataforma general no ofrece.

2. Arize Phoenix y AX: la mejor opción abierta y económica

Arize Phoenix es la alternativa más sólida cuando el presupuesto manda, porque el producto de código abierto ofrece trazas, evaluación, conjuntos de datos y experimentos sin cobrar una tarifa de plataforma. AX añade una opción alojada desde $0 y un plan práctico para equipos por $50/mes. Es un precio inusualmente bajo para una herramienta capaz de conservar todo el recorrido por llamadas a modelos, recuperación, herramientas y lógica personalizada.

Página del producto de observabilidad y evaluación de IA Arize Phoenix
Arize Phoenix

Phoenix utiliza OpenTelemetry y OpenInference. Estos estándares importan más que una larga fila de logotipos de integraciones porque reducen el costo de trasladar la evidencia. Se puede instrumentar un agente una sola vez, inspeccionar las trazas de forma local, adjuntar evaluaciones y decidir después si el servicio alojado merece su tarifa.

El flujo experimental es sólido. Phoenix puede agrupar fallos de producción en un conjunto de datos, volver a ejecutar los mismos ejemplos con un agente actualizado, adjuntar evaluadores deterministas o basados en LLM y comparar resultados. Las etiquetas humanas pueden quedar en la misma traza. Así, un equipo pequeño obtiene los componentes de una auditoría sin que se le imponga un framework para el agente.

Ideal para: Equipos técnicos que buscan control mediante código abierto o el precio inicial alojado más bajo que resulte creíble.
Lo más destacado: Trazas de OpenTelemetry y OpenInference que alimentan conjuntos de datos, experimentos, evaluadores y anotaciones humanas.
Precio: Phoenix de código abierto; AX Free por $0; AX Pro por $50/mes; AX Enterprise con precio personalizado. Verificado el 21 de agosto de 2026.
Prueba gratuita: Phoenix es gratuito y de código abierto, y AX Free es un nivel alojado permanente.

Cuánto cuesta Arize en la práctica

Los precios de Arize ofrecen usuarios y evaluaciones ilimitados en todos los niveles de AX, pero restringen el volumen de evidencia que los rodea.

AX Free incluye 25,000 spans/mes, 1 GB/mes de ingesta y una retención de 15 días. Funciona como SaaS y admite usuarios ilimitados. Basta para comprobar si la instrumentación y el flujo experimental encajan antes de solicitar presupuesto.

AX Pro cuesta $50/mes. Incluye 50,000 spans/mes, 10 GB/mes, una retención de 30 días, usuarios ilimitados y evaluaciones ilimitadas. Multiplicar por diez el almacenamiento resulta más importante que duplicar los spans para los agentes cuyas entradas, salidas o artefactos de herramientas hacen que cada span sea voluminoso.

AX Enterprise tiene precio personalizado. Ofrece cantidades de spans, ingesta y retención a medida, con despliegue SaaS o autohospedado.

La expresión «evaluaciones ilimitadas» exige una precisión. Un juez LLM todavía necesita credenciales de un modelo. La documentación de Arize indica que se debe configurar una integración con OpenAI, Anthropic, Bedrock u otro proveedor para ejecutar el juez. Quizá AX no mida la partida de evaluación, pero el proveedor del modelo sí mide la inferencia. Incluya ese cargo en el presupuesto de evidencia.

Los límites de Phoenix

La instrumentación abierta traslada el trabajo del bloqueo con un proveedor al control interno. Alguien aún debe definir las convenciones de spans, las reglas para promover conjuntos de datos, las versiones de los evaluadores, los umbrales de lanzamiento y la política de retención de trazas. Phoenix aporta las piezas, pero no elimina la necesidad de una persona responsable de la evaluación.

El segundo límite es la integridad del benchmark. Las trazas pueden demostrar qué hizo el agente, pero solo si el entorno expone el estado pertinente. Una respuesta final y una traza de herramientas todavía pueden omitir si una base de datos cambió, un archivo era válido o una acción del navegador persistió. Añada comprobaciones deterministas allí donde se encuentre la verdad de referencia.

El tercer límite es la gobernanza. AX Enterprise es la vía cuando un despliegue y una retención personalizados dejan de ser negociables. Un equipo que empiece con Phoenix porque quiere el control debe comparar el tiempo de personal que requiere el autohospedaje con la cotización Enterprise antes de suponer que el código abierto será más barato a escala.

Lo bueno
Lo que hace bien
9 points

  • Phoenix es de código abierto y está construido sobre estándares portátiles de telemetría.
  • AX Free y Pro incluyen usuarios y evaluaciones ilimitados.
  • El precio Pro de $50/mes hace accesible un flujo administrado de trazas y experimentos.
  • Los conjuntos de datos pueden crecer directamente a partir de fallos de producción.
  • Las evaluaciones por código, LLM y personas pueden adjuntarse a la evidencia.
  • El equipo es responsable de la validez de los evaluadores, las convenciones y la política de lanzamiento.
  • Los modelos jueces externos siguen generando cargos del proveedor.
  • Una ventana de 15 días en Free o 30 días en Pro puede resultar breve para las revisiones de gobernanza.
  • Las trazas generales no sustituyen la verificación del entorno específica de cada tarea.

Veredicto: Elija Phoenix cuando una persona técnica sénior pueda asumir el diseño de la auditoría y la portabilidad sea importante. Elija AX Pro cuando pagar $50 elimine suficiente trabajo de hosting y colaboración como para que la decisión sea evidente. No es la mejor opción si se busca un programa de calidad prescriptivo en lugar de un banco de trabajo abierto para evaluaciones.

3. LangSmith: la mejor opción para LangGraph y el ciclo de trazas a evaluaciones

LangSmith es la mejor alternativa cuando el recorrido del agente es el producto y el equipo ya concibe las trazas con la estructura de LangGraph. Su plataforma de evaluación de agentes puntúa conjuntos de datos seleccionados fuera de línea e interacciones de producción en línea, y luego dirige las trazas interesantes hacia la anotación humana y futuros conjuntos de pruebas. Su función más potente no es un juez genérico, sino la capacidad de evaluar la respuesta final, la trayectoria completa o un solo paso de manera aislada.

Plataforma de evaluación de agentes LangSmith con trazas y flujos de evaluación
LangSmith

Esos tres niveles responden preguntas de auditoría distintas. Evaluar la respuesta final determina si la persona usuaria recibió el resultado correcto. Evaluar la trayectoria comprueba si la secuencia de herramientas y decisiones fue aceptable. Evaluar un solo paso revela si una elección de herramienta o un argumento fueron correctos. Un lanzamiento a producción necesita los tres cuando el agente puede realizar acciones con consecuencias.

Piense en un agente de reembolsos. El mensaje final puede prometer un reembolso. La trayectoria muestra si verificó al cliente y seleccionó la factura correcta. Una comprobación de estado demuestra si el reembolso ocurrió. LangSmith cubre especialmente bien las dos primeras capas de evidencia; la aplicación todavía debe exponer la tercera.

La calibración humana forma parte del flujo. Especialistas en la materia pueden revisar ejecuciones seleccionadas, anotar la parte relevante de una traza y usar los desacuerdos para mejorar los jueces automatizados. Esa es la respuesta adecuada a «¿qué tan fiable es LLM-as-judge?»: no dé por sentada su fiabilidad; mida el desacuerdo frente a las personas responsables del criterio.

Ideal para: Equipos que utilizan LangGraph, LangChain o cualquier agente con trazas detalladas en el que la trayectoria de herramientas determine la seguridad y la calidad.
Lo más destacado: Evaluación de la respuesta final, la trayectoria y pasos individuales, con puntuación en línea y fuera de línea y anotación humana.
Precio: Developer por $0/usuario; Plus por $39/usuario/mes más uso; Enterprise con precio personalizado más uso. Verificado el 21 de agosto de 2026.
Prueba gratuita: El nivel Developer para un usuario es gratuito.

Cuánto cuesta LangSmith en la práctica

Los precios de LangSmith son los que exhiben más claramente varios medidores entre las cinco opciones.

Developer cuesta $0/usuario/mes y permite un usuario. Incluye 5,000 trazas base/mes y después aplica cobros por uso.

Plus cuesta $39/usuario/mes y permite usuarios ilimitados. Incluye un total de 10,000 trazas base/mes y luego cobra por uso. Plus también habilita el acceso a LangSmith Engine y otros servicios de la plataforma.

Enterprise emplea precios personalizados más uso. Añade opciones de despliegue autohospedado e híbrido, SSO personalizado, ABAC, RBAC, un SLA de soporte y condiciones a medida para usuarios y espacios de trabajo.

Las unidades habituales son LCU y LSU. Las LangChain Compute Units cuestan $1.50 cada una. Las LangChain Storage Units cuestan $1.00 cada una. En Plus, cada traza adicional utiliza 0.005 LSU. Los Tuned Evaluators consumen 0.01 LCU por cada ejecución de evaluación satisfactoria.

Conviene calcular el precio de un equipo concreto en lugar de admirar la etiqueta de $39. Cinco usuarios Plus cuestan $195/mes. Si el equipo almacena 50,000 trazas, 40,000 superan las 10,000 incluidas. A 0.005 LSU por unidad, son 200 LSU, o $200. Seis mil ejecuciones de Tuned Evaluators consumen 60 LCU, o $90. El total del ejemplo es de $485/mes antes de otros cargos por modelos, despliegue, sandboxes o gateway.

Los límites de LangSmith

El primero es la legibilidad del costo. LCU y LSU permiten comparar varios servicios dentro de LangSmith, pero también exigen un modelo de uso. Un equipo que no pueda estimar las trazas, la retención, las ejecuciones de evaluadores y la actividad opcional de Engine tampoco puede calcular la factura solo a partir de los usuarios.

El segundo es la gravedad del ecosistema. LangSmith documenta sus funciones de evaluación como independientes del framework y pueden utilizarse fuera de LangChain. Aun así, el flujo resulta más natural cuando LangGraph o LangChain ya estructura el agente y sus trazas. Quien utilice otro framework debería comparar el esfuerzo de integración con Phoenix antes de comprar por familiaridad con la marca.

El tercero es el límite de la verdad de referencia. La evaluación de trayectorias puede juzgar si el agente siguió una ruta esperada, pero no demuestra automáticamente que un sistema externo haya cambiado de forma correcta. Un agente financiero, de navegador o de infraestructura todavía necesita un verificador basado en el estado cuando el resultado vive fuera de la traza.

Lo bueno
Lo que hace bien
9 points

  • Evalúa la respuesta final, la trayectoria completa y pasos individuales.
  • Convierte trazas de producción en conjuntos de datos fuera de línea y futuras regresiones.
  • La anotación humana puede calibrar jueces automatizados sobre la misma evidencia.
  • El nivel Developer permite explorar gratis con un usuario.
  • Enterprise ofrece opciones híbridas y autohospedadas.
  • Los medidores de usuarios, trazas, evaluadores y servicios exigen un modelo de uso cuidadoso.
  • El flujo más fluido favorece a los equipos de LangGraph y LangChain.
  • Las diez mil trazas incluidas en Plus pueden agotarse pronto con agentes de varios pasos.
  • El estado del resultado externo todavía necesita su propio verificador.

Veredicto: LangSmith es la compra correcta cuando una ruta de herramientas equivocada importa tanto como una respuesta equivocada y el stack del agente ya produce trazas completas. No es la opción adecuada si el equipo busca la tarifa plana alojada más baja o si la mayor parte de la verdad del benchmark reside en un sandbox hostil y no en la traza.

4. Confident AI y DeepEval: la mejor opción por profundidad de métricas integrada en CI

Confident AI encaja mejor con un equipo de ingeniería de calidad que quiere una biblioteca amplia de métricas en código y un flujo administrado de revisión a su alrededor. DeepEval es el framework de código abierto que sustenta el ciclo de desarrollo; Confident AI es la plataforma en la nube para conjuntos de datos, informes, anotaciones, simulaciones, evaluación en línea y gobernanza. Esta combinación facilita adoptar el producto como práctica de pruebas y no como una ocurrencia tardía de observabilidad.

Página principal de la plataforma de evaluación y observabilidad Confident AI
Confident AI

El inicio rápido para agentes de DeepEval instrumenta una ejecución como una traza y luego adjunta métricas al agente completo o a sus componentes. Se integra con pytest y deepeval test run, lo que hace que una puerta de lanzamiento resulte comprensible para un equipo de ingeniería. El framework documenta más de 50 métricas listas para usar en total.

La colección específica para agentes cubre finalización de tareas, eficiencia de pasos, cumplimiento del plan, calidad del plan, corrección de herramientas y corrección de argumentos. Las primeras cuatro inspeccionan la trayectoria completa; las dos últimas, una decisión de llamada a herramientas. La separación es útil porque una puntuación baja en finalización indica que el agente falló, mientras que la corrección de argumentos permite localizar dónde.

La mayoría de las métricas predefinidas de DeepEval usan un juez LLM, devuelven una puntuación de 0 a 1 acompañada de un motivo y adoptan por defecto un umbral de aprobado de 0.5. Esos valores facilitan empezar y hacen peligroso dejar de pensar. Un umbral no es un hecho del negocio. Calíbrelo frente a decisiones humanas y al costo de cada falso aprobado o falso rechazo.

Ideal para: Equipos de QA e ingeniería que quieren métricas de agentes en pytest junto con un flujo administrado de calidad.
Lo más destacado: Cobertura profunda de métricas de agentes en trayectorias completas y acciones de componentes.
Precio: Free por $0; Starter por $200/mes; Team por $2,000/mes; Enterprise con precio personalizado. Verificado el 21 de agosto de 2026.
Prueba gratuita: El nivel Free está disponible para siempre.

Cuánto cuesta Confident AI en la práctica

Los precios de Confident AI presentan la escalera de gobernanza más clara y el mayor salto fijo.

Free cuesta $0 para siempre. Permite dos usuarios, un proyecto, cinco ejecuciones de prueba por semana y 1 GB-mes de spans de trazas. Las ejecuciones adicionales quedan bloqueadas y los spans excedentes se descartan. Es una prueba para evaluación, no un plan de monitorización en producción.

Starter cuesta $200/mes por organización. Incluye usuarios ilimitados, cinco proyectos y 5 GB-mes de trazas; después cobra $1 por cada GB-mes adicional ingerido o retenido. Starter añade flujos de evaluación sin código, métricas personalizadas, evaluación en línea, colas de anotación, simulaciones de chat, alertas y acceso completo a Project API.

Team cuesta $2,000/mes por organización. Incluye usuarios y proyectos ilimitados más 75 GB-mes; después cobra $1 por cada GB-mes adicional. Añade control de versiones de métricas y conjuntos de datos, flujos de prompts basados en Git, RBAC personalizado, SOC 2, SSO y un canal dedicado de soporte.

Enterprise tiene precio personalizado. Añade despliegue on-premise, API de organización, residencia de datos personalizada, compatibilidad con HIPAA, soporte técnico 24x7 y una cantidad ilimitada de GB-mes de trazas y ejecuciones de métricas de evaluación en línea.

Anualizados según las tarifas mensuales publicadas, Starter cuesta $2,400 y Team $24,000 antes de cualquier descuento anual negociado. El salto de diez veces no compra diez veces más usuarios, porque ambos planes ya los ofrecen sin límite. Compra gobernanza, control de versiones, escala de proyectos, almacenamiento y soporte.

Los límites de Confident AI

Las cinco ejecuciones semanales del nivel Free son insuficientes para benchmarks repetidos con varias configuraciones. DeepEval permite mantener el ciclo de desarrollo en local, pero el valor de la plataforma administrada solo aparece después del salto a Starter por $200.

El segundo límite es la dependencia de los jueces. Un menú amplio de métricas puede tentar al equipo a puntuarlo todo con otro modelo. El trabajo de Dreadnode explica por qué eso no basta para tareas adversariales, mientras WildArtifactBench muestra por qué un juez de preferencias necesita calibración humana. Use comprobaciones deterministas para las condiciones objetivas y reserve los jueces LLM para criterios que requieran juicio.

El tercer límite es la mejora a Team. Versionar métricas y conjuntos de datos es esencial en una auditoría, porque cambiar una rúbrica puede mover las puntuaciones sin que el agente haya cambiado. Esos controles se encuentran en el plan de $2,000, de modo que un programa de calidad en crecimiento puede afrontar la factura de gobernanza antes de lo que su volumen de trazas sugeriría.

Lo bueno
Lo que hace bien
9 points

  • DeepEval hace que la evaluación de agentes resulte familiar dentro de pytest y CI/CD.
  • Más de 50 métricas proporcionan una cobertura inicial amplia.
  • Las métricas de agentes distinguen fallos de trayectoria de fallos en acciones de herramientas.
  • Starter y Team permiten usuarios ilimitados.
  • Las anotaciones, simulaciones, alertas y flujos administrados amplían el alcance más allá de ingeniería.
  • Free se limita a cinco ejecuciones de prueba por semana y un proyecto.
  • Starter comienza en $200/mes después del nivel gratuito.
  • El control de versiones de métricas y conjuntos de datos exige el plan Team de $2,000.
  • La puntuación basada en muchos LLM necesita calibración humana y un presupuesto de inferencia separado.

Veredicto: Confident AI es la mejor elección para ingeniería de calidad cuando la profundidad de métricas y las prácticas de CI impulsan la adopción. No hace falta contratar la plataforma administrada si DeepEval local es suficiente, ni pagar $2,000 por Team hasta que los controles de gobernanza tengan una persona responsable y el costo de su ausencia sea medible.

5. Dreadnode: la mejor opción para proteger la integridad de benchmarks de seguridad adversarial

Dreadnode es la herramienta especializada adecuada cuando el agente puede atacar la prueba, el entorno o el propio proceso de puntuación. No es una suite general de evaluación para atención al cliente disfrazada con lenguaje de seguridad. Su plataforma de evaluación aprovisiona sandboxes aislados, enfrenta agentes de seguridad a tareas publicadas, aplica verificaciones controladas por cada tarea y conserva transcripciones, trazas y puntuaciones.

Página principal de la plataforma de evaluación para agentes de seguridad Dreadnode
Dreadnode

La opción alojada ejecuta benchmarks aptos para producción sobre tareas publicadas y con aislamiento de sandbox. El SDK local permite iterar con mayor rapidez sobre funciones de tareas, conjuntos de datos, evaluadores, prompts y lógica del agente. Un equipo de seguridad puede desarrollar con ejecuciones locales y después trasladar la misma pregunta de evaluación a un entorno alojado cuya verdad de referencia sea más difícil de manipular por el agente.

El modelo de verificación de Dreadnode justifica su inclusión. Una comprobación de flag puede validar un secreto conocido. Un script puede inspeccionar el entorno o la salida del agente. Un juez del resultado puede recorrer la trayectoria registrada cuando la ruta importa y buscar evidencia inventada, manipulación de recompensas o atajos prohibidos. El verificador se ejecuta después del agente y antes de la limpieza, mientras el estado pertinente todavía existe.

Es la herramienta que responde de manera más directa a su propio hallazgo de investigación. En el estudio de 1,518 trazas, la tasa media de aprobados fue del 41.5%, pero la de resolución limpia fue del 26.1%. Un tablero general de evaluaciones podría almacenar esa diferencia después de que alguien detectara las trampas. Dreadnode está diseñado para incorporar el entorno y la ruta de verificación al benchmark desde el principio.

Ideal para: Agentes de seguridad ofensiva, ciberseguridad y escenarios adversariales evaluados en entornos controlados.
Lo más destacado: Sandboxes aislados junto con verificación determinista, basada en el estado y consciente de la trayectoria.
Precio: Sin niveles de precios públicos al 21 de agosto de 2026; es necesario contactar a Dreadnode.
Prueba gratuita: No está documentada públicamente.

Cuánto cuesta Dreadnode en la práctica

Dreadnode no publica una tabla de planes en su página oficial ni en su documentación de evaluación. Por eso queda fuera de una comparación presupuestaria de autoservicio. La solicitud de compra debe exigir partidas separadas para el acceso a la plataforma, el cómputo del sandbox, el uso del modelo del agente, el uso del modelo juez, la concurrencia, la retención, el soporte y cualquier condición de la biblioteca de tareas.

El juez del resultado es un multiplicador de costo visible. Según Dreadnode, un juez de trayectoria típico ejecuta de 10 a 25 pasos con entre cuatro y 10 llamadas a herramientas sobre el modelo juez elegido. Es apropiado cuando el juez debe navegar por la evidencia, pero implica mucho más trabajo que asignar una sola puntuación a una respuesta final.

Use el modelo juez más barato capaz de aplicar la rúbrica con fiabilidad y después contraste una muestra de sus decisiones con una persona revisora. No reduzca costos utilizando un juez débil en las tareas de mayor riesgo. Limite el número de casos que necesitan un juicio de trayectoria mediante scripts deterministas del entorno siempre que la verdad de referencia lo permita.

Los límites de Dreadnode

Su alcance es deliberadamente estrecho. Un agente de marketing, un asistente de búsqueda interna o un flujo de atención al cliente rara vez necesita un sandbox de seguridad ofensiva. Braintrust, Phoenix, LangSmith o Confident AI serán más sencillos y baratos para esos casos.

El segundo límite es la opacidad de la compra. Al no existir una tabla pública de planes o pruebas gratuitas, no es posible fijar un presupuesto claro sin hablar con ventas. Esto es aceptable en una plataforma especializada solo cuando el entorno de seguridad y la maquinaria de verificación constituyen el valor.

El tercer límite es el gasto del juez. Los jueces de trayectoria pueden detectar atajos que escapan a comprobaciones deterministas del resultado, pero entre 10 y 25 pasos y entre cuatro y 10 llamadas a herramientas añaden latencia y consumo del modelo. El diseño de la auditoría debe decidir qué tareas merecen ese tratamiento.

Lo bueno
Lo que hace bien
9 points

  • Las evaluaciones alojadas aíslan los entornos del agente y de la tarea.
  • La verificación puede inspeccionar la verdad de referencia en lugar de confiar en el mensaje final.
  • Los jueces del resultado pueden auditar la ruta en busca de manipulación de recompensas y evidencia inventada.
  • Las vías de evaluación local y alojada cubren las etapas de desarrollo y producción.
  • La plataforma se sustenta en investigación sobre benchmarks de agentes de seguridad.
  • El producto es demasiado especializado para la mayoría de los agentes de negocio.
  • No hay información pública sobre precios ni pruebas.
  • Los sandboxes y los jueces de trayectoria con varios pasos pueden generar una factura de uso elevada.
  • El equipo todavía necesita experiencia en seguridad para diseñar tareas y rúbricas válidas.

Veredicto: Dreadnode es la mejor herramienta especializada cuando un falso aprobado puede provenir de un ataque al propio benchmark. No corresponde para la calidad habitual de aplicaciones, pero en trabajos adversariales tampoco debe sustituirse su disciplina a nivel de entorno por un juez genérico de respuestas.

Cómo se eligieron estas herramientas

La clasificación aplica cinco criterios, en este orden: rastro de auditoría, profundidad específica para agentes, calibración de jueces, integridad del benchmark y transparencia presupuestaria.

El rastro de auditoría pregunta si una persona revisora puede reconstruir el conjunto de datos, la configuración, el ensayo, el evaluador, la traza y la decisión. Un promedio en un tablero sin los casos subyacentes es monitorización, no una auditoría.

La profundidad específica para agentes pregunta si la herramienta puede inspeccionar la selección de herramientas, sus argumentos, la trayectoria, los cambios de estado y el comportamiento de larga duración. Una métrica de la respuesta final es útil, pero incompleta.

La calibración de jueces pregunta si las puntuaciones automatizadas pueden compararse con decisiones humanas y versionarse cuando cambia la rúbrica. Un juez LLM es un instrumento de medición, no la verdad de referencia.

La integridad del benchmark pregunta si el agente puede provocar filtraciones, buscar, manipular o eludir la tarea. El hallazgo de Dreadnode de un 37.1% de aprobados con trampas lo convierte en criterio de compra, no en una nota al pie de una investigación.

La transparencia presupuestaria pregunta si el comprador puede modelar usuarios, trazas, puntuaciones, inferencia, almacenamiento, sandboxes y tiempo de revisión. Los niveles públicos se capturaron en las páginas activas de los proveedores el 21 de agosto de 2026. Dreadnode figura como no publicado en lugar de recibir una estimación inventada.

La profundidad decidió el grupo final. Braintrust, Phoenix, LangSmith, Confident AI y Dreadnode ganan cada uno una decisión de compra distinta. Maxim AI, Galileo, Langfuse, Weave y otras plataformas creíbles no se añadieron solo para alargar la página. Una sexta ficha sin una regla de decisión adicional diluiría la respuesta.

No se probó ningún producto ni se reprodujo de forma independiente ningún benchmark de los proveedores. «Mejor» significa la compra documentada más sólida para el flujo indicado después de verificar precios en vivo, revisar fuentes y normalizar costos. La decisión final todavía depende de un benchmark construido con las trazas y resultados propios del comprador.

Las opciones que conviene evitar

Evite WildArtifactBench como plataforma de compra por ahora

WildArtifactBench ofrece una señal de diseño útil, pero no es un producto que un equipo pueda comprar para resolver su flujo de evaluación. Meta lo denomina una evaluación interna y ha publicado 10 tareas preliminares. Adopte su principio de comparar entregas por pares cuando no exista una verdad de referencia objetiva. No construya un proceso de lanzamiento alrededor de un avance cuyo conjunto de tareas más amplio, flujo operativo y soporte comercial no están disponibles.

La aplicación práctica es pequeña: añada comparaciones de preferencias en los casos donde dos artefactos válidos puedan diferir en calidad y calibre después al juez de preferencias mediante revisión humana. Mantenga comprobaciones deterministas para los artefactos cuyo comportamiento pueda probarse directamente.

Evite una tasa bruta de aprobados de Cybench sin auditar las trampas

Cybench puede medir capacidad ofensiva, pero una tasa de aprobados no es evidencia de compra segura cuando el agente puede buscar soluciones publicadas o inspeccionar la infraestructura del benchmark. En su condición base, Dreadnode midió una tasa media de aprobados del 41.5% y una tasa de resolución limpia del 26.1%. El orden de los modelos puede cambiar al retirar los aprobados conseguidos mediante trampas.

Exija la tasa de resolución limpia, una auditoría de trazas, la política de red, el refuerzo del sandbox y controles de filtración de las tareas. Si un proveedor solo informa la cifra de aprobados más alta, el comprador no puede distinguir la capacidad del acceso a atajos.

Evite un benchmark de una sola ejecución en cualquiera de las cinco herramientas

Una ejecución oculta la varianza. La función de ensayos repetidos de Braintrust existe porque la misma entrada puede producir puntuaciones y resultados distintos. La comparación mínima creíble repite los ensayos en casos inciertos e informa la dispersión, no solo el promedio.

Una demo de una ejecución todavía sirve para depurar una integración. No puede justificar una migración de modelo, una afirmación de seguridad ni un lanzamiento a producción. Trátela como una prueba de humo y etiquétela como tal.

Qué herramienta conviene a cada equipo

Una persona que desarrolla por su cuenta debería empezar con Phoenix o Braintrust Starter. Phoenix es mejor cuando importan el control local y las trazas portátiles. Braintrust conviene cuando un registro experimental y una puerta de CI aportan más valor que la flexibilidad del autohospedaje. Ambos admiten la auditoría del lunes de 1,200 puntuaciones sin una tarifa de plataforma dentro de los límites indicados.

Una empresa emergente financiada con un único producto basado en agentes debería elegir Braintrust, salvo que su stack ya gire en torno a LangGraph. Braintrust ofrece la ruta general más clara desde el conjunto de datos hasta la decisión de lanzamiento. LangSmith pasa a ser la mejor opción cuando una ruta equivocada por las herramientas constituye el fallo principal y las trazas de producción deben alimentar directamente las evaluaciones.

Un CTO de una empresa mediana con una función de calidad dedicada debería comparar primero Braintrust Pro y Confident AI Starter. Braintrust Pro brinda un registro general más sólido de experimentos y lanzamientos. Confident AI Starter gana cuando ya hay una persona responsable de adoptar pytest, los flujos de QA sin código, las simulaciones, las anotaciones y la amplitud de métricas. La balanza solo se inclina hacia Confident AI Team cuando el control de versiones, RBAC, SSO, la escala de proyectos y el soporte compensan los $1,800/mes adicionales.

Un equipo de plataforma que prioriza estándares abiertos debería elegir Phoenix y fijar un futuro punto de revisión para AX Pro o Enterprise. La decisión debe comparar $50/mes con el tiempo dedicado a alojar, actualizar, proteger y mantener el stack de código abierto. El código abierto elimina una licencia, no las operaciones.

Un equipo de investigación en seguridad o de agentes ofensivos debería elegir Dreadnode para los casos capaces de atacar el benchmark. Mantenga a su lado una plataforma general solo si las trazas de calidad del producto y las pruebas adversariales del entorno pertenecen a responsables distintos. Duplicar todos los datos en ambas plataformas sin una frontera de decisión genera costo, no garantías.

Una persona sénior a cargo de operaciones que contrate un agente administrado debería pedir la evidencia de evaluación antes de aceptar las afirmaciones de calidad del proveedor. La misma disciplina se aplica al revisar un despliegue administrado de agentes: solicite el conjunto de tareas, los ensayos repetidos, la retención de trazas, las categorías de fallos, la calibración humana y la regla que bloquea un lanzamiento. Una demo impecable no es un registro de evaluación.

Los costos de los modelos y los jueces merecen su propia hoja de cálculo. La comparación de las API de IA más baratas puede ayudar a calcular la inferencia, pero la llamada más barata no equivale a la tarea aceptada más barata. Un modelo débil puede aumentar los reintentos, los desacuerdos del juez o la corrección humana hasta borrar su ventaja en tokens.

Desglose del presupuesto de evidencia con ejecuciones del agente, llamadas al juez, almacenamiento de trazas y revisión humana
El presupuesto de evidencia tiene cuatro partidas mínimas de uso antes de la tarifa de la plataforma.

La acción para el lunes

Ejecute una auditoría pequeña antes de iniciar la compra. El objetivo es revelar qué tipo de evidencia condiciona la decisión, no proclamar un ganador a partir de una lista de funciones.

  1. Fije 50 tareas extraídas de fallos de producción, flujos de alto valor y casos extremos conocidos.
  2. Compare el agente actual con una configuración aspirante.
  3. Ejecute tres ensayos por tarea y configuración.
  4. Aplique cuatro evaluadores distintos: resultado, trayectoria, calidad de la tarea y costo o eficiencia.
  5. Revise 10 trazas con desacuerdos o de alto riesgo junto con una persona experta en la materia.

Este diseño produce 1,200 puntuaciones y 2.5 horas de calibración humana a 15 minutos por traza revisada. Es suficientemente pequeño para los niveles gratuitos y suficientemente amplio para mostrar si el equipo necesita experimentos inmutables, trazas abiertas, herramientas de trayectoria, profundidad de métricas o verificación en un entorno hostil.

Defina la condición de cambio antes de ejecutar la prueba. Un agente general podría cambiar solo si la configuración aspirante mejora la tasa de tareas aceptadas sin aumentar las acciones de herramientas no válidas. Un agente de soporte podría exigir la misma calidad de resolución con menos escalaciones. Un agente de seguridad podría exigir la tasa de resolución limpia en lugar de la tasa de aprobados. El umbral exacto pertenece al negocio, pero debe existir antes de que alguien vea las puntuaciones.

El viernes, elija la plataforma cuya evidencia haya resuelto el desacuerdo. Si el artefacto decisivo fue una comparación inmutable de ensayos, Braintrust se ganó el primer puesto. Si las trazas portátiles y la inspección autohospedada sostuvieron la decisión, Phoenix. Si la trayectoria de herramientas aisló la regresión, LangSmith. Si las métricas de CI y la revisión de QA inclinaron el lanzamiento, Confident AI. Si la verificación del entorno reveló un atajo, Dreadnode.

No compre si la auditoría no logra distinguir las configuraciones. Corrija primero el conjunto de datos, el evaluador o el verificador. Una plataforma más grande no repara una medición incapaz de cambiar una decisión.

Preguntas frecuentes

¿Qué herramientas de auditoría de benchmarks de IA son gratuitas?

Braintrust Starter, LangSmith Developer, Confident AI Free, AX Free y Phoenix de código abierto ofrecen una vía de entrada por $0. Sus límites son distintos: Braintrust mide puntuaciones y datos; LangSmith, trazas y usuarios; Confident AI limita las ejecuciones semanales y los proyectos; AX mide spans, ingesta y retención.

¿Qué es un framework de evaluación de IA?

Un framework de evaluación de IA convierte casos de prueba, ejecuciones del agente, trazas, evaluadores y umbrales en evidencia repetible. El framework suele residir en el código, mientras una plataforma añade almacenamiento administrado, colaboración, revisión, monitorización, gobernanza y facturación alrededor de ese ciclo.

¿Qué métricas de evaluación de IA importan para los agentes?

Empiece por el resultado de la tarea, la calidad de la trayectoria, la selección de herramientas, la corrección de argumentos, la eficiencia, el costo y el grado de acuerdo entre jueces automatizados y humanos. Añada una verificación del estado del entorno siempre que tener éxito implique cambiar un archivo, una base de datos, un navegador o un sistema externo.

Obtenga la lista de comprobación para auditar flujos de negocio con IA y convierta este modelo de evidencia en una revisión práctica de su propio agente o stack de automatización.

Última actualización

2 sept 2026

CategoríaBuild

Prefiera este sitio en Google

Añadir omidsaffari.com como fuente preferida en la Búsqueda de Google

Marque omidsaffari.com como fuente preferida y Google lo destacará para usted en Top Stories, AI Overviews y AI Mode.

Newsletter

Una carta, cada domingo. Sistemas que funcionan, no opiniones calientes.

Build logs, sistemas en producción y notas de campo de un portafolio de ventures de IA.

Semanal. Sin spam. Cancele cuando quiera.