Agentes de IA con Vercel AI SDK: cuándo paga la suscripción y cuándo la API

Vercel AI SDK ya puede cargar el uso del modelo a una suscripción autenticada en el host. Descubre qué credencial paga y por qué Sandbox se cobra aparte.

Tuesday, September 15, 2026Omid Saffari
Agentes de IA con Vercel AI SDK: cuándo paga la suscripción y cuándo la API

El 14 de septiembre de 2026, Vercel cambió la cuenta que puede asumir el costo de un agente de programación integrado. Con AI SDK, los agentes de IA ahora pueden usar una suscripción compatible cuya sesión ya esté iniciada en el host: la siguiente ejecución apta del modelo tendrá un cargo incremental de $0 hasta que se agote el cupo del plan. El cómputo de Sandbox se sigue facturando aparte.

Agentes de IA con Vercel AI SDK: cambia quién paga, no el agente

AI SDK ofrece una capa para ejecutar agentes de programación completos mediante una única interfaz HarnessAgent. Vercel llama harness a cada adaptador porque no se limita a envolver una llamada al modelo: el agente conserva sus propias herramientas, el funcionamiento de su espacio de trabajo, el estado de la sesión, los permisos y la compactación.

La diferencia es importante. Esta novedad no mejora la capacidad de Claude Code, Codex, Cursor ni de ningún otro agente para programar. Lo que hace es dar al adaptador un nuevo lugar donde buscar credenciales: la sesión de una suscripción nativa guardada en la máquina que ejecuta la aplicación.

Antes, una ejecución integrada necesitaba credenciales explícitas del proveedor o de AI Gateway. Ahora, un adaptador apto puede recurrir a la suscripción que ya está autenticada en el host. No hace falta cambiar el código de la aplicación ni configurar nada nuevo para detectarla.

El anuncio menciona nueve adaptadores: Claude Code, Cline, Codex, Cursor, fx, GitHub Copilot, Grok Build, OpenCode y Pi. Eso no garantiza la función para todas las cuentas. El agente subyacente debe admitir el inicio de sesión mediante suscripción, y las reglas de su propio plan siguen determinando qué uso permite esa sesión.

La consecuencia práctica para el negocio es sencilla: una misma llamada a agent.generate() puede terminar en tres partidas presupuestarias distintas, según las credenciales disponibles en el entorno.

El orden de las credenciales decide la factura

Hay tres modos de autenticación. El predeterminado es auto. En adaptadores directos como Claude Code y Codex, el orden práctico es el siguiente:

ModoPrioridad de credencialesDónde se carga el uso del modelo
autoPrimero AI Gateway; después, las credenciales del proveedor; por último, una suscripción nativaCréditos o factura de Gateway si existe VERCEL_OIDC_TOKEN o AI_GATEWAY_API_KEY; de lo contrario, la cuenta de API del proveedor; y, como última opción, el cupo del plan
directPrimero las credenciales del proveedor; después, una suscripción nativaLa cuenta de API del proveedor si existe su clave; en caso contrario, el cupo del plan
ai-gatewaySolo AI GatewayCréditos de Gateway o la factura de Vercel; las suscripciones nativas nunca se consultan

Aquí es donde una variable de entorno aparentemente inocua cambia la contabilidad. Una ejecución de Claude Code en modo direct usará ANTHROPIC_API_KEY o ANTHROPIC_AUTH_TOKEN antes que la suscripción de Claude. Una ejecución de Codex usará OPENAI_API_KEY o CODEX_API_KEY antes que el cupo incluido en ChatGPT.

auto añade un nivel por encima. Si encuentra credenciales de Gateway, estas tienen prioridad tanto sobre la clave del proveedor como sobre la suscripción.

La ruta de red y la fuente de facturación no coinciden en todos los adaptadores. fx sigue enviando las solicitudes del modelo a través de AI Gateway en direct y ai-gateway, pero ahora puede usar una suscripción nativa compatible cuando no hay credenciales de entorno aplicables y no se seleccionó ai-gateway. Antes de interpretar esta tabla como un mapa universal del tráfico, conviene consultar la página del adaptador.

Modelo arquitectónico de rutas con entradas Auto, Direct y Gateway que conducen al cupo de la suscripción, a la API del proveedor o a la facturación de AI Gateway
El modo de autenticación elige la ruta, pero las credenciales presentes en ella siguen decidiendo qué cuenta paga.

Esta separación de seguridad es mejor que copiar directamente un token OAuth dentro de una máquina aislada. Vercel resuelve las credenciales en el host y renueva allí la autenticación OAuth. Cuando el sandbox admite la transformación de solicitudes, el agente solo ve un marcador de posición y el host inyecta la credencial real únicamente en la solicitud saliente correspondiente.

Así se mantiene el secreto fuera del sandbox. Lo que no se consigue es convertir una suscripción personal en capacidad compartida para toda la empresa.

Cómo se calculan realmente los costos

El cargo del modelo puede trasladarse a un cupo. No ocurre lo mismo con el costo del entorno de ejecución.

Cupo de la suscripción

Claude Code es, hoy, el ejemplo más claro. Claude Pro cuesta $20 con pago mensual o $200 por un año, mientras que Claude Max cuesta $100 o $200 al mes e incluye 5x o 20x el uso de Pro. Para quien ya paga uno de esos planes, una ejecución apta con autenticación nativa no añade un cargo separado por el modelo hasta agotar el cupo compartido.

La palabra compartido es clave. Anthropic afirma actualmente que Claude Agent SDK, claude -p y las aplicaciones de terceros basadas en Agent SDK siguen consumiendo los límites de la suscripción. También indica que claude.ai, Claude Code y Claude Desktop consumen el mismo límite de uso. Como el adaptador de Claude Code para Vercel usa el Agent SDK de Anthropic, la lectura práctica es que el trabajo integrado compite con las demás tareas de Claude del suscriptor.

OpenAI aplica una lógica presupuestaria similar, aunque con medidores diferentes. ChatGPT Plus cuesta $20 al mes, Codex está incluido en los planes de ChatGPT y los límites varían según el plan. Codex comparte un cupo de uso para agentes con ChatGPT Work, ChatGPT for Excel y Workspace Agents allí donde esos productos están disponibles. Los usuarios aptos de Plus y Pro pueden comprar créditos cuando agotan el uso incluido, pero no se trata de créditos de API.

Por tanto, la ruta de la suscripción no significa que la inferencia sea gratuita. Es capacidad prepagada con un techo variable. Llevar tareas en segundo plano al adaptador puede ahorrar cargos de API hoy y dejar mañana menos margen para la sesión interactiva de esa persona.

API directa del proveedor

Si prevalece una clave del proveedor, el cargo recae en su cuenta de consumo medido. Claude Sonnet 4.6 cuesta actualmente $3 por millón de tokens de entrada y $15 por millón de tokens de salida con las tarifas estándar de la API. GPT-5.6 Luna de OpenAI cuesta $0.20 por millón de tokens de entrada, $0.02 por millón de tokens de entrada en caché y $1.20 por millón de tokens de salida.

Esos precios facilitan atribuir el gasto de la ruta de API, pero no permiten predecir con facilidad el costo de una tarea realizada por un agente de programación. El tamaño del repositorio, el historial de la conversación, el esfuerzo de razonamiento, los reintentos y los bucles de uso de herramientas modifican el consumo de tokens. La unidad que conviene medir es la tarea completada, no el prompt.

AI Gateway

Cuando prevalece una credencial de Gateway, el consumo aparece en AI Gateway. Vercel cobra el precio de lista del proveedor sin recargo por tokens ni comisión de plataforma. La fuente de pago habitual son los créditos prepagados de Gateway; los clientes Enterprise también pueden utilizar una factura consolidada de Vercel.

Esta ruta reúne el gasto del equipo en un solo lugar. También permite usar los presupuestos de Gateway. Esos controles no se aplican a una ejecución que eluda Gateway para usar una suscripción nativa. Por eso, la elección entre ahorro marginal y control presupuestario central debe ser deliberada.

Cómputo de Sandbox

Todos los entornos de ejecución de agentes de AI SDK siguen funcionando dentro de un sandbox. En la región predeterminada iad1 de Vercel, Sandbox cuesta $0.128 por hora de CPU activa y $0.0212 por GB-hora aprovisionado. La CPU se pausa mientras el proceso espera operaciones de E/S del modelo o de la red, pero la memoria se sigue contabilizando durante todo el tiempo de ejecución.

El propio ejemplo de Vercel para validar código con IA dura cinco minutos y usa dos vCPU y cuatro GB de memoria. Cuesta alrededor de $0.03 con un uso de CPU del 100%. Si los $20 de crédito Pro estuvieran disponibles por completo y solo para esa carga exacta, el cálculo daría un techo aproximado de 666 ejecuciones antes de comenzar a pagar por Sandbox. La capacidad real será distinta: otros servicios de Vercel pueden consumir el crédito, cada tarea usa recursos diferentes y la transferencia o el almacenamiento pueden añadir costos.

Este es el presupuesto completo:

  • Ruta de suscripción: precio del plan existente, cupo compartido y Sandbox.
  • Ruta del proveedor: tokens medidos por el proveedor y Sandbox.
  • Ruta de Gateway: tokens al precio de lista del proveedor, cargados al saldo o a la factura de Gateway, y Sandbox.

Qué ruta conviene para cada caso de uso de agentes de IA

Un fundador que ejecuta un asistente interno para repositorios

Un fundador que ya paga Claude Pro o ChatGPT Plus puede implementar con HarnessAgent una herramienta de bajo volumen para corregir pruebas o resumir repositorios, seleccionar direct y dejar que la suscripción cubra el trabajo apto del modelo. Durante el piloto, la ventaja es no tener que mantener otro saldo para el modelo.

Conviene mantener el alcance dentro de la empresa y vigilar la página de consumo del proveedor. Esa misma suscripción también paga el trabajo de la persona en la terminal y en las aplicaciones, de modo que una tarea en segundo plano puede gastar la capacidad que necesitará más tarde ese mismo día.

Un responsable técnico de una agencia que estandariza tareas operativas

Una agencia puede asignar a cada operador concreto una tarea acotada sobre un repositorio y usar en el host la suscripción apta de esa persona. El control decisivo no es qué adaptador se elige, sino confirmar antes de la ejecución que no existan variables de API del proveedor.

Así, el área de finanzas obtiene una regla clara: primero se usa el cupo del plan para trabajo interno acotado; la API del proveedor solo entra cuando se monta una clave de forma intencional. También se evita compartir el inicio de sesión de una persona con toda la agencia.

Un equipo de plataforma para desarrolladores con automatizaciones compartidas

Por lo general, un equipo de plataforma debería fijar los trabajos desatendidos o compartidos en ai-gateway. Se pierde la ventana de cargo incremental de $0 que ofrece la suscripción, pero a cambio el equipo obtiene un único titular de facturación, un fondo común de créditos o una factura y controles de gasto alineados con el servicio, no con una persona.

La explicación anterior del adaptador fx conserva un dato importante: ambos modos de fx envían las solicitudes del modelo a través de AI Gateway. Lo que cambió el 14 de septiembre fue el mecanismo de respaldo de las credenciales. Ahora, sus apartados de configuración y costos deben contemplar una suscripción nativa compatible cuando no existe una credencial de mayor prioridad.

Un fundador de SaaS que vende trabajo de agentes a sus clientes

Una función de programación orientada a clientes no debería depender de la suscripción de un empleado para planificar su capacidad. El tráfico de clientes es compartido, variable y debe resistir los cambios de personal. La opción adecuada es AI Gateway o una cuenta de API del proveedor con un responsable explícito, incorporando también Sandbox a la economía unitaria.

La comparativa independiente de agentes de programación que usan suscripciones existentes explica qué cliente local o de código abierto conviene a un desarrollador que ya tiene un plan. Esta novedad trata de integrar un entorno de ejecución compatible dentro de una aplicación de AI SDK. El inicio de sesión puede ser parecido; el modelo operativo, no.

Ejecutar una tarea de Claude Code con el cupo del plan

Esta ruta sirve para una tarea interna acotada en un host donde el usuario identificado ya inició sesión en Claude Code. Selecciona direct expresamente mediante la configuración documentada del adaptador de Claude Code, de modo que el token OIDC de Vercel pueda autenticar Sandbox sin dirigir el trabajo del modelo a Gateway.

  1. Instalar los paquetes documentados

    En un proyecto Node existente, hay que añadir el paquete central del agente, el adaptador de Claude Code y el adaptador de Vercel Sandbox.

    Bash
    pnpm add @ai-sdk/harness @ai-sdk/harness-claude-code @ai-sdk/sandbox-vercel
  2. Iniciar sesión en el host

    Hay que ejecutar Claude Code en el mismo host y elegir la cuenta de Claude que tenga la suscripción apta.

    Bash
    claude

    VERCEL_OIDC_TOKEN debe mantenerse disponible para Sandbox. Si la suscripción debe pagar, hay que revisar el entorno del proceso y retirar de esta ejecución ANTHROPIC_API_KEY y ANTHROPIC_AUTH_TOKEN. Cualquiera de esas variables del proveedor tiene prioridad sobre el inicio de sesión nativo.

  3. Forzar la ruta directa

    El siguiente código debe guardarse como agent.mjs. Emplea el selector documentado direct, el entorno de ejecución actual node24 de Sandbox y el puerto expuesto 4000 que necesita el puente.

    JavaScript
    import { HarnessAgent } from '@ai-sdk/harness/agent';
    import { createClaudeCode } from '@ai-sdk/harness-claude-code';
    import { createVercelSandbox } from '@ai-sdk/sandbox-vercel';
    
    const agent = new HarnessAgent({
      harness: createClaudeCode({ auth: 'direct' }),
      model: 'claude-sonnet-4-6',
      sandbox: createVercelSandbox({
        runtime: 'node24',
        ports: [4000],
      }),
    });
    
    const session = await agent.createSession();
    
    let exitCode = 0;
    try {
      const result = await agent.generate({
        session,
        prompt: 'Create a short TODO.md for this repository.',
      });
    
      console.log(result.text);
    } catch (err) {
      exitCode = 1;
      console.error(err);
    } finally {
      await session.destroy();
      process.exit(exitCode);
    }
  4. Comprobar ambos recibos

    Hay que ejecutar una tarea inocua. Después, se verifica que la página de consumo del proveedor muestre movimiento en el cupo del plan, pero ningún cargo nuevo de API. Por último, se consulta en Vercel Usage la línea correspondiente a Sandbox.

    Si AI Gateway registra la solicitud del modelo, prevaleció una credencial de Gateway. Si el panel de la API del proveedor registra un cargo, prevaleció una credencial del proveedor. Antes de ampliar el piloto, hay que detenerse y corregir el entorno.

Los límites reales

El inicio de sesión nativo está vinculado al host. No es un flujo OAuth listo para cada cliente de una aplicación ni permite reunir en un fondo común los cupos individuales de un equipo.

La capacidad del plan también varía. OpenAI señala que los límites de Codex dependen del plan y de la tarea. Anthropic indica que el uso de Claude depende del modelo, la complejidad de la tarea, el contexto y el esfuerzo. Ninguna de las dos empresas asigna a esta ruta de Vercel un número fijo de trabajos de producción.

Los paquetes de agentes de AI SDK siguen siendo experimentales y pueden introducir cambios incompatibles entre versiones. Es un riesgo aceptable en un piloto interno medido. También es un motivo para fijar las dependencias, probar qué credencial resulta elegida y preparar una ruta de Gateway o del proveedor antes de convertirla en una promesa para clientes.

La acción para el lunes

Hay que elegir una tarea interna sobre un repositorio y un usuario apto. Se configura el adaptador en direct, se hace un inventario de las variables del proveedor presentes en ese host, se ejecuta la tarea una vez y se registra qué panel de facturación mostró movimiento, si cambió el cupo de la suscripción, cuánto cobró Sandbox y si la tarea terminó.

Conviene actuar esta semana si ya existe un plan compatible y un flujo interno acotado. Es mejor esperar si el agente subyacente no puede iniciar sesión mediante suscripción o si el carácter experimental del paquete queda fuera de la política de dependencias. Hay que mantener ai-gateway si los presupuestos centrales y la titularidad compartida de producción importan más que el ahorro marginal del modelo. Este cambio no afecta a quienes usan proveedores de modelos convencionales de AI SDK y nunca usan HarnessAgent.

Para recibir más explicaciones prácticas sobre las herramientas de IA que cambian presupuestos y flujos de trabajo reales, está disponible el boletín.

Última actualización
15 sept 2026
Categoría
Explained

Prefiera este sitio en Google

Añadir omidsaffari.com como fuente preferida en la Búsqueda de Google

Marque omidsaffari.com como fuente preferida y Google lo destacará para usted en Top Stories, AI Overviews y AI Mode.

Automatización de navegador con Cloudflare: destinos aprobados y revisión de solo lectura

Automatización de navegador con Cloudflare: destinos aprobados y revisión de solo lectura

Limita la automatización de navegador a dominios aprobados, identifica los CDN necesarios y permite revisar cada sesión con Live View en modo de solo lectura.14 sept 2026Explained
Agente de voz IA: el costo real de llamar con GPT-Live-1

Agente de voz IA: el costo real de llamar con GPT-Live-1

Calcula el costo real de un agente de voz IA con GPT-Live-1: sesión de voz, razonamiento, herramientas, telefonía y costo por llamada resuelta.14 sept 2026Explained
ChatGPT para Windows: Appshots reduce la copia manual de contexto

ChatGPT para Windows: Appshots reduce la copia manual de contexto

Con Appshots, ChatGPT para Windows adjunta la ventana activa a un chat. Aprende a configurar la función, medir el ahorro y evitar exponer datos sensibles.14 sept 2026Explained
Cómo la CDN de Vercel reduce el uso de Functions en FastAPI

Cómo la CDN de Vercel reduce el uso de Functions en FastAPI

Vercel ahora sirve archivos estáticos elegibles de FastAPI desde su CDN. Descubre qué solicitudes dejan de usar Functions y cuáles aún las necesitan.13 sept 2026Explained
Clave API OpenAI: cómo rotarla antes de que caduque

Clave API OpenAI: cómo rotarla antes de que caduque

Planifica la rotación de una clave API OpenAI antes de su caducidad: responsable, ventana de reemplazo, presupuesto y verificación sin interrupciones.13 sept 2026Explained
Gestión de credenciales en Vercel Connect: quién debe tener el control

Gestión de credenciales en Vercel Connect: quién debe tener el control

Vercel Connect ya permite asignar un responsable a los conectores compartidos. Así funciona el permiso Connector Manager y dónde están sus límites.13 sept 2026Explained
Cloudflare R2: cómo indexar archivos sin extensión con AI Search

Cloudflare R2: cómo indexar archivos sin extensión con AI Search

Cloudflare R2 ya permite que AI Search indexe archivos sin extensión mediante un Content-Type válido. Descubre qué cambia y qué trabajo sigue pendiente.12 sept 2026Explained
Vercel Sandbox 64 GB: más espacio para tareas de agentes

Vercel Sandbox 64 GB: más espacio para tareas de agentes

Vercel Sandbox duplica el disco de trabajo de 32 GB a 64 GB. Descubre qué cambia para repositorios, compilaciones y agentes de código más grandes.12 sept 2026Explained
Newsletter

Una carta, cada domingo.Sistemas que funcionan, no opiniones calientes.

Semanal. Sin spam. Cancele cuando quiera.