Vercel AI Gateway: cómo limitar el gasto de cada usuario
Configura presupuestos por usuario en Vercel AI Gateway, separa las claves de producción y evita que un solo miembro agote el gasto del equipo.

Un agente de programación descontrolado ya no tiene por qué compartir el mismo interruptor financiero que una aplicación en producción. El 31 de agosto de 2026, Vercel AI Gateway incorporó presupuestos por usuario: el gasto de las claves de API atribuidas a un miembro puede detenerse sin interrumpir una clave de producción atribuida al equipo, siempre que esa clave y el equipo aún tengan presupuesto disponible. La novedad cambia cómo se controla la factura, no el precio de los modelos.

La idea clave, en una sola frase
Asigna un presupuesto individual a las claves de agentes que pertenecen a personas y deja las claves compartidas de producción a nombre del equipo.
Ese es todo el mecanismo. El presupuesto de un usuario acumula el gasto de todas las claves de AI Gateway atribuidas al mismo miembro. Cuando se agota, las nuevas solicitudes realizadas con esas claves devuelven un HTTP 402, mientras que el tráfico ajeno a ese presupuesto puede continuar.
Antes de este lanzamiento, Vercel permitía fijar topes para el equipo, un proyecto o una clave de API concreta. El nuevo nivel por usuario se suma a esos controles para resolver otro problema: una misma persona puede utilizar varias claves en Codex, Claude Code, Cursor u otra carga de trabajo desatendida, pero finanzas necesita un solo límite para todo el gasto de esa persona en el gateway.
Qué gasto asigna Vercel AI Gateway a cada usuario
El ajuste decisivo es la atribución del gasto (Spend attribution): la etiqueta de propiedad que Vercel asigna a una clave de API para contabilizarla dentro de los presupuestos.
Las claves nuevas se atribuyen de forma predeterminada a User. Por compatibilidad con versiones anteriores, las claves antiguas sin atribución siguen asociadas a Team. Una clave creada mediante la API sin metadata.spendAttribution también se contabiliza dentro de Team.
Esto da lugar a cuatro rutas de solicitud diferentes:
El gasto no se reparte entre esos presupuestos: se registra simultáneamente en todos los contadores aplicables. Una solicitud hecha con una clave atribuida a un miembro debe caber en el presupuesto de la clave, en el presupuesto personal de ese miembro y en el presupuesto del equipo. Si cualquiera de los tres se agota, la solicitud se detiene.

Por eso, el tráfico compartido de producción exige una decisión explícita. Si un desarrollador crea una clave nueva para una aplicación orientada a clientes, esa clave queda atribuida de forma predeterminada al desarrollador y su presupuesto personal podría detener la aplicación. En la página de claves de API de AI Gateway, cambia Spend attribution a Team para que solo se apliquen los presupuestos de esa clave y del equipo.
Cómo cambian las cuentas del negocio
Los límites por usuario convierten un riesgo compartido en presupuestos que pueden asignarse antes de que llegue la factura.
Tomemos un ejemplo ilustrativo, no un precio de Vercel. Un equipo de 8 personas tiene un presupuesto mensual de $1,000. Siete miembros reciben un valor predeterminado de $50 al mes. La persona responsable obtiene un presupuesto personalizado de $150 porque su función requiere agentes con cargas más intensivas.
El margen total para las claves personales queda así:
7 × $50 + 1 × $150 = $500 per month
Esos $500 no se suman al presupuesto del equipo: forman parte de él. Si las claves atribuidas a miembros consumen primero los $500 completos, esos mismos $500 también se descuentan del tope de $1,000 del equipo. En este caso simplificado, quedan $500 antes de alcanzar el límite del equipo para el tráfico de producción atribuido a Team.
Sin embargo, nada queda reservado. Producción puede gastar primero y cada solicitud necesita margen en el presupuesto del equipo. La mejora es más concreta: ningún miembro puede gastar con sus claves atribuidas más de su asignación antes de que todo el equipo pierda el acceso.
El enfoque difiere del control nativo de OpenAI, donde un agente necesita su propio proyecto para contar con un tope de proyecto obligatorio. La guía sobre los límites estrictos de gasto de la API de OpenAI explica ese modelo de aislamiento. En Vercel, un presupuesto de usuario puede abarcar varias claves atribuidas al mismo miembro sin crear un proyecto por persona.
Esta función no reduce el precio de los tokens. AI Gateway sigue cobrando los precios de lista del proveedor, sin recargo por token ni comisión de plataforma. El beneficio está en contener las pérdidas y aclarar la responsabilidad del gasto, no en abaratar la inferencia.
Cuatro equipos cuyo flujo de trabajo sí cambia
Un responsable de ingeniería de producto con varios agentes de programación
Define un presupuesto de usuario predeterminado para el equipo y asigna una cantidad personalizada a quienes consuman más. Un desarrollador puede ejecutar distintos agentes con claves separadas y, aun así, reunir el gasto de todas ellas bajo un único límite personal.
La ventaja es poner un tope a los bucles nocturnos. Si un agente no deja de reintentar una tarea fallida, se detienen las solicitudes de ese desarrollador sin derribar automáticamente un servicio de producción atribuido al equipo.
Una agencia que necesita proteger el margen de sus clientes
Entrega a cada operador una clave atribuida a su usuario y una asignación predeterminada. Añade un presupuesto personalizado para quien se encargue de una migración intensiva en modelos o de un proyecto corto para un cliente.
La ventaja es que la excepción tiene nombre. Se puede aprobar más gasto para una sola persona sin aumentar la asignación de todos los miembros ni convertir el presupuesto global de la agencia en el único cortacircuitos.
Un responsable de plataforma que separa a las personas de producción
Audita todas las claves de AI Gateway y marca como Team las que pertenezcan a servicios compartidos. Mantén las claves personales de los agentes de programación atribuidas a quienes las crearon.
La ventaja es aislar los fallos. Cuando una persona agota su presupuesto, se detiene el tráfico de sus agentes, pero una carga orientada a clientes continúa hasta agotar el presupuesto de su propia clave o el del equipo.
Un responsable de finanzas u operaciones a cargo de la política
Un Owner puede conceder el permiso AI Gateway Budget Manager sin entregar el rol completo de Owner. Esa persona podrá administrar los presupuestos por usuario, los valores predeterminados y la atribución de claves; además, todos los roles del equipo excepto Contributor pueden consultar las páginas de presupuestos.
La ventaja es contar con un responsable operativo real. Finanzas define el margen, ingeniería puede verlo y un cambio de presupuesto no tiene que esperar al único Owner de todo el equipo de Vercel.
Configuración sin vincular producción a una persona
Los presupuestos por usuario de Vercel requieren la versión 59.6.2 o una posterior de la CLI. Los comandos siguientes se verificaron con la versión 59.6.2 durante esta prueba.
Actualiza la CLI y comprueba su versión
Ejecuta la actualización documentada y confirma que la versión instalada sea, como mínimo, la 59.6.2.
Bashvercel upgrade vercel --versionDefine la asignación predeterminada
En este ejemplo, cada miembro sin un presupuesto personalizado recibe su propia asignación mensual de $50. No son $50 compartidos por todo el grupo.
Bashvercel ai-gateway budgets defaults set user --limit 50 --refresh-period monthlyAsigna un límite personalizado a quien más consume
El presupuesto personalizado sustituye al valor predeterminado para esa persona. Vercel acepta una dirección de correo electrónico, un nombre de usuario o un ID de usuario.
Bashvercel ai-gateway budgets set user lead@example.com --limit 150 --refresh-period monthly vercel ai-gateway budgets listTransfiere las claves compartidas al equipo
Abre AI Gateway, entra en API Keys, edita cada clave destinada a clientes o a una carga compartida y configura Spend attribution como Team. Las claves nuevas se atribuyen por defecto a User, así que incorpora esta revisión al proceso de crear claves para producción.
Añade alertas cuando alguien deba recibirlas
Los presupuestos personalizados pueden enviar correos al alcanzar el 50%, el 75% y el 100% del límite. Las alertas están desactivadas de forma predeterminada y los presupuestos predeterminados no envían avisos; si una persona necesita advertencias por correo antes del bloqueo, crea para ella un presupuesto personalizado.
Los presupuestos mensuales se reinician el primer día del mes a medianoche UTC. Los diarios se reinician a medianoche UTC; los semanales, el lunes a medianoche UTC; y none crea un límite acumulativo que nunca se reinicia.
Cómo probar el bloqueo y la reanudación en staging
Para este artículo no se modificó ningún presupuesto de un equipo real de Vercel porque la prueba no disponía de un equipo y una clave desechables. Por eso, la forma segura de comprobarlo es hacerlo en staging. El comportamiento del 402 y los tiempos de propagación que aparecen a continuación son el contrato documentado por Vercel, no un benchmark obtenido en una cuenta durante esta prueba.
Utiliza un miembro dedicado de staging y una clave atribuida a esa persona. No hagas este ensayo con una clave de producción.
Empieza con un gasto visible
Usa
vercel ai-gateway budgets listpara comprobar el gasto del periodo actual del miembro de staging. Si ya supera el mínimo documentado de $1, puedes activar el límite sin generar un dólar adicional de tráfico de prueba.Reduce el límite del usuario de staging
Al editar un presupuesto se conserva el gasto ya acumulado durante el periodo actual. Fija el presupuesto del usuario de staging en $1 y espera a que el cambio se propague.
Bashvercel ai-gateway budgets set user staging@example.com --limit 1 --refresh-period monthlyEnvía una solicitud con la clave de ese miembro
Exporta la clave de staging atribuida al miembro como
AI_GATEWAY_API_KEYy utiliza el formato de solicitud HTTP directa que documenta Vercel.Bashcurl https://ai-gateway.vercel.sh/v1/chat/completions \ -H "Authorization: Bearer $AI_GATEWAY_API_KEY" \ -H "Content-Type: application/json" \ -d '{ "model": "openai/gpt-5.6-sol", "messages": [ { "role": "user", "content": "Invent a new holiday and describe its traditions." } ] }'Cuando el presupuesto esté activo y agotado, la solicitud debería devolver un HTTP
402con el tipo de errorquota_for_entity_exceeded. Si el402muestra otro tipo, el problema puede estar en el saldo de créditos del equipo y no en un presupuesto.Aumenta el límite y vuelve a intentarlo
Eleva el límite personalizado por encima del gasto que muestra
budgets list. Este comando documentado utiliza $100.Bashvercel ai-gateway budgets set user staging@example.com --limit 100 --refresh-period monthlyLos cambios de presupuesto suelen propagarse en decenas de segundos, aunque una clave activa puede tardar hasta unos cinco minutos. Espera y envía de nuevo la misma solicitud. Debería reanudarse, salvo que se haya agotado otro presupuesto aplicable a la clave o al equipo.
Restablece la política prevista
Devuelve al usuario de staging el límite personalizado planificado. Eliminar ese presupuesto no siempre desbloquea el tráfico: si existe un valor predeterminado, el usuario vuelve a él; si ese presupuesto ya está agotado, el tráfico continúa bloqueado.
Dos límites del sistema que conviene tener presentes
En primer lugar, el gasto mediante BYOK queda fuera de todos los presupuestos de AI Gateway. Cuando el gateway utiliza credenciales propias del proveedor, ese consumo se contabiliza por separado y un límite de usuario no puede contenerlo. Además, una solicitud BYOK fallida puede recurrir a las credenciales del sistema de Vercel y cargar el costo al saldo de créditos de AI Gateway del equipo.
En segundo lugar, las propias páginas de Vercel se contradicen actualmente respecto de los app tokens. El anuncio del 31 de agosto afirma que los límites por usuario abarcan las claves de API atribuidas y los app tokens. Sin embargo, la documentación actual sobre presupuestos indica que los app tokens no tienen atribución de miembro y nunca cuentan para el presupuesto de un usuario.
La acción prioritaria para el lunes
Conviene actuar esta semana si varios miembros utilizan agentes de programación u otras cargas de trabajo sin supervisión con sus propias claves de AI Gateway. En cambio, se puede esperar si todo el tráfico pasa por tokens OIDC de proyectos o por credenciales de proveedor BYOK, ya que los presupuestos por usuario no controlan esas rutas. Para una persona que trabaja sola con una clave y un presupuesto de equipo, el impacto es mínimo.
El lunes, clasifica cada clave del gateway como PERSONA o COMPARTIDA. Primero, cambia las claves compartidas de producción a la atribución Team. Después, define un único presupuesto mensual predeterminado por usuario, añade solo las excepciones personalizadas que el negocio pueda justificar y ejecuta en staging la prueba del 402: bloqueo, aumento del límite y reanudación. La configuración estará lista cuando producción quede fuera de la asignación de una sola persona y el responsable sepa qué límite bloqueó la solicitud.
Para recibir más notas prácticas sobre control de costos de IA y flujos de trabajo en producción, suscríbete al boletín.
6 sept 2026







