IA para analizar videos con Gemini: cuándo es posible ahorrar 88% de tokens

Gemini ya busca dentro de videos largos antes de responder. Así funciona el modo agéntico, qué implica ahorrar hasta un 88% de tokens y cuándo conviene.

Wednesday, September 2, 2026Omid Saffari
Tools
IA para analizar videos con Gemini: cuándo es posible ahorrar 88% de tokens

El 1 de septiembre de 2026, Google añadió a la API de Gemini una forma distinta de usar IA para analizar videos largos: en lugar de cargar toda la línea de tiempo a una frecuencia fija, el modelo ahora puede consultar solo la transcripción, los fotogramas o el audio que necesita para responder. Google habla de hasta un 88% menos de tokens en videos de larga duración, pero esa cifra es un máximo, no una rebaja automática en cualquier factura.

Qué es realmente la IA para analizar videos de Gemini

El método anterior, y todavía predeterminado, es el procesamiento estático. Gemini extrae un fotograma por segundo, procesa el audio, incorpora ese material a la ventana de contexto y responde en una sola pasada. Es predecible porque el modelo observa la línea de tiempo con una frecuencia de muestreo fija, tanto si la pregunta requiere todo ese contenido como si no.

La nueva alternativa es el procesamiento agéntico. Primero, el modelo determina qué evidencias necesita. Puede solicitar un tramo de la transcripción, cargar fotogramas del momento pertinente, examinar el audio y repetir el ciclo antes de redactar la respuesta. Dicho de forma simple, Gemini ahora busca dentro del video antes de responder sobre él.

La mejor analogía es la de un investigador en un archivo audiovisual. En modo estático, todos los rollos pasan por la mesa. En modo agéntico, el investigador consulta el catálogo, saca el rollo probable, revisa la escena exacta y solo vuelve por otra pieza si la primera no basta.

Esta función llegó a gemini-3.7-flash, gemini-3.6-flash y gemini-3.5-flash-lite. Funciona tanto con la Interactions API como con la GenerateContent API. La Interactions API es la ruta recomendada, y es la que usaré a continuación porque su respuesta muestra los pasos de procesamiento del modelo.

DecisiónModo estáticoModo agéntico
Cómo lee el videoProcesa un fotograma por segundo y el audio en una sola pasadaCarga la transcripción, los fotogramas o el audio según los necesita
Cuándo convieneClips cortos, baja latencia inicial y precisión en toda la línea de tiempoVideos largos y preguntas centradas en momentos concretos
Consumo de tokensCerca de 100 tokens por segundo con resolución multimedia bajaVariable, con hasta un 88% menos de tokens en videos de larga duración
Controles adicionalesIntervalos de recorte y frecuencias de fotogramas personalizadasNavegación dinámica controlada por el modelo
PredeterminadoNo; hay que definir processing: "agentic"
Archivo de video representado en arcilla donde el modo estático carga todos los fotogramas y el modo agéntico selecciona transcripción, fotogramas y audio
El modo estático carga la línea de tiempo. El modo agéntico vuelve a buscar las evidencias que necesita la pregunta.

Ese ciclo se apoya en dos nuevos tipos de paso en la respuesta. Un processing_call indica que el modelo solicitó otro segmento del video o de la transcripción. El processing_result correspondiente contiene lo que recibió. Si esos tipos aparecen en interaction.steps, la navegación agéntica se ejecutó. La aplicación puede mostrarlos como progreso, pero no tiene que responderlos como si fueran una llamada a una función personalizada.

Hay un límite importante: esto sirve para comprender videos, no para generarlos. Estos tres modelos reciben video y devuelven texto. Para crear o editar video existe otro proceso, el de Gemini Omni Flash.

Por qué importa ese 88%

El costo del video estático crece de una manera muy mecánica. Con resolución multimedia baja, la guía calcula cerca de 100 tokens por cada segundo de video. Por lo tanto, una hora ronda los 360,000 tokens de entrada antes de la respuesta. Con la tarifa Standard vigente de Gemini 3.7 Flash o 3.6 Flash, de $0.75 por 1 millón de tokens de entrada hasta el 31 de diciembre de 2026, esa entrada cuesta alrededor de $0.27.

Si se aplica la reducción completa de 88% a ese presupuesto de entrada, el resultado es 43,200 tokens, o unos $0.0324 con la misma tarifa. Ese es el caso atractivo: una pregunta específica sobre una grabación larga ya no obliga a cargar cada fotograma muestreado en el contexto.

Pero eso no representa toda la factura. La exploración agéntica genera tokens de razonamiento, cobrados a la tarifa de salida, y tokens de uso de herramientas correspondientes a la transcripción, el audio y los fotogramas que carga. El modelo también puede revisar más material cuando la pregunta es amplia o el video tiene una alta densidad visual. Google informa de una calidad aproximadamente un 7% mayor al trabajar con contenido de larga duración, aunque la guía pública no muestra el benchmark que sustenta esa cifra.

La elección del modelo también cambia el precio unitario. Gemini 3.5 Flash-Lite cuesta $0.30 por 1 millón de tokens de entrada y $2.50 por 1 millón de tokens de salida con la tarifa Standard. Gemini 3.7 Flash y 3.6 Flash cuestan $0.75 para la entrada y $3.75 para la salida hasta finales de 2026; después, ambas tarifas programadas se duplican el 1 de enero de 2027.

Así, el video agéntico aporta valor en dos frentes. Permite que una fuente más larga quepa en el presupuesto de contexto y reduce la cantidad de material de pago que el modelo debe inspeccionar. La ventaja es mayor cuando la fuente es larga y la pregunta, específica.

¿Quién queda al margen? Es poco probable que un equipo que procesa clips de producto de treinta segundos obtenga el mismo beneficio. Si un flujo ya sabe qué tramo exacto de cinco minutos necesita, quizá le convenga recortarlo y usar el modo estático. Tampoco aparece una nueva opción para quien utiliza la aplicación de Gemini: Google lanzó un parámetro de procesamiento para la API, no un control para consumidores.

Quién puede aprovecharlo desde mañana

Un responsable de formación con grabaciones de una hora

El responsable de formación y desarrollo de una gran empresa puede subir la grabación de un taller y pedir los procedimientos principales, los ejemplos asociados a cada uno y un cuestionario. El modo agéntico puede comenzar por la transcripción, recuperar fotogramas cuando importe una diapositiva o una demostración física y omitir los tramos que no vienen al caso.

La ventaja no se limita a obtener un resumen más barato. La misma fuente permite responder preguntas concretas como «¿Qué dijo el ponente sobre el proceso de escalamiento?» sin llenar primero la ventana de contexto con todos los fotogramas.

Un responsable de investigación SaaS que revisa entrevistas

Quien dirige la investigación de producto en una empresa SaaS puede pedirle a Gemini que localice, en una entrevista de una hora, todos los momentos en los que el cliente menciona dificultades de onboarding, confusión con los precios o la ausencia de un flujo de trabajo. La respuesta puede incluir marcas de tiempo para que el investigador vuelva a la grabación original antes de convertir lo que dice el modelo en una decisión de producto.

La ganancia está en la velocidad de revisión sin perder la trazabilidad. Gemini acota el metraje; el investigador todavía comprueba el clip que respalda cada afirmación.

Un equipo de operaciones de medios que busca en un archivo

Un equipo de medios puede indicarle a Gemini que busque en un webinar, una reunión general o una entrevista extensa el momento en que aparece un tema concreto. El modo agéntico nació para este tipo de tarea: una línea de tiempo grande y una búsqueda específica.

La entrega se acelera. El editor recibe los momentos probables y sus marcas de tiempo, no un resumen vago de todo el programa.

Un ingeniero de calidad que revisa grabaciones de inspección

Un ingeniero de control de calidad de manufactura puede emplear el modo agéntico para buscar un evento concreto en una grabación larga, como la apertura de un resguardo o el cambio de una luz de advertencia. Cuando Gemini encuentra un intervalo sospechoso, el ingeniero puede procesar ese breve tramo en modo estático.

Ese segundo paso es importante. El modo estático sigue siendo la opción correcta cuando importa cada fotograma muestreado, y Google advierte que procesar un fotograma por segundo puede pasar por alto acciones rápidas. Este flujo usa el modo agéntico para ubicar la zona y después recurre al modo estático o a un sistema de visión especializado para verificar el evento.

Un producto educativo que mantiene viva la conversación sobre una clase

Quien desarrolla un producto educativo puede crear una interacción en torno a una clase y dejar que el estudiante haga preguntas de seguimiento mediante previous_interaction_id. El servidor conserva el contexto del video, de modo que el producto no necesita reconstruir toda la conversación en cada turno.

El resultado es una verdadera sesión de estudio, no un resumen aislado. La salvedad está en el estado: si el producto funciona sin estado, debe volver a enviar todos los pasos de procesamiento recibidos o la siguiente respuesta perderá el contexto del video.

Cómo analizar videos con IA mediante la Interactions API

La configuración mínima orientada a producción utiliza el SDK oficial Google Gen AI para Python y la Files API. Conviene usar la Files API para un video de duración considerable, para cualquier archivo sobre el que se harán varias preguntas y para toda solicitud que supere 20 MB en total.

  1. Configura la clave de la API e instala el SDK

    Crea una clave de la API de Gemini en Google AI Studio, guárdala en GEMINI_API_KEY e instala el SDK actual:

    Bash
    export GEMINI_API_KEY="YOUR_API_KEY"
    pip install -U google-genai
  2. Sube el video y solicita el procesamiento agéntico

    Sustituye la ruta por la de un video local. Este ejemplo reproduce el flujo de Python de la guía de video agéntico de Google:

    Python
    import time
    from google import genai
    
    client = genai.Client()
    
    # Upload a long video
    video_file = client.files.upload(file="path/to/lecture.mp4")
    
    while video_file.state.name == "PROCESSING":
        time.sleep(2)
        video_file = client.files.get(name=video_file.name)
    
    # Use agentic processing
    interaction = client.interactions.create(
        model="gemini-3.7-flash",
        input=[
            {
                "type": "video",
                "uri": video_file.uri,
                "mime_type": video_file.mime_type,
                "processing": "agentic"
            },
            {"type": "text", "text": "What are the three main arguments presented?"}
        ]
    )
    print(interaction.output_text)
  3. Verifica el modo antes de dar por válida la prueba

    Inspecciona interaction.steps. Deberías ver entradas processing_call y processing_result antes del model_output final. Si no están, la solicitud no demuestra que se haya utilizado la navegación dinámica.

  4. Mide la comparación correcta

    Ejecuta los mismos videos y preguntas representativos en modo estático y agéntico. Compara el total de tokens de entrada, los tokens de razonamiento, los tokens de uso de herramientas, el tiempo hasta el primer token, la calidad de la respuesta y el costo final. El 88% es un máximo informado por el proveedor; la mezcla de prompts determinará si resiste el paso a producción.

El error más sencillo es colocar processing en la solicitud en vez de hacerlo dentro del objeto de video. Debe ir en esa entrada de video. Cuando una solicitud contiene varios videos, cada uno puede elegir su propio modo: una clase larga puede ser agéntica mientras un clip breve de un experimento permanece en modo estático.

El orden del prompt también importa. Para un video acompañado de texto, Google recomienda colocar primero el video y después el prompt de texto, como en el ejemplo.

Lo que conviene decir sin rodeos

El modo agéntico sustituye un recorrido fijo por un ciclo de búsqueda. En clips de menos de cinco minutos, ese ciclo puede aumentar ligeramente el tiempo hasta el primer token porque el modelo razona, solicita material y espera resultados de herramientas internas antes de empezar la respuesta final. Si el clip es corto y la aplicación es sensible a la latencia, el modo estático sigue siendo el punto de partida más limpio.

Los controles de recorte y frecuencia de fotogramas personalizados marcan otro límite estricto. start_offset, end_offset y un fps personalizado solo funcionan con procesamiento estático. Si ya se conoce el intervalo exacto, recortar una solicitud estática puede ser más sencillo y predecible que pedirle al modelo que vuelva a encontrarlo.

Los límites de entrada exigen cautela porque la guía actual de Google se contradice. Su tabla comparativa señala que los datos inline deben estar por debajo de 100 MB, pero la sección detallada indica que la solicitud total no puede superar 20 MB y pide expresamente usar la Files API por encima de 20 MB. Hasta que Google armonice la página, aplica el umbral conservador de 20 MB.

La File API admite archivos de hasta 20 GB en cuentas de pago y 2 GB en cuentas gratuitas. Los modelos con una ventana de contexto de 1,048,576 tokens pueden procesar hasta tres horas de video en resolución baja o una hora en resolución alta. Las URL públicas de YouTube funcionan, pero los videos privados y no listados no. Además, el nivel gratuito limita la entrada de YouTube a ocho horas diarias.

El estado entre varios turnos esconde una trampa en producción. Las solicitudes con estado que usan previous_interaction_id conservan el contexto del video en el servidor. Las solicitudes sin estado deben reenviar cada paso processing_call y processing_result. Omitirlos no produce actualmente un error, pero Google señala que el contexto del video desaparece y la calidad de las respuestas de seguimiento cae con fuerza. Reproducir los pasos también suma tokens de entrada.

Por último, encontrar una evidencia no equivale a verificarla. La propia guía de seguridad de Google advierte que los resultados del modelo pueden ser inexactos y considera esenciales el posprocesamiento y la evaluación humana. En decisiones médicas, legales, de seguridad, de cumplimiento o que exijan precisión de fotograma, usa Gemini para localizar evidencias y mantén a una persona o a un sistema determinista en el circuito de aprobación.

Qué hacer ahora

Usa el modo agéntico esta semana si tu producto envía grabaciones largas a Gemini y formula preguntas específicas sobre momentos, temas o argumentos. Empieza con Gemini 3.7 Flash cuando la calidad de la respuesta sea prioritaria y prueba Gemini 3.5 Flash-Lite cuando manden el volumen y el costo.

Conserva el modo estático si los clips son cortos, importa la latencia inicial, necesitas recortar o fijar una frecuencia de fotogramas personalizada, o el trabajo exige revisar de manera uniforme toda la línea de tiempo. La nueva opción no vuelve obsoleta la anterior: ofrece una segunda estrategia de lectura.

Espera si tu producto todavía no puede registrar por separado los campos de uso o comparar las respuestas con las marcas de tiempo de la fuente. Sin esos comprobantes, no podrás saber si la navegación agéntica ahorró dinero o simplemente trasladó tokens de una categoría a otra.

Nada cambia para ti si necesitas generación de video, una función de Gemini para consumidores o análisis determinista fotograma a fotograma. Son productos distintos para problemas técnicos diferentes.

Si quieres convertir el próximo cambio de plataforma en una decisión aplicable, suscríbete al boletín.

Última actualización

2 sept 2026

CategoríaExplained

Prefiera este sitio en Google

Añadir omidsaffari.com como fuente preferida en la Búsqueda de Google

Marque omidsaffari.com como fuente preferida y Google lo destacará para usted en Top Stories, AI Overviews y AI Mode.

Newsletter

Una carta, cada domingo. Sistemas que funcionan, no opiniones calientes.

Build logs, sistemas en producción y notas de campo de un portafolio de ventures de IA.

Semanal. Sin spam. Cancele cuando quiera.