Agente de voz IA con Gemini 3.8 Live: consultas sin silencios

Descubre cómo Gemini 3.8 Live mantiene la conversación mientras las herramientas trabajan en segundo plano y cómo medir el costo real por tarea completada.

Wednesday, September 16, 2026Omid Saffari
Agente de voz IA con Gemini 3.8 Live: consultas sin silencios

El 15 de septiembre de 2026, Google anunció la disponibilidad general de Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking. La mejora práctica es sencilla: un agente de voz IA puede mantener informado al interlocutor mientras el calendario, el sistema de pedidos o la API de reservas hacen el trabajo lento en segundo plano.

Un agente de voz IA ya no tiene que callar durante la consulta

Un agente de voz suele atender dos frentes a la vez: sostener una conversación natural y ejecutar una tarea real en otro sistema.

Ese segundo frente es el que vuelve incómodas muchas llamadas. El agente consulta en la API de reservas si hay un horario disponible, espera y deja a la persona en silencio. Entonces, el interlocutor repite la solicitud, pregunta si alguien sigue ahí o cuelga. Si la aplicación interpreta esa repetición como una instrucción nueva, también puede iniciar dos veces la misma tarea.

Gemini 3.8 Live cambia esa dinámica mediante llamadas a funciones asíncronas. Esto permite que la herramienta siga trabajando sin bloquear toda la sesión en vivo. Mientras la consulta continúa, la persona puede aportar contexto, corregir un dato o escuchar una actualización.

Gemini 3.8 Live Extended Thinking va un paso más allá: puede razonar sobre una tarea de varias etapas y comunicar avances breves mientras se ejecutan las herramientas. El propio ejemplo de Google muestra un proceso de reserva de viajes que consulta varios sistemas sin interrumpir la conversación en vivo.

Eso no significa que Gemini haga reservas por cuenta propia. La aplicación sigue siendo la encargada de recibir la llamada a la función, consultar el calendario o el sistema de pedidos y devolver el resultado. El modelo gestiona la conversación que acompaña ese trabajo.

OpciónCuándo usarlaComportamiento de las herramientasSeñal de finalización
gemini-3.8-liveLa tarea es directa y la herramienta responde rápidoEl modo asíncrono es el predeterminado, aunque el modo bloqueante sigue disponibleturnComplete: true cierra el turno
gemini-3.8-live-extended-thinkingLa tarea exige varias etapas o una herramienta tarda segundosSolo asíncrono, con nivel de razonamiento low, medium o highEsperar a interaction_status: "IDLE"

La última columna encierra la trampa en producción. Con Extended Thinking, turnComplete: true puede indicar únicamente que terminó una actualización verbal intermedia, aunque la consulta siga activa. Si en ese momento se cierra la sesión, se habilita el botón de reserva o se marca la tarea como terminada, se generan falsos resultados completados.

Escena didáctica de plastilina con un interlocutor, una consulta en segundo plano, una actualización de progreso y un registro de finalización verificada
El flujo útil combina una conversación en vivo, una tarea en segundo plano y un registro de finalización verificada.

La métrica de negocio es el costo por tarea completada

Hablar mientras una tarea se ejecuta en segundo plano no supone un ahorro automático. El modelo puede generar más audio durante la espera y, al alargarse la conversación, quizá deba volver a procesar más contexto en turnos posteriores. La función solo se justifica si esa continuidad se traduce en más reservas terminadas, menos llamadas abandonadas o menos correcciones manuales.

Google publica las mismas tarifas estándar para los dos modelos nuevos: el audio de entrada cuesta $0.005 por minuto y el de salida, $0.018 por minuto. El texto de entrada cuesta $0.75 por 1 millón de tokens, mientras que el texto de salida, incluidos los tokens de razonamiento, cuesta $4.50 por 1 millón de tokens.

Pensemos en una llamada de reserva de cinco minutos en la que el modelo habla durante dos minutos. Como el audio proactivo está activado de forma permanente, el cálculo básico del audio nuevo suma $0.025 por cinco minutos de entrada y $0.036 por dos minutos de salida. El subtotal bruto de audio es $0.061.

Pero ese no es el costo final de la llamada.

La guía de facturación de la Live API advierte que una sesión persistente puede volver a procesar el contexto acumulado en turnos posteriores. Las transcripciones añaden cargos por tokens de texto, y Extended Thinking puede sumar tokens de salida destinados al razonamiento. El calendario, el CRM, el operador telefónico, el alojamiento, los reintentos y las derivaciones a personal humano quedan fuera del subtotal de audio de Google.

Conviene usar esta fórmula:

Costo por tarea completada = gasto total en modelo, herramientas, telefonía, infraestructura, reintentos y derivaciones dividido entre las tareas completadas y verificadas.

Una tarea completada no es una transcripción agradable. En una línea de citas, significa que un identificador de reserva se escribió una sola vez, se leyó correctamente y fue aceptado por la persona. En atención de pedidos, es la acción correcta aplicada al pedido y a la cuenta correctos. En una transferencia, es una derivación que llegó a la cola indicada con todo el contexto.

Google devuelve periódicamente los totales de tokens consumidos en usageMetadata. Vincule ese registro con el identificador de la llamada a la herramienta, la sesión del operador, el resultado final de negocio y cualquier intervención humana. Así obtendrá un registro por llamada que se puede auditar, en lugar de una estimación por minuto que solo queda aceptar.

Las cifras del lanzamiento no sustituyen este piloto. Google informa un 68.6% en el benchmark de tareas tau-Voice y un 35.1% en su variante bancaria para Extended Thinking. Esas puntuaciones indican que el modelo se puede evaluar en tareas de voz con agentes. No revelan qué porcentaje de sus interlocutores completará una reserva en su calendario, con sus políticas y su conexión telefónica.

Cuatro flujos de trabajo donde la espera sí importa

Una clínica dental que agenda una cita

El responsable de operaciones puede dejar que el agente pregunte qué día prefiere la persona, consulte la disponibilidad y avise que sigue buscando mientras responde el calendario. El beneficio no consiste simplemente en reducir el silencio, sino en confirmar más citas y evitar llamadas posteriores del personal.

La regla de seguridad es estricta: una actualización verbal no equivale a una reserva. El sistema solo debe crearla después de que la persona elija uno de los horarios devueltos, y los reintentos deben reutilizar una clave de idempotencia para impedir que una llamada genere dos veces la misma cita.

Un equipo de comercio electrónico que consulta un pedido

El responsable de soporte puede mantener a la persona en la misma conversación mientras el agente consulta el sistema de pedidos. Si la solicitud cambia de «¿dónde está mi paquete?» a «quiero cambiar la dirección de entrega», la aplicación debe tomar la petición más reciente como la activa y cancelar o ignorar el trabajo obsoleto.

El beneficio es reducir las derivaciones en los casos rutinarios. El riesgo consiste en ofrecer una respuesta correcta a una pregunta anterior cuando la persona ya pasó a otro asunto.

Un equipo de viajes que gestiona un cambio de reserva

Buscar vuelos, comprobar políticas, revisar la disponibilidad de hoteles y comparar tarifas hace que este caso encaje mejor con Extended Thinking. El modelo puede narrar los avances mientras se ejecutan varias funciones no bloqueantes.

Los pagos y los cambios de reserva deben permanecer detrás de un paso de confirmación. Una voz natural no rebaja el nivel de aprobación exigible para una acción irreversible.

Una cola de soporte técnico que diagnostica un problema de cuenta

Una consulta rápida de la cuenta corresponde a Gemini 3.8 Live. Un diagnóstico que reúne varios registros y revisa una configuración puede justificar Extended Thinking.

La distinción importa porque un razonamiento más profundo no es gratis. Dirija cada caso según la complejidad del trabajo y luego compare las tasas de resolución y derivación. No envíe todos los restablecimientos de contraseña por la ruta más pesada solo porque el nombre del modelo parece más seguro.

Conecte el ciclo en segundo plano antes de añadir la línea telefónica

Empiece con una sesión activada por texto y una herramienta simulada. Así podrá aislar el comportamiento asíncrono antes de que el operador, el micrófono, el puente de audio y el calendario de producción añadan otros cuatro puntos que depurar.

El ejemplo siguiente utiliza el SDK actual de Python de Google, la configuración de Extended Thinking, una declaración de función no bloqueante, el patrón de respuesta de herramientas y los campos interaction_status y usageMetadata. Guarda el audio devuelto a 24 kHz en response.wav. El resultado de la herramienta es una simulación local, por lo que no modifica un calendario real.

Bash
pip install -U google-genai
export GEMINI_API_KEY="YOUR_API_KEY"
Python
import asyncio
import wave

from google import genai
from google.genai import types

client = genai.Client()
model = "gemini-3.8-live-extended-thinking"

check_availability = types.FunctionDeclaration(
    name="check_availability",
    description="Checks the calendar for the next available appointment.",
    behavior="NON_BLOCKING",
    parameters={
        "type": "OBJECT",
        "properties": {},
    },
)

config = types.LiveConnectConfig(
    response_modalities=["AUDIO"],
    thinking_config=types.ThinkingConfig(thinking_level="low"),
    tools=[types.Tool(function_declarations=[check_availability])],
)


async def main():
    async with client.aio.live.connect(model=model, config=config) as session:
        await session.send_client_content(
            turns={
                "parts": [
                    {"text": "Find the next available appointment and keep me updated."}
                ]
            }
        )

        with wave.open("response.wav", "wb") as audio:
            audio.setnchannels(1)
            audio.setsampwidth(2)
            audio.setframerate(24000)

            async for message in session.receive():
                status = getattr(message, "interaction_status", None)

                if message.data is not None:
                    audio.writeframes(message.data)

                if message.usage_metadata:
                    print("Tokens:", message.usage_metadata.total_token_count)

                if message.tool_call:
                    replies = []
                    for call in message.tool_call.function_calls:
                        replies.append(
                            types.FunctionResponse(
                                id=call.id,
                                name=call.name,
                                response={"result": "Tuesday morning is available."},
                            )
                        )
                    await session.send_tool_response(function_responses=replies)

                if status == "IDLE":
                    print("Interaction complete")
                    break


if __name__ == "__main__":
    asyncio.run(main())

El error más probable es detener el proceso al recibir el primer turnComplete. Extended Thinking puede haber dicho «Estoy consultando» y seguir a la espera de la herramienta. Mantenga la escucha hasta que interaction_status sea IDLE y conserve el identificador de la llamada a la herramienta vinculado con el resultado de negocio definitivo.

Para un agente telefónico en producción, añada el puente de audio solo cuando este bucle funcione como debe. La comparativa general de costos de agentes de voz ayuda a elegir las capas de telefonía y orquestación que rodean al modelo. Si quiere contrastar el contador de tokens de Google con una tarifa de voz frontal más sencilla, el desglose del costo de llamadas con GPT-Live-1 muestra por qué el denominador debe ser la tarea completada en ambos casos.

Diseñe el piloto en torno a un registro, no a una demostración

  1. Elija un único evento de finalización

    Limite el piloto a un flujo de trabajo concreto, como una cita confirmada. Defina el evento exacto de la base de datos que demuestra la finalización y enumere todos los estados que cuentan como fallo, abandono, trabajo duplicado o derivación a personal humano.

  2. Registre el ciclo completo de la sesión en vivo

    Guarde el identificador de sesión, cada identificador de llamada a herramienta, los cambios de interaction_status, las horas de inicio y fin de la herramienta y usageMetadata. Una frase para llenar la espera indica progreso, no finalización.

  3. Reúna todas las capas facturadas

    Asocie al mismo registro de llamada el uso de Gemini, las tarifas del calendario o CRM, los cargos del operador, la infraestructura, los reintentos y el tiempo del personal. No compare el subtotal ilustrativo de audio de Google de $0.061 con una factura integral del sistema actual.

  4. Pruebe las rutas de fallo

    Interrumpa al agente, cambie la fecha solicitada mientras se ejecuta una consulta, provoque un tiempo de espera agotado en la herramienta, simule que no hay disponibilidad y cuelgue antes de recibir el resultado. Compruebe que las llamadas obsoletas no puedan crear una reserva.

  5. Compare las tareas completadas

    Procese los mismos tipos de llamada mediante el flujo actual y el nuevo. Compare la finalización verificada, los abandonos, el trabajo de derivación, las acciones duplicadas y el costo total por tarea completada. No declare un ahorro hasta que todos esos registros cuadren.

Los límites reales

El modelo puede llenar el silencio, pero no acelerar un calendario lento, reparar una mala conexión telefónica ni decidir qué considera su empresa una tarea terminada.

Las sesiones solo de audio están limitadas a 15 minutos, salvo que se incorporen técnicas de gestión de sesiones para mantener conversaciones más largas. El límite de contexto del audio nativo es de 128,000 tokens. Las llamadas largas, con muchos turnos, también cuestan de forma distinta a una estimación basada únicamente en la duración, porque el contexto anterior puede volver a procesarse.

La seguridad sigue siendo responsabilidad de la aplicación. Un navegador que se conecta directamente debe utilizar tokens efímeros, no una clave de API estándar. Una reserva, un reembolso o un cambio de cuenta todavía requieren autenticación, validación, idempotencia y un registro de auditoría.

La ruta asíncrona añade otro riesgo de producción: el trabajo obsoleto. Si la persona cambia su solicitud mientras una herramienta se está ejecutando, el resultado anterior puede llegar después. Mantenga un estado explícito de la tarea y rechace los resultados que ya no coincidan con la intención actual.

La acción del lunes: instrumente una sola cola

Actúe esta semana si las esperas silenciosas hacen que las personas repitan lo que dijeron, abandonen una reserva o generen trabajo adicional para el personal. Use Gemini 3.8 Live en consultas directas y Extended Thinking en un único flujo que realmente tenga varias etapas. Mantenga ambos detrás del mismo registro de finalización.

Espere si todavía no puede demostrar la finalización en su propio sistema, si la integración con el operador telefónico no está resuelta o si el flujo contiene una acción irreversible sin una instancia de confirmación. Primero necesita el registro; después, el modelo nuevo.

Este lanzamiento no es relevante para productos que solo trabajan con texto, flujos de voz cuyas herramientas ya responden de inmediato ni un agente telefónico que ya cumple sus objetivos de finalización, derivación y costo. Un modelo nuevo no justifica reemplazar un sistema medido.

Para recibir más análisis claros sobre cambios que afectan los costos operativos y los flujos de trabajo, suscríbase al boletín.

Última actualización
16 sept 2026
Categoría
Explained

Prefiera este sitio en Google

Añadir omidsaffari.com como fuente preferida en la Búsqueda de Google

Marque omidsaffari.com como fuente preferida y Google lo destacará para usted en Top Stories, AI Overviews y AI Mode.

Permisos Cloudflare Workers: aísle el despliegue de cada cliente

Permisos Cloudflare Workers: aísle el despliegue de cada cliente

Configure permisos Cloudflare Workers para que cada token de despliegue alcance un solo cliente, sin ignorar bindings, rutas ni políticas heredadas.15 sept 2026Explained
Claude Code ya limita el acceso de red a cada comando

Claude Code ya limita el acceso de red a cada comando

Claude Code 2.1.271 limita el acceso de red al comando que lo necesita. Aprende a instalar dependencias sin dejar el registro abierto al resto del trabajo.15 sept 2026Explained
Agentes de IA con Vercel AI SDK: cuándo paga la suscripción y cuándo la API

Agentes de IA con Vercel AI SDK: cuándo paga la suscripción y cuándo la API

Vercel AI SDK ya puede cargar el uso del modelo a una suscripción autenticada en el host. Descubre qué credencial paga y por qué Sandbox se cobra aparte.15 sept 2026Explained
Automatización de navegador con Cloudflare: destinos aprobados y revisión de solo lectura

Automatización de navegador con Cloudflare: destinos aprobados y revisión de solo lectura

Limita la automatización de navegador a dominios aprobados, identifica los CDN necesarios y permite revisar cada sesión con Live View en modo de solo lectura.14 sept 2026Explained
Agente de voz IA: el costo real de llamar con GPT-Live-1

Agente de voz IA: el costo real de llamar con GPT-Live-1

Calcula el costo real de un agente de voz IA con GPT-Live-1: sesión de voz, razonamiento, herramientas, telefonía y costo por llamada resuelta.14 sept 2026Explained
ChatGPT para Windows: Appshots reduce la copia manual de contexto

ChatGPT para Windows: Appshots reduce la copia manual de contexto

Con Appshots, ChatGPT para Windows adjunta la ventana activa a un chat. Aprende a configurar la función, medir el ahorro y evitar exponer datos sensibles.14 sept 2026Explained
Cómo la CDN de Vercel reduce el uso de Functions en FastAPI

Cómo la CDN de Vercel reduce el uso de Functions en FastAPI

Vercel ahora sirve archivos estáticos elegibles de FastAPI desde su CDN. Descubre qué solicitudes dejan de usar Functions y cuáles aún las necesitan.13 sept 2026Explained
Clave API OpenAI: cómo rotarla antes de que caduque

Clave API OpenAI: cómo rotarla antes de que caduque

Planifica la rotación de una clave API OpenAI antes de su caducidad: responsable, ventana de reemplazo, presupuesto y verificación sin interrupciones.13 sept 2026Explained
Newsletter

Una carta, cada domingo.Sistemas que funcionan, no opiniones calientes.

Semanal. Sin spam. Cancele cuando quiera.