Agente de voz IA con Gemini 3.8 Live: consultas sin silencios
Descubre cómo Gemini 3.8 Live mantiene la conversación mientras las herramientas trabajan en segundo plano y cómo medir el costo real por tarea completada.

El 15 de septiembre de 2026, Google anunció la disponibilidad general de Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking. La mejora práctica es sencilla: un agente de voz IA puede mantener informado al interlocutor mientras el calendario, el sistema de pedidos o la API de reservas hacen el trabajo lento en segundo plano.
Un agente de voz IA ya no tiene que callar durante la consulta
Un agente de voz suele atender dos frentes a la vez: sostener una conversación natural y ejecutar una tarea real en otro sistema.
Ese segundo frente es el que vuelve incómodas muchas llamadas. El agente consulta en la API de reservas si hay un horario disponible, espera y deja a la persona en silencio. Entonces, el interlocutor repite la solicitud, pregunta si alguien sigue ahí o cuelga. Si la aplicación interpreta esa repetición como una instrucción nueva, también puede iniciar dos veces la misma tarea.
Gemini 3.8 Live cambia esa dinámica mediante llamadas a funciones asíncronas. Esto permite que la herramienta siga trabajando sin bloquear toda la sesión en vivo. Mientras la consulta continúa, la persona puede aportar contexto, corregir un dato o escuchar una actualización.
Gemini 3.8 Live Extended Thinking va un paso más allá: puede razonar sobre una tarea de varias etapas y comunicar avances breves mientras se ejecutan las herramientas. El propio ejemplo de Google muestra un proceso de reserva de viajes que consulta varios sistemas sin interrumpir la conversación en vivo.
Eso no significa que Gemini haga reservas por cuenta propia. La aplicación sigue siendo la encargada de recibir la llamada a la función, consultar el calendario o el sistema de pedidos y devolver el resultado. El modelo gestiona la conversación que acompaña ese trabajo.
La última columna encierra la trampa en producción. Con Extended Thinking, turnComplete: true puede indicar únicamente que terminó una actualización verbal intermedia, aunque la consulta siga activa. Si en ese momento se cierra la sesión, se habilita el botón de reserva o se marca la tarea como terminada, se generan falsos resultados completados.

La métrica de negocio es el costo por tarea completada
Hablar mientras una tarea se ejecuta en segundo plano no supone un ahorro automático. El modelo puede generar más audio durante la espera y, al alargarse la conversación, quizá deba volver a procesar más contexto en turnos posteriores. La función solo se justifica si esa continuidad se traduce en más reservas terminadas, menos llamadas abandonadas o menos correcciones manuales.
Google publica las mismas tarifas estándar para los dos modelos nuevos: el audio de entrada cuesta $0.005 por minuto y el de salida, $0.018 por minuto. El texto de entrada cuesta $0.75 por 1 millón de tokens, mientras que el texto de salida, incluidos los tokens de razonamiento, cuesta $4.50 por 1 millón de tokens.
Pensemos en una llamada de reserva de cinco minutos en la que el modelo habla durante dos minutos. Como el audio proactivo está activado de forma permanente, el cálculo básico del audio nuevo suma $0.025 por cinco minutos de entrada y $0.036 por dos minutos de salida. El subtotal bruto de audio es $0.061.
Pero ese no es el costo final de la llamada.
La guía de facturación de la Live API advierte que una sesión persistente puede volver a procesar el contexto acumulado en turnos posteriores. Las transcripciones añaden cargos por tokens de texto, y Extended Thinking puede sumar tokens de salida destinados al razonamiento. El calendario, el CRM, el operador telefónico, el alojamiento, los reintentos y las derivaciones a personal humano quedan fuera del subtotal de audio de Google.
Conviene usar esta fórmula:
Costo por tarea completada = gasto total en modelo, herramientas, telefonía, infraestructura, reintentos y derivaciones dividido entre las tareas completadas y verificadas.
Una tarea completada no es una transcripción agradable. En una línea de citas, significa que un identificador de reserva se escribió una sola vez, se leyó correctamente y fue aceptado por la persona. En atención de pedidos, es la acción correcta aplicada al pedido y a la cuenta correctos. En una transferencia, es una derivación que llegó a la cola indicada con todo el contexto.
Google devuelve periódicamente los totales de tokens consumidos en usageMetadata. Vincule ese registro con el identificador de la llamada a la herramienta, la sesión del operador, el resultado final de negocio y cualquier intervención humana. Así obtendrá un registro por llamada que se puede auditar, en lugar de una estimación por minuto que solo queda aceptar.
Las cifras del lanzamiento no sustituyen este piloto. Google informa un 68.6% en el benchmark de tareas tau-Voice y un 35.1% en su variante bancaria para Extended Thinking. Esas puntuaciones indican que el modelo se puede evaluar en tareas de voz con agentes. No revelan qué porcentaje de sus interlocutores completará una reserva en su calendario, con sus políticas y su conexión telefónica.
Cuatro flujos de trabajo donde la espera sí importa
Una clínica dental que agenda una cita
El responsable de operaciones puede dejar que el agente pregunte qué día prefiere la persona, consulte la disponibilidad y avise que sigue buscando mientras responde el calendario. El beneficio no consiste simplemente en reducir el silencio, sino en confirmar más citas y evitar llamadas posteriores del personal.
La regla de seguridad es estricta: una actualización verbal no equivale a una reserva. El sistema solo debe crearla después de que la persona elija uno de los horarios devueltos, y los reintentos deben reutilizar una clave de idempotencia para impedir que una llamada genere dos veces la misma cita.
Un equipo de comercio electrónico que consulta un pedido
El responsable de soporte puede mantener a la persona en la misma conversación mientras el agente consulta el sistema de pedidos. Si la solicitud cambia de «¿dónde está mi paquete?» a «quiero cambiar la dirección de entrega», la aplicación debe tomar la petición más reciente como la activa y cancelar o ignorar el trabajo obsoleto.
El beneficio es reducir las derivaciones en los casos rutinarios. El riesgo consiste en ofrecer una respuesta correcta a una pregunta anterior cuando la persona ya pasó a otro asunto.
Un equipo de viajes que gestiona un cambio de reserva
Buscar vuelos, comprobar políticas, revisar la disponibilidad de hoteles y comparar tarifas hace que este caso encaje mejor con Extended Thinking. El modelo puede narrar los avances mientras se ejecutan varias funciones no bloqueantes.
Los pagos y los cambios de reserva deben permanecer detrás de un paso de confirmación. Una voz natural no rebaja el nivel de aprobación exigible para una acción irreversible.
Una cola de soporte técnico que diagnostica un problema de cuenta
Una consulta rápida de la cuenta corresponde a Gemini 3.8 Live. Un diagnóstico que reúne varios registros y revisa una configuración puede justificar Extended Thinking.
La distinción importa porque un razonamiento más profundo no es gratis. Dirija cada caso según la complejidad del trabajo y luego compare las tasas de resolución y derivación. No envíe todos los restablecimientos de contraseña por la ruta más pesada solo porque el nombre del modelo parece más seguro.
Conecte el ciclo en segundo plano antes de añadir la línea telefónica
Empiece con una sesión activada por texto y una herramienta simulada. Así podrá aislar el comportamiento asíncrono antes de que el operador, el micrófono, el puente de audio y el calendario de producción añadan otros cuatro puntos que depurar.
El ejemplo siguiente utiliza el SDK actual de Python de Google, la configuración de Extended Thinking, una declaración de función no bloqueante, el patrón de respuesta de herramientas y los campos interaction_status y usageMetadata. Guarda el audio devuelto a 24 kHz en response.wav. El resultado de la herramienta es una simulación local, por lo que no modifica un calendario real.
pip install -U google-genai
export GEMINI_API_KEY="YOUR_API_KEY"import asyncio
import wave
from google import genai
from google.genai import types
client = genai.Client()
model = "gemini-3.8-live-extended-thinking"
check_availability = types.FunctionDeclaration(
name="check_availability",
description="Checks the calendar for the next available appointment.",
behavior="NON_BLOCKING",
parameters={
"type": "OBJECT",
"properties": {},
},
)
config = types.LiveConnectConfig(
response_modalities=["AUDIO"],
thinking_config=types.ThinkingConfig(thinking_level="low"),
tools=[types.Tool(function_declarations=[check_availability])],
)
async def main():
async with client.aio.live.connect(model=model, config=config) as session:
await session.send_client_content(
turns={
"parts": [
{"text": "Find the next available appointment and keep me updated."}
]
}
)
with wave.open("response.wav", "wb") as audio:
audio.setnchannels(1)
audio.setsampwidth(2)
audio.setframerate(24000)
async for message in session.receive():
status = getattr(message, "interaction_status", None)
if message.data is not None:
audio.writeframes(message.data)
if message.usage_metadata:
print("Tokens:", message.usage_metadata.total_token_count)
if message.tool_call:
replies = []
for call in message.tool_call.function_calls:
replies.append(
types.FunctionResponse(
id=call.id,
name=call.name,
response={"result": "Tuesday morning is available."},
)
)
await session.send_tool_response(function_responses=replies)
if status == "IDLE":
print("Interaction complete")
break
if __name__ == "__main__":
asyncio.run(main())El error más probable es detener el proceso al recibir el primer turnComplete. Extended Thinking puede haber dicho «Estoy consultando» y seguir a la espera de la herramienta. Mantenga la escucha hasta que interaction_status sea IDLE y conserve el identificador de la llamada a la herramienta vinculado con el resultado de negocio definitivo.
Para un agente telefónico en producción, añada el puente de audio solo cuando este bucle funcione como debe. La comparativa general de costos de agentes de voz ayuda a elegir las capas de telefonía y orquestación que rodean al modelo. Si quiere contrastar el contador de tokens de Google con una tarifa de voz frontal más sencilla, el desglose del costo de llamadas con GPT-Live-1 muestra por qué el denominador debe ser la tarea completada en ambos casos.
Diseñe el piloto en torno a un registro, no a una demostración
Elija un único evento de finalización
Limite el piloto a un flujo de trabajo concreto, como una cita confirmada. Defina el evento exacto de la base de datos que demuestra la finalización y enumere todos los estados que cuentan como fallo, abandono, trabajo duplicado o derivación a personal humano.
Registre el ciclo completo de la sesión en vivo
Guarde el identificador de sesión, cada identificador de llamada a herramienta, los cambios de
interaction_status, las horas de inicio y fin de la herramienta yusageMetadata. Una frase para llenar la espera indica progreso, no finalización.Reúna todas las capas facturadas
Asocie al mismo registro de llamada el uso de Gemini, las tarifas del calendario o CRM, los cargos del operador, la infraestructura, los reintentos y el tiempo del personal. No compare el subtotal ilustrativo de audio de Google de $0.061 con una factura integral del sistema actual.
Pruebe las rutas de fallo
Interrumpa al agente, cambie la fecha solicitada mientras se ejecuta una consulta, provoque un tiempo de espera agotado en la herramienta, simule que no hay disponibilidad y cuelgue antes de recibir el resultado. Compruebe que las llamadas obsoletas no puedan crear una reserva.
Compare las tareas completadas
Procese los mismos tipos de llamada mediante el flujo actual y el nuevo. Compare la finalización verificada, los abandonos, el trabajo de derivación, las acciones duplicadas y el costo total por tarea completada. No declare un ahorro hasta que todos esos registros cuadren.
Los límites reales
El modelo puede llenar el silencio, pero no acelerar un calendario lento, reparar una mala conexión telefónica ni decidir qué considera su empresa una tarea terminada.
Las sesiones solo de audio están limitadas a 15 minutos, salvo que se incorporen técnicas de gestión de sesiones para mantener conversaciones más largas. El límite de contexto del audio nativo es de 128,000 tokens. Las llamadas largas, con muchos turnos, también cuestan de forma distinta a una estimación basada únicamente en la duración, porque el contexto anterior puede volver a procesarse.
La seguridad sigue siendo responsabilidad de la aplicación. Un navegador que se conecta directamente debe utilizar tokens efímeros, no una clave de API estándar. Una reserva, un reembolso o un cambio de cuenta todavía requieren autenticación, validación, idempotencia y un registro de auditoría.
La ruta asíncrona añade otro riesgo de producción: el trabajo obsoleto. Si la persona cambia su solicitud mientras una herramienta se está ejecutando, el resultado anterior puede llegar después. Mantenga un estado explícito de la tarea y rechace los resultados que ya no coincidan con la intención actual.
La acción del lunes: instrumente una sola cola
Actúe esta semana si las esperas silenciosas hacen que las personas repitan lo que dijeron, abandonen una reserva o generen trabajo adicional para el personal. Use Gemini 3.8 Live en consultas directas y Extended Thinking en un único flujo que realmente tenga varias etapas. Mantenga ambos detrás del mismo registro de finalización.
Espere si todavía no puede demostrar la finalización en su propio sistema, si la integración con el operador telefónico no está resuelta o si el flujo contiene una acción irreversible sin una instancia de confirmación. Primero necesita el registro; después, el modelo nuevo.
Este lanzamiento no es relevante para productos que solo trabajan con texto, flujos de voz cuyas herramientas ya responden de inmediato ni un agente telefónico que ya cumple sus objetivos de finalización, derivación y costo. Un modelo nuevo no justifica reemplazar un sistema medido.
Para recibir más análisis claros sobre cambios que afectan los costos operativos y los flujos de trabajo, suscríbase al boletín.
- Última actualización
- 16 sept 2026
- Categoría
- Explained







