IA de voz sem silêncio: o que muda no Gemini 3.8 Live
O Gemini 3.8 Live mantém a conversa enquanto ferramentas rodam em segundo plano. Entenda custos, riscos e como medir tarefas realmente concluídas.

Em 15 de setembro de 2026, o Google disponibilizou de forma geral o Gemini 3.8 Live e o Gemini 3.8 Live Extended Thinking. Para quem opera IA de voz, a mudança que importa é simples: o agente pode manter a pessoa informada enquanto o calendário, o sistema de pedidos ou a API de agendamento executa, em segundo plano, a parte mais demorada.
A IA de voz não precisa mais interromper a chamada durante uma consulta
Um agente de voz costuma lidar com duas tarefas ao mesmo tempo: sustentar uma conversa natural e executar uma ação real em outro sistema.
É na segunda tarefa que a chamada geralmente fica desconfortável. O agente consulta a API de agendamento em busca de um horário, espera e deixa a pessoa em silêncio. Ela repete o pedido, pergunta se ainda há alguém na linha ou desliga. Se o aplicativo interpretar essa repetição como uma nova instrução, pode ainda iniciar a mesma tarefa duas vezes.
O Gemini 3.8 Live muda esse fluxo com chamadas de função assíncronas. Na prática, a ferramenta continua trabalhando sem congelar toda a sessão ao vivo. Enquanto a consulta está em andamento, a pessoa pode acrescentar contexto, corrigir um detalhe ou ouvir uma atualização.
O Gemini 3.8 Live Extended Thinking vai além. Ele consegue raciocinar sobre uma tarefa com várias etapas e dar atualizações curtas por voz enquanto as ferramentas trabalham. No exemplo do próprio Google, um fluxo de reserva de viagem consulta vários sistemas sem interromper a conversa ao vivo.
Isso não significa que o Gemini faça reservas por conta própria. O aplicativo continua recebendo a chamada de função, consultando o calendário ou o sistema de pedidos e devolvendo o resultado. O modelo cuida da conversa em torno desse trabalho.
A última coluna esconde a principal armadilha em produção. No Extended Thinking, turnComplete: true pode indicar apenas que uma atualização intermediária por voz terminou. A consulta talvez ainda esteja rodando. Se a sessão for encerrada, o botão de reserva for liberado ou a tarefa for marcada como concluída nesse momento, o sistema registrará conclusões falsas.

A métrica de negócio é o custo por tarefa concluída
Falar durante o processamento em segundo plano não gera economia automaticamente. O recurso pode produzir mais saída do modelo enquanto uma ferramenta trabalha, e uma conversa mais longa pode fazer com que mais contexto seja processado novamente nos turnos seguintes. Ele só se justifica quando essa continuidade resulta em mais reservas concluídas, menos chamadas abandonadas ou menos correções manuais.
O Google informa as mesmas tarifas padrão para os dois novos modelos: a entrada de áudio custa $0.005 por minuto, e a saída de áudio, $0.018 por minuto. A entrada de texto custa $0.75 por 1 milhão de tokens; a saída de texto, incluindo tokens de raciocínio, custa $4.50 por 1 milhão de tokens.
Considere uma chamada de agendamento com cinco minutos de duração, na qual o modelo fala por dois minutos. Como o áudio proativo fica permanentemente ativado, a conta simples do áudio novo é $0.025 por cinco minutos de entrada, mais $0.036 por dois minutos de saída. O subtotal bruto de áudio chega a $0.061.
Esse não é o custo final da chamada.
O guia de cobrança da Live API explica que a sessão persistente pode reprocessar o contexto acumulado em turnos posteriores. Transcrições acrescentam cobranças por tokens de texto. O Extended Thinking pode adicionar tokens de saída de raciocínio. Calendário, CRM, operadora de telefonia, hospedagem, novas tentativas e escalonamento para uma pessoa ficam fora do subtotal de áudio do Google.
Use esta fórmula:
Custo por tarefa concluída = todo o gasto com modelo, ferramenta, telefonia, infraestrutura, novas tentativas e escalonamento dividido pelo total de tarefas concluídas e verificadas.
Uma tarefa concluída não é apenas uma transcrição agradável. Em uma central de agendamento, é um ID de reserva gravado uma única vez, lido de volta corretamente e aceito pela pessoa. No suporte a pedidos, é a ação certa vinculada à conta certa. Em uma transferência, é o encaminhamento que chegou à fila pretendida com o contexto preservado.
O Google inclui periodicamente os totais de tokens consumidos em usageMetadata. Vincule esse registro ao ID da chamada de ferramenta, à sessão da operadora, ao resultado final de negócio e a qualquer trabalho humano. Assim, cada chamada ganha um registro auditável, em vez de uma estimativa por minuto que precisa ser aceita sem verificação.
Os números de lançamento não substituem esse piloto. O Google informa 68.6% no benchmark de tarefas tau-Voice e 35.1% na versão voltada a serviços bancários para o Extended Thinking. Esses resultados mostram que o modelo pode ser testado em tarefas agênticas por voz. Eles não dizem qual porcentagem das pessoas concluirá uma reserva no seu calendário, com suas políticas e sua conexão telefônica.
Quatro fluxos em que o tempo de espera faz diferença
Uma clínica odontológica agendando uma consulta
A liderança de operações pode deixar o agente coletar o dia preferido, consultar a disponibilidade e avisar que continua procurando enquanto o calendário responde. O ganho não está apenas em reduzir o silêncio: está em confirmar mais consultas e diminuir a necessidade de retorno da equipe.
A regra de segurança é rígida: uma atualização por voz não equivale a uma reserva. O sistema só deve criar o agendamento depois que a pessoa escolher um dos horários retornados, e novas tentativas devem reutilizar uma chave de idempotência para impedir que uma chamada crie a mesma consulta duas vezes.
Uma equipe de ecommerce consultando um pedido
A liderança de suporte pode manter a pessoa na mesma conversa enquanto o agente consulta o sistema de pedidos. Se o pedido mudar de “onde está meu pacote?” para “altere o endereço de entrega”, o aplicativo precisa considerar a solicitação mais recente como a ativa e cancelar ou ignorar trabalhos desatualizados.
O ganho é reduzir transferências em casos rotineiros. O risco é entregar a resposta certa para uma pergunta antiga depois que a conversa já tomou outro rumo.
Uma equipe de viagens cuidando de uma remarcação
Busca de voos, verificação de políticas, disponibilidade de hotéis e comparação de tarifas tornam esse caso mais adequado ao Extended Thinking. O modelo pode narrar o progresso enquanto várias funções não bloqueantes trabalham.
Mantenha pagamentos e alterações de bilhete atrás de uma etapa de confirmação. Uma voz natural não reduz o nível de aprovação exigido para uma ação irreversível.
Uma fila de suporte técnico diagnosticando um problema de conta
Uma consulta rápida à conta combina com o Gemini 3.8 Live. Um diagnóstico que reúne vários logs e verifica uma configuração pode justificar o Extended Thinking.
Essa divisão importa porque o raciocínio mais profundo tem custo. Direcione cada chamada conforme a complexidade da tarefa e depois compare as taxas de resolução e escalonamento. Não envie toda redefinição de senha para o caminho mais pesado apenas porque o nome do modelo parece mais seguro.
Configure o ciclo de vida em segundo plano antes da linha telefônica
Comece com uma sessão acionada por texto e uma ferramenta simulada. Isso permite isolar o comportamento assíncrono antes que operadora, microfone, ponte de áudio e calendário de produção acrescentem mais quatro pontos para depurar.
O exemplo abaixo segue o SDK atual do Google para Python, a configuração do Extended Thinking, a declaração de função não bloqueante, o padrão de resposta da ferramenta e os campos interaction_status e usageMetadata. O áudio retornado em 24 kHz é gravado em response.wav. Como o resultado da ferramenta é uma simulação local, nenhum calendário real é acessado.
pip install -U google-genai
export GEMINI_API_KEY="YOUR_API_KEY"import asyncio
import wave
from google import genai
from google.genai import types
client = genai.Client()
model = "gemini-3.8-live-extended-thinking"
check_availability = types.FunctionDeclaration(
name="check_availability",
description="Checks the calendar for the next available appointment.",
behavior="NON_BLOCKING",
parameters={
"type": "OBJECT",
"properties": {},
},
)
config = types.LiveConnectConfig(
response_modalities=["AUDIO"],
thinking_config=types.ThinkingConfig(thinking_level="low"),
tools=[types.Tool(function_declarations=[check_availability])],
)
async def main():
async with client.aio.live.connect(model=model, config=config) as session:
await session.send_client_content(
turns={
"parts": [
{"text": "Find the next available appointment and keep me updated."}
]
}
)
with wave.open("response.wav", "wb") as audio:
audio.setnchannels(1)
audio.setsampwidth(2)
audio.setframerate(24000)
async for message in session.receive():
status = getattr(message, "interaction_status", None)
if message.data is not None:
audio.writeframes(message.data)
if message.usage_metadata:
print("Tokens:", message.usage_metadata.total_token_count)
if message.tool_call:
replies = []
for call in message.tool_call.function_calls:
replies.append(
types.FunctionResponse(
id=call.id,
name=call.name,
response={"result": "Tuesday morning is available."},
)
)
await session.send_tool_response(function_responses=replies)
if status == "IDLE":
print("Interaction complete")
break
if __name__ == "__main__":
asyncio.run(main())O erro mais provável é interromper o fluxo no primeiro turnComplete. O Extended Thinking pode já ter dito “estou verificando” e ainda estar esperando a ferramenta. Continue ouvindo até que interaction_status seja IDLE e mantenha o ID da chamada de ferramenta associado ao resultado final de negócio.
Em um agente telefônico de produção, só acrescente a ponte de áudio depois que esse loop estiver funcionando corretamente. O comparativo mais amplo de custos de agentes de voz ajuda a escolher as camadas de operadora e orquestração ao redor do modelo. Para comparar o medidor de tokens do Google com uma tarifa de voz mais simples na camada de interface, a análise do custo de chamadas com GPT-Live-1 mostra por que o denominador de tarefas concluídas importa nos dois casos.
Estruture o piloto em torno de um registro, não de uma demonstração
Escolha um único evento de conclusão
Use um fluxo bem delimitado, como uma consulta confirmada. Defina o evento exato no banco de dados que comprova a conclusão e nomeie todos os estados considerados falha, abandono, trabalho duplicado ou escalonamento para uma pessoa.
Registre o ciclo de vida da sessão ao vivo
Armazene o ID da sessão, todos os IDs de chamadas de ferramenta, as mudanças em
interaction_status, os horários de início e fim das ferramentas eusageMetadata. Uma fala para preencher a espera indica progresso, não conclusão.Reúna todas as camadas cobradas
Vincule ao mesmo registro de chamada o uso do Gemini, as tarifas do calendário ou CRM, os custos da operadora, a infraestrutura, as novas tentativas e o tempo da equipe. Não compare o subtotal ilustrativo de áudio de $0.061 do Google com uma fatura completa do sistema atual.
Teste os caminhos de falha
Interrompa o agente, mude a data solicitada enquanto uma consulta estiver rodando, force o timeout da ferramenta, retorne indisponibilidade e desligue antes do resultado. Confirme que chamadas desatualizadas não conseguem gravar uma reserva.
Compare tarefas concluídas
Passe os mesmos tipos de chamada pelo fluxo atual e pelo novo. Compare conclusão verificada, abandono, trabalho de escalonamento, ações duplicadas e custo total por tarefa concluída. Só declare economia depois de reconciliar esses registros.
Os limites, sem maquiagem
O modelo pode preencher o silêncio. Não pode acelerar um calendário lento, corrigir uma conexão telefônica ruim nem decidir o que sua empresa considera uma tarefa concluída.
Sessões apenas com áudio ficam limitadas a 15 minutos, a menos que sejam adotadas técnicas de gerenciamento para conversas mais longas. O limite de contexto do áudio nativo é de 128,000 tokens. Chamadas longas e com muitos turnos também custam de forma diferente de uma simples estimativa por duração, pois o contexto anterior pode ser processado novamente.
A segurança continua sob responsabilidade do aplicativo. Um navegador conectado diretamente deve usar tokens efêmeros, não uma chave de API padrão. Reserva, reembolso ou alteração de conta ainda exigem autenticação, validação, idempotência e trilha de auditoria.
O caminho assíncrono cria mais um risco em produção: trabalho desatualizado. Se a pessoa mudar o pedido enquanto uma ferramenta estiver rodando, o resultado antigo pode chegar depois. Acompanhe explicitamente o estado da tarefa e rejeite resultados que já não correspondam à intenção atual.
A ação para segunda-feira: instrumente uma fila bem delimitada
Comece nesta semana se a espera silenciosa pelas ferramentas faz as pessoas repetirem pedidos, abandonarem agendamentos ou exigirem correções da equipe. Use o Gemini 3.8 Live nas consultas diretas e o Extended Thinking em um único fluxo realmente composto por várias etapas. Mantenha os dois sob o mesmo registro de conclusão.
Espere se ainda não for possível comprovar a conclusão no seu sistema, se o caminho da operadora não estiver definido ou se o fluxo incluir uma ação irreversível sem uma etapa de confirmação. O registro vem antes do modelo novo.
Este lançamento não muda nada para produtos somente de texto, fluxos de voz cujas ferramentas já respondem imediatamente ou um agente telefônico que já cumpre as metas de conclusão, escalonamento e custo. Um modelo novo não é motivo para substituir um sistema já medido.
Para receber mais análises diretas sobre mudanças que afetam custos operacionais e fluxos de trabalho, assine a newsletter.
- Última atualização
- 16 de set. de 2026
- Categoria
- Explained







