IA de voz sem silêncio: o que muda no Gemini 3.8 Live

O Gemini 3.8 Live mantém a conversa enquanto ferramentas rodam em segundo plano. Entenda custos, riscos e como medir tarefas realmente concluídas.

Wednesday, September 16, 2026Omid Saffari
IA de voz sem silêncio: o que muda no Gemini 3.8 Live

Em 15 de setembro de 2026, o Google disponibilizou de forma geral o Gemini 3.8 Live e o Gemini 3.8 Live Extended Thinking. Para quem opera IA de voz, a mudança que importa é simples: o agente pode manter a pessoa informada enquanto o calendário, o sistema de pedidos ou a API de agendamento executa, em segundo plano, a parte mais demorada.

A IA de voz não precisa mais interromper a chamada durante uma consulta

Um agente de voz costuma lidar com duas tarefas ao mesmo tempo: sustentar uma conversa natural e executar uma ação real em outro sistema.

É na segunda tarefa que a chamada geralmente fica desconfortável. O agente consulta a API de agendamento em busca de um horário, espera e deixa a pessoa em silêncio. Ela repete o pedido, pergunta se ainda há alguém na linha ou desliga. Se o aplicativo interpretar essa repetição como uma nova instrução, pode ainda iniciar a mesma tarefa duas vezes.

O Gemini 3.8 Live muda esse fluxo com chamadas de função assíncronas. Na prática, a ferramenta continua trabalhando sem congelar toda a sessão ao vivo. Enquanto a consulta está em andamento, a pessoa pode acrescentar contexto, corrigir um detalhe ou ouvir uma atualização.

O Gemini 3.8 Live Extended Thinking vai além. Ele consegue raciocinar sobre uma tarefa com várias etapas e dar atualizações curtas por voz enquanto as ferramentas trabalham. No exemplo do próprio Google, um fluxo de reserva de viagem consulta vários sistemas sem interromper a conversa ao vivo.

Isso não significa que o Gemini faça reservas por conta própria. O aplicativo continua recebendo a chamada de função, consultando o calendário ou o sistema de pedidos e devolvendo o resultado. O modelo cuida da conversa em torno desse trabalho.

EscolhaQuando usarComportamento da ferramentaSinal de conclusão
gemini-3.8-liveA tarefa é direta e a ferramenta responde rápidoO modo assíncrono é o padrão, mas o modo bloqueante continua disponívelturnComplete: true encerra o turno
gemini-3.8-live-extended-thinkingA tarefa exige várias etapas ou a ferramenta leva alguns segundosApenas assíncrono, com raciocínio low, medium ou highEspere por interaction_status: "IDLE"

A última coluna esconde a principal armadilha em produção. No Extended Thinking, turnComplete: true pode indicar apenas que uma atualização intermediária por voz terminou. A consulta talvez ainda esteja rodando. Se a sessão for encerrada, o botão de reserva for liberado ou a tarefa for marcada como concluída nesse momento, o sistema registrará conclusões falsas.

Cena didática em massinha mostrando uma pessoa ao telefone, uma consulta em segundo plano, uma atualização de progresso e um registro de conclusão verificado
O fluxo útil combina uma conversa ao vivo, uma tarefa em segundo plano e um registro de conclusão verificado.

A métrica de negócio é o custo por tarefa concluída

Falar durante o processamento em segundo plano não gera economia automaticamente. O recurso pode produzir mais saída do modelo enquanto uma ferramenta trabalha, e uma conversa mais longa pode fazer com que mais contexto seja processado novamente nos turnos seguintes. Ele só se justifica quando essa continuidade resulta em mais reservas concluídas, menos chamadas abandonadas ou menos correções manuais.

O Google informa as mesmas tarifas padrão para os dois novos modelos: a entrada de áudio custa $0.005 por minuto, e a saída de áudio, $0.018 por minuto. A entrada de texto custa $0.75 por 1 milhão de tokens; a saída de texto, incluindo tokens de raciocínio, custa $4.50 por 1 milhão de tokens.

Considere uma chamada de agendamento com cinco minutos de duração, na qual o modelo fala por dois minutos. Como o áudio proativo fica permanentemente ativado, a conta simples do áudio novo é $0.025 por cinco minutos de entrada, mais $0.036 por dois minutos de saída. O subtotal bruto de áudio chega a $0.061.

Esse não é o custo final da chamada.

O guia de cobrança da Live API explica que a sessão persistente pode reprocessar o contexto acumulado em turnos posteriores. Transcrições acrescentam cobranças por tokens de texto. O Extended Thinking pode adicionar tokens de saída de raciocínio. Calendário, CRM, operadora de telefonia, hospedagem, novas tentativas e escalonamento para uma pessoa ficam fora do subtotal de áudio do Google.

Use esta fórmula:

Custo por tarefa concluída = todo o gasto com modelo, ferramenta, telefonia, infraestrutura, novas tentativas e escalonamento dividido pelo total de tarefas concluídas e verificadas.

Uma tarefa concluída não é apenas uma transcrição agradável. Em uma central de agendamento, é um ID de reserva gravado uma única vez, lido de volta corretamente e aceito pela pessoa. No suporte a pedidos, é a ação certa vinculada à conta certa. Em uma transferência, é o encaminhamento que chegou à fila pretendida com o contexto preservado.

O Google inclui periodicamente os totais de tokens consumidos em usageMetadata. Vincule esse registro ao ID da chamada de ferramenta, à sessão da operadora, ao resultado final de negócio e a qualquer trabalho humano. Assim, cada chamada ganha um registro auditável, em vez de uma estimativa por minuto que precisa ser aceita sem verificação.

Os números de lançamento não substituem esse piloto. O Google informa 68.6% no benchmark de tarefas tau-Voice e 35.1% na versão voltada a serviços bancários para o Extended Thinking. Esses resultados mostram que o modelo pode ser testado em tarefas agênticas por voz. Eles não dizem qual porcentagem das pessoas concluirá uma reserva no seu calendário, com suas políticas e sua conexão telefônica.

Quatro fluxos em que o tempo de espera faz diferença

Uma clínica odontológica agendando uma consulta

A liderança de operações pode deixar o agente coletar o dia preferido, consultar a disponibilidade e avisar que continua procurando enquanto o calendário responde. O ganho não está apenas em reduzir o silêncio: está em confirmar mais consultas e diminuir a necessidade de retorno da equipe.

A regra de segurança é rígida: uma atualização por voz não equivale a uma reserva. O sistema só deve criar o agendamento depois que a pessoa escolher um dos horários retornados, e novas tentativas devem reutilizar uma chave de idempotência para impedir que uma chamada crie a mesma consulta duas vezes.

Uma equipe de ecommerce consultando um pedido

A liderança de suporte pode manter a pessoa na mesma conversa enquanto o agente consulta o sistema de pedidos. Se o pedido mudar de “onde está meu pacote?” para “altere o endereço de entrega”, o aplicativo precisa considerar a solicitação mais recente como a ativa e cancelar ou ignorar trabalhos desatualizados.

O ganho é reduzir transferências em casos rotineiros. O risco é entregar a resposta certa para uma pergunta antiga depois que a conversa já tomou outro rumo.

Uma equipe de viagens cuidando de uma remarcação

Busca de voos, verificação de políticas, disponibilidade de hotéis e comparação de tarifas tornam esse caso mais adequado ao Extended Thinking. O modelo pode narrar o progresso enquanto várias funções não bloqueantes trabalham.

Mantenha pagamentos e alterações de bilhete atrás de uma etapa de confirmação. Uma voz natural não reduz o nível de aprovação exigido para uma ação irreversível.

Uma fila de suporte técnico diagnosticando um problema de conta

Uma consulta rápida à conta combina com o Gemini 3.8 Live. Um diagnóstico que reúne vários logs e verifica uma configuração pode justificar o Extended Thinking.

Essa divisão importa porque o raciocínio mais profundo tem custo. Direcione cada chamada conforme a complexidade da tarefa e depois compare as taxas de resolução e escalonamento. Não envie toda redefinição de senha para o caminho mais pesado apenas porque o nome do modelo parece mais seguro.

Configure o ciclo de vida em segundo plano antes da linha telefônica

Comece com uma sessão acionada por texto e uma ferramenta simulada. Isso permite isolar o comportamento assíncrono antes que operadora, microfone, ponte de áudio e calendário de produção acrescentem mais quatro pontos para depurar.

O exemplo abaixo segue o SDK atual do Google para Python, a configuração do Extended Thinking, a declaração de função não bloqueante, o padrão de resposta da ferramenta e os campos interaction_status e usageMetadata. O áudio retornado em 24 kHz é gravado em response.wav. Como o resultado da ferramenta é uma simulação local, nenhum calendário real é acessado.

Bash
pip install -U google-genai
export GEMINI_API_KEY="YOUR_API_KEY"
Python
import asyncio
import wave

from google import genai
from google.genai import types

client = genai.Client()
model = "gemini-3.8-live-extended-thinking"

check_availability = types.FunctionDeclaration(
    name="check_availability",
    description="Checks the calendar for the next available appointment.",
    behavior="NON_BLOCKING",
    parameters={
        "type": "OBJECT",
        "properties": {},
    },
)

config = types.LiveConnectConfig(
    response_modalities=["AUDIO"],
    thinking_config=types.ThinkingConfig(thinking_level="low"),
    tools=[types.Tool(function_declarations=[check_availability])],
)


async def main():
    async with client.aio.live.connect(model=model, config=config) as session:
        await session.send_client_content(
            turns={
                "parts": [
                    {"text": "Find the next available appointment and keep me updated."}
                ]
            }
        )

        with wave.open("response.wav", "wb") as audio:
            audio.setnchannels(1)
            audio.setsampwidth(2)
            audio.setframerate(24000)

            async for message in session.receive():
                status = getattr(message, "interaction_status", None)

                if message.data is not None:
                    audio.writeframes(message.data)

                if message.usage_metadata:
                    print("Tokens:", message.usage_metadata.total_token_count)

                if message.tool_call:
                    replies = []
                    for call in message.tool_call.function_calls:
                        replies.append(
                            types.FunctionResponse(
                                id=call.id,
                                name=call.name,
                                response={"result": "Tuesday morning is available."},
                            )
                        )
                    await session.send_tool_response(function_responses=replies)

                if status == "IDLE":
                    print("Interaction complete")
                    break


if __name__ == "__main__":
    asyncio.run(main())

O erro mais provável é interromper o fluxo no primeiro turnComplete. O Extended Thinking pode já ter dito “estou verificando” e ainda estar esperando a ferramenta. Continue ouvindo até que interaction_status seja IDLE e mantenha o ID da chamada de ferramenta associado ao resultado final de negócio.

Em um agente telefônico de produção, só acrescente a ponte de áudio depois que esse loop estiver funcionando corretamente. O comparativo mais amplo de custos de agentes de voz ajuda a escolher as camadas de operadora e orquestração ao redor do modelo. Para comparar o medidor de tokens do Google com uma tarifa de voz mais simples na camada de interface, a análise do custo de chamadas com GPT-Live-1 mostra por que o denominador de tarefas concluídas importa nos dois casos.

Estruture o piloto em torno de um registro, não de uma demonstração

  1. Escolha um único evento de conclusão

    Use um fluxo bem delimitado, como uma consulta confirmada. Defina o evento exato no banco de dados que comprova a conclusão e nomeie todos os estados considerados falha, abandono, trabalho duplicado ou escalonamento para uma pessoa.

  2. Registre o ciclo de vida da sessão ao vivo

    Armazene o ID da sessão, todos os IDs de chamadas de ferramenta, as mudanças em interaction_status, os horários de início e fim das ferramentas e usageMetadata. Uma fala para preencher a espera indica progresso, não conclusão.

  3. Reúna todas as camadas cobradas

    Vincule ao mesmo registro de chamada o uso do Gemini, as tarifas do calendário ou CRM, os custos da operadora, a infraestrutura, as novas tentativas e o tempo da equipe. Não compare o subtotal ilustrativo de áudio de $0.061 do Google com uma fatura completa do sistema atual.

  4. Teste os caminhos de falha

    Interrompa o agente, mude a data solicitada enquanto uma consulta estiver rodando, force o timeout da ferramenta, retorne indisponibilidade e desligue antes do resultado. Confirme que chamadas desatualizadas não conseguem gravar uma reserva.

  5. Compare tarefas concluídas

    Passe os mesmos tipos de chamada pelo fluxo atual e pelo novo. Compare conclusão verificada, abandono, trabalho de escalonamento, ações duplicadas e custo total por tarefa concluída. Só declare economia depois de reconciliar esses registros.

Os limites, sem maquiagem

O modelo pode preencher o silêncio. Não pode acelerar um calendário lento, corrigir uma conexão telefônica ruim nem decidir o que sua empresa considera uma tarefa concluída.

Sessões apenas com áudio ficam limitadas a 15 minutos, a menos que sejam adotadas técnicas de gerenciamento para conversas mais longas. O limite de contexto do áudio nativo é de 128,000 tokens. Chamadas longas e com muitos turnos também custam de forma diferente de uma simples estimativa por duração, pois o contexto anterior pode ser processado novamente.

A segurança continua sob responsabilidade do aplicativo. Um navegador conectado diretamente deve usar tokens efêmeros, não uma chave de API padrão. Reserva, reembolso ou alteração de conta ainda exigem autenticação, validação, idempotência e trilha de auditoria.

O caminho assíncrono cria mais um risco em produção: trabalho desatualizado. Se a pessoa mudar o pedido enquanto uma ferramenta estiver rodando, o resultado antigo pode chegar depois. Acompanhe explicitamente o estado da tarefa e rejeite resultados que já não correspondam à intenção atual.

A ação para segunda-feira: instrumente uma fila bem delimitada

Comece nesta semana se a espera silenciosa pelas ferramentas faz as pessoas repetirem pedidos, abandonarem agendamentos ou exigirem correções da equipe. Use o Gemini 3.8 Live nas consultas diretas e o Extended Thinking em um único fluxo realmente composto por várias etapas. Mantenha os dois sob o mesmo registro de conclusão.

Espere se ainda não for possível comprovar a conclusão no seu sistema, se o caminho da operadora não estiver definido ou se o fluxo incluir uma ação irreversível sem uma etapa de confirmação. O registro vem antes do modelo novo.

Este lançamento não muda nada para produtos somente de texto, fluxos de voz cujas ferramentas já respondem imediatamente ou um agente telefônico que já cumpre as metas de conclusão, escalonamento e custo. Um modelo novo não é motivo para substituir um sistema já medido.

Para receber mais análises diretas sobre mudanças que afetam custos operacionais e fluxos de trabalho, assine a newsletter.

Última atualização
16 de set. de 2026
Categoria
Explained

Prefira este site no Google

Adicionar omidsaffari.com como fonte preferida na Busca do Google

Marque omidsaffari.com como fonte preferida e o Google destaca o site para você em Top Stories, AI Overviews e AI Mode.

Wrangler Cloudflare: controle o deploy de cada cliente

Wrangler Cloudflare: controle o deploy de cada cliente

Veja como restringir o deploy com Wrangler Cloudflare a um único Worker por cliente, usando tokens, papéis granulares e políticas de menor privilégio.15 de set. de 2026Explained
Controle de acesso à rede no Claude Code passa a valer por comando

Controle de acesso à rede no Claude Code passa a valer por comando

Entenda como o controle de acesso à rede por comando do Claude Code reduz permissões persistentes em instalações de dependências executadas no sandbox.15 de set. de 2026Explained
Agentes de IA no Vercel AI SDK: a assinatura pode pagar a conta

Agentes de IA no Vercel AI SDK: a assinatura pode pagar a conta

O Vercel AI SDK agora usa assinaturas compatíveis de agentes de IA. Veja qual credencial define a cobrança, qual plano paga e quanto o Sandbox ainda custa.15 de set. de 2026Explained
Browser automation com Cloudflare: hosts aprovados e revisão somente leitura

Browser automation com Cloudflare: hosts aprovados e revisão somente leitura

Veja como restringir o Cloudflare Browser Run a hosts aprovados, oferecer Live View somente leitura e calcular o impacto na operação e na cobrança.14 de set. de 2026Explained
Agente de voz IA: o custo real de uma ligação com GPT-Live-1

Agente de voz IA: o custo real de uma ligação com GPT-Live-1

Entenda o custo real de um agente de voz IA com GPT-Live-1: $0.05 por minuto, mais raciocínio no backend, ferramentas e telefonia por chamada.14 de set. de 2026Explained
ChatGPT para Windows: Appshots reduzem o trabalho de copiar contexto

ChatGPT para Windows: Appshots reduzem o trabalho de copiar contexto

Veja como usar Appshots no ChatGPT para Windows para enviar uma janela ao chat, reduzir o copia e cola de contexto e revisar os dados compartilhados.14 de set. de 2026Explained
FastAPI Vercel: arquivos estáticos deixam de usar Functions

FastAPI Vercel: arquivos estáticos deixam de usar Functions

A Vercel agora entrega arquivos estáticos elegíveis do FastAPI pela CDN. Veja quais requisições deixam de usar Functions e quando a proteção exige Python.13 de set. de 2026Explained
Chave da API OpenAI: como planejar a rotação sem interrupções

Chave da API OpenAI: como planejar a rotação sem interrupções

Entenda como definir a validade da chave da API OpenAI, preparar a substituição e verificar cada automação antes que a credencial expire em produção.13 de set. de 2026Explained
Newsletter

Uma carta, todo domingo.Sistemas que funcionam, não hot takes.

Semanal. Sem spam. Cancele quando quiser.