Agent vocal IA : Gemini 3.8 Live passe aux outils asynchrones
Gemini 3.8 Live laisse un agent vocal IA parler pendant l’exécution des outils. Découvrez l’impact sur les réservations, le suivi client et les coûts.

Le 15 septembre 2026, Google a rendu Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking disponibles de manière générale. Le changement concret tient en une phrase : un agent vocal IA peut continuer à informer son interlocuteur pendant que votre agenda, votre système de commandes ou votre API de réservation effectue en arrière-plan le travail qui prend du temps.
Pourquoi l’agent vocal IA ne doit plus suspendre l’appel
Un agent vocal remplit généralement deux missions à la fois. Il doit entretenir une conversation naturelle tout en réalisant une action concrète dans un autre système.
C’est cette seconde mission qui rend souvent les appels pénibles. L’agent interroge votre API de réservation pour trouver un créneau, attend la réponse et laisse l’appelant face au silence. Celui-ci répète alors sa demande, vérifie que quelqu’un est toujours en ligne ou raccroche. Et si l’application interprète cette répétition comme une nouvelle instruction, elle peut aussi lancer deux fois la même tâche.
Gemini 3.8 Live change ce fonctionnement grâce aux appels de fonction asynchrones. L’outil peut ainsi poursuivre son exécution sans figer toute la session en direct. Pendant que la recherche continue, l’appelant peut préciser sa demande, corriger un détail ou recevoir un point d’avancement.
Gemini 3.8 Live Extended Thinking va plus loin. Il peut raisonner sur une tâche en plusieurs étapes et donner de brèves nouvelles pendant l’exécution des outils. Dans l’exemple de Google, un parcours de réservation de voyage consulte plusieurs systèmes sans interrompre la conversation en direct.
Cela ne signifie pas que Gemini effectue lui-même une réservation. Votre application reçoit toujours l’appel de fonction, lance la recherche dans l’agenda ou le système de commandes, puis renvoie le résultat. Le modèle prend en charge la conversation qui entoure ce travail.
La dernière colonne cache le principal piège en production. Avec Extended Thinking, turnComplete: true peut simplement indiquer qu’un point d’avancement oral vient de se terminer. La recherche, elle, est peut-être encore en cours. Fermer la session, activer le bouton de réservation ou déclarer la tâche terminée à ce moment-là créerait de faux statuts de fin.

Le bon indicateur : le coût par tâche menée à terme
Parler pendant une recherche n’entraîne pas automatiquement des économies. Cela peut ajouter de la sortie générée par le modèle pendant l’exécution d’un outil, tandis qu’une conversation plus longue peut accroître le volume de contexte retraité lors des tours suivants. Cette fonctionnalité n’a d’intérêt que si cette continuité se traduit par davantage de réservations finalisées, moins d’appels abandonnés ou moins de reprises manuelles.
Google affiche les mêmes tarifs standards pour les deux nouveaux modèles : l’entrée audio coûte $0.005 par minute et la sortie audio $0.018 par minute. L’entrée texte coûte $0.75 par 1 million de tokens, contre $4.50 par 1 million de tokens pour la sortie texte, tokens de réflexion compris.
Prenons un appel de réservation de cinq minutes durant lequel le modèle parle pendant deux minutes. Comme l’audio proactif est activé en permanence, le calcul audio de base donne $0.025 pour cinq minutes d’entrée, auxquels s’ajoutent $0.036 pour deux minutes de sortie. Soit un sous-total audio brut de $0.061.
Ce n’est pas le coût final de l’appel.
Le guide de facturation de la Live API précise qu’une session persistante peut retraiter le contexte accumulé lors des tours suivants. Les transcriptions ajoutent des frais liés aux tokens texte. Extended Thinking peut générer des tokens de réflexion supplémentaires. Votre agenda, votre CRM, votre opérateur téléphonique, l’hébergement, les nouvelles tentatives et le transfert vers un conseiller ne sont pas inclus dans le sous-total audio de Google.
Utilisez plutôt cette formule :
Coût par tâche menée à terme = ensemble des dépenses liées au modèle, aux outils, au téléphone, à l’infrastructure, aux nouvelles tentatives et aux escalades, divisé par le nombre de tâches dont l’achèvement est vérifié.
Une tâche achevée ne se résume pas à une transcription agréable. Pour une ligne de prise de rendez-vous, il faut qu’un identifiant de réservation soit enregistré une seule fois, relu correctement et accepté par l’appelant. Pour le suivi de commande, la bonne action doit être associée au bon compte. Pour un transfert, l’appel doit atteindre la file prévue avec tout son contexte.
Google renvoie régulièrement le total des tokens consommés dans usageMetadata. Reliez cet enregistrement à l’identifiant de l’appel d’outil, à la session de l’opérateur, au résultat métier final et à toute intervention humaine. Vous obtenez ainsi un registre par appel que vous pouvez auditer, plutôt qu’une estimation à la minute qu’il faudrait accepter sans preuve.
Les chiffres de lancement ne remplacent pas ce pilote. Google annonce 68.6% sur le benchmark de tâches tau-Voice et 35.1% sur sa déclinaison bancaire pour Extended Thinking. Ces scores indiquent que le modèle peut être évalué sur des tâches vocales agentiques. Ils ne disent pas quelle part de vos appelants finalisera une réservation dans votre agenda, avec vos règles et votre connexion téléphonique.
Quatre workflows où l’attente compte vraiment
Un cabinet dentaire qui prend un rendez-vous
Un responsable des opérations peut laisser l’agent recueillir le jour souhaité par l’appelant, lancer une recherche de disponibilité et préciser que la vérification continue pendant que l’agenda répond. Le bénéfice ne se limite pas à raccourcir le silence. Il se mesure au nombre de rendez-vous confirmés et à la baisse des rappels par le personnel.
La règle de sécurité est stricte : un point d’avancement oral ne vaut pas réservation. Le système ne doit créer le rendez-vous qu’après le choix d’un créneau retourné par l’outil, et les nouvelles tentatives doivent réutiliser une clé d’idempotence pour qu’un même appel ne puisse pas générer deux fois le même rendez-vous.
Une équipe e-commerce qui vérifie une commande
Le service client peut garder l’appelant dans la même conversation pendant que l’agent interroge le système de commandes. Si la demande passe de « où est mon colis ? » à « modifiez l’adresse de livraison », votre application doit considérer la plus récente comme active et annuler ou ignorer le travail devenu obsolète.
Le bénéfice attendu est une baisse des transferts sur les cas courants. Le risque, lui, consiste à fournir la bonne réponse à une ancienne question alors que l’appelant est déjà passé à autre chose.
Une équipe voyage qui gère un changement de réservation
La recherche de vols, la vérification des règles, la disponibilité des hôtels et la comparaison des tarifs rendent ce cas plus adapté à Extended Thinking. Le modèle peut annoncer sa progression pendant l’exécution de plusieurs fonctions non bloquantes.
Le paiement et les modifications de billets doivent rester soumis à une étape de confirmation. Une voix naturelle ne réduit pas le niveau d’approbation requis pour une action irréversible.
Un support technique qui diagnostique un problème de compte
Une consultation rapide du compte relève de Gemini 3.8 Live. Un diagnostic qui rassemble plusieurs journaux et vérifie une configuration peut justifier Extended Thinking.
Cette distinction compte, car un raisonnement plus poussé n’est pas gratuit. Orientez les appels selon la complexité de la tâche, puis comparez les taux de résolution et d’escalade. Inutile de faire passer chaque réinitialisation de mot de passe par le parcours le plus lourd simplement parce que le nom du modèle paraît plus rassurant.
Fiabilisez le cycle en arrière-plan avant de brancher la téléphonie
Commencez par une session déclenchée par du texte et un outil factice. Vous pourrez ainsi isoler le comportement asynchrone avant qu’un opérateur, un microphone, une passerelle audio et un agenda de production n’ajoutent quatre couches supplémentaires à déboguer.
L’exemple ci-dessous reprend le SDK Python actuel de Google, la configuration Extended Thinking, une déclaration de fonction non bloquante, le schéma de réponse de l’outil ainsi que les champs interaction_status et usageMetadata. Il enregistre l’audio 24 kHz renvoyé dans response.wav. Le résultat de l’outil est simulé localement : aucun agenda réel n’est sollicité.
pip install -U google-genai
export GEMINI_API_KEY="YOUR_API_KEY"import asyncio
import wave
from google import genai
from google.genai import types
client = genai.Client()
model = "gemini-3.8-live-extended-thinking"
check_availability = types.FunctionDeclaration(
name="check_availability",
description="Checks the calendar for the next available appointment.",
behavior="NON_BLOCKING",
parameters={
"type": "OBJECT",
"properties": {},
},
)
config = types.LiveConnectConfig(
response_modalities=["AUDIO"],
thinking_config=types.ThinkingConfig(thinking_level="low"),
tools=[types.Tool(function_declarations=[check_availability])],
)
async def main():
async with client.aio.live.connect(model=model, config=config) as session:
await session.send_client_content(
turns={
"parts": [
{"text": "Find the next available appointment and keep me updated."}
]
}
)
with wave.open("response.wav", "wb") as audio:
audio.setnchannels(1)
audio.setsampwidth(2)
audio.setframerate(24000)
async for message in session.receive():
status = getattr(message, "interaction_status", None)
if message.data is not None:
audio.writeframes(message.data)
if message.usage_metadata:
print("Tokens:", message.usage_metadata.total_token_count)
if message.tool_call:
replies = []
for call in message.tool_call.function_calls:
replies.append(
types.FunctionResponse(
id=call.id,
name=call.name,
response={"result": "Tuesday morning is available."},
)
)
await session.send_tool_response(function_responses=replies)
if status == "IDLE":
print("Interaction complete")
break
if __name__ == "__main__":
asyncio.run(main())L’erreur la plus probable consiste à interrompre la boucle au premier turnComplete. Extended Thinking peut avoir annoncé « je vérifie » alors que l’outil n’a pas encore répondu. Continuez à écouter jusqu’à ce que interaction_status passe à IDLE, et conservez l’identifiant de l’appel d’outil avec le résultat métier obtenu ensuite.
Pour un agent téléphonique en production, n’ajoutez la passerelle audio qu’une fois cette boucle fiable. Le comparatif plus large des coûts des agents vocaux aide à choisir l’opérateur et les couches d’orchestration autour du modèle. Et pour comparer la facturation par tokens de Google à un tarif vocal frontal plus simple, le détail du coût d’un appel avec GPT-Live-1 montre pourquoi le dénominateur doit rester la tâche menée à terme dans les deux cas.
Pilotez avec un registre, pas avec une démo
Choisissez un seul événement d’achèvement
Partez d’un workflow étroit, par exemple un rendez-vous confirmé. Définissez précisément l’événement de base de données qui prouve son achèvement, puis nommez chaque état correspondant à un échec, un abandon, un doublon ou un transfert vers un conseiller.
Journalisez tout le cycle de la session
Conservez l’identifiant de session, chaque identifiant d’appel d’outil, les changements d’
interaction_status, les heures de début et de fin des outils ainsi queusageMetadata. Une phrase destinée à meubler l’attente signale une progression, pas un achèvement.Rattachez chaque poste facturé
Associez au même enregistrement d’appel l’usage de Gemini, les frais d’agenda ou de CRM, les coûts de l’opérateur, l’infrastructure, les nouvelles tentatives et le temps du personnel. Ne comparez pas le sous-total audio indicatif de $0.061 chez Google à la facture tout compris de votre solution actuelle.
Testez les scénarios d’échec
Interrompez l’agent, changez la date demandée pendant une recherche, provoquez un délai d’expiration de l’outil, ne renvoyez aucune disponibilité, puis raccrochez avant le résultat. Vérifiez qu’un appel d’outil devenu obsolète ne peut jamais enregistrer une réservation.
Comparez les tâches réellement achevées
Faites passer les mêmes types d’appels par le parcours actuel et par le nouveau. Comparez les achèvements vérifiés, les abandons, la charge liée aux escalades, les actions en double et le coût total par tâche menée à terme. Ne revendiquez une économie qu’après rapprochement de ces enregistrements.
Les limites à regarder en face
Le modèle peut combler un silence. Il ne peut ni accélérer un agenda lent, ni réparer une mauvaise connexion téléphonique, ni décider de ce que votre entreprise considère comme terminé.
Les sessions audio uniquement sont limitées à 15 minutes, sauf à mettre en place des techniques de gestion de session pour prolonger la conversation. La limite de contexte de l’audio natif est de 128,000 tokens. Le coût des appels longs et riches en échanges s’écarte aussi d’une simple estimation fondée sur la durée, car l’ancien contexte peut être traité à nouveau.
La sécurité reste du ressort de votre application. Un navigateur qui se connecte directement doit utiliser des tokens éphémères, et non une clé API standard. Une réservation, un remboursement ou une modification de compte exige toujours une authentification, une validation, de l’idempotence et une piste d’audit.
Le parcours asynchrone ajoute un risque de production : le travail obsolète. Si l’appelant modifie sa demande pendant l’exécution d’un outil, l’ancien résultat peut arriver plus tard. Suivez explicitement l’état de la tâche et rejetez tout résultat qui ne correspond plus à l’intention en cours.
À faire lundi : instrumenter une seule file d’appels
Agissez cette semaine si l’attente silencieuse des outils pousse les appelants à se répéter, à abandonner une réservation ou à imposer une reprise manuelle. Réservez Gemini 3.8 Live aux recherches directes et Extended Thinking à un workflow réellement composé de plusieurs étapes. Faites passer les deux par le même registre d’achèvement.
Attendez si vous ne pouvez pas encore prouver l’achèvement dans votre propre système, si le parcours opérateur n’est pas stabilisé ou si le workflow comporte une action irréversible sans étape de confirmation. Il vous faut d’abord une trace fiable, pas un nouveau modèle.
Cette sortie ne change rien pour les produits exclusivement textuels, les parcours vocaux dont les outils répondent déjà immédiatement ou les agents téléphoniques qui atteignent déjà leurs objectifs de finalisation, d’escalade et de coût. Un nouveau modèle ne justifie pas de remplacer un système dont les résultats sont mesurés.
Pour recevoir d’autres analyses claires sur les évolutions qui changent les coûts d’exploitation et les workflows, inscrivez-vous à la newsletter.
- Dernière mise à jour
- 16 sept. 2026
- Catégorie
- Explained







