Agent vocal IA : Gemini 3.8 Live passe aux outils asynchrones

Gemini 3.8 Live laisse un agent vocal IA parler pendant l’exécution des outils. Découvrez l’impact sur les réservations, le suivi client et les coûts.

Wednesday, September 16, 2026Omid Saffari
Agent vocal IA : Gemini 3.8 Live passe aux outils asynchrones

Le 15 septembre 2026, Google a rendu Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking disponibles de manière générale. Le changement concret tient en une phrase : un agent vocal IA peut continuer à informer son interlocuteur pendant que votre agenda, votre système de commandes ou votre API de réservation effectue en arrière-plan le travail qui prend du temps.

Pourquoi l’agent vocal IA ne doit plus suspendre l’appel

Un agent vocal remplit généralement deux missions à la fois. Il doit entretenir une conversation naturelle tout en réalisant une action concrète dans un autre système.

C’est cette seconde mission qui rend souvent les appels pénibles. L’agent interroge votre API de réservation pour trouver un créneau, attend la réponse et laisse l’appelant face au silence. Celui-ci répète alors sa demande, vérifie que quelqu’un est toujours en ligne ou raccroche. Et si l’application interprète cette répétition comme une nouvelle instruction, elle peut aussi lancer deux fois la même tâche.

Gemini 3.8 Live change ce fonctionnement grâce aux appels de fonction asynchrones. L’outil peut ainsi poursuivre son exécution sans figer toute la session en direct. Pendant que la recherche continue, l’appelant peut préciser sa demande, corriger un détail ou recevoir un point d’avancement.

Gemini 3.8 Live Extended Thinking va plus loin. Il peut raisonner sur une tâche en plusieurs étapes et donner de brèves nouvelles pendant l’exécution des outils. Dans l’exemple de Google, un parcours de réservation de voyage consulte plusieurs systèmes sans interrompre la conversation en direct.

Cela ne signifie pas que Gemini effectue lui-même une réservation. Votre application reçoit toujours l’appel de fonction, lance la recherche dans l’agenda ou le système de commandes, puis renvoie le résultat. Le modèle prend en charge la conversation qui entoure ce travail.

ChoixÀ utiliser quandComportement des outilsSignal de fin
gemini-3.8-liveLa tâche est directe et l’outil répond viteLe mode asynchrone est utilisé par défaut, mais le mode bloquant reste disponibleturnComplete: true clôt le tour
gemini-3.8-live-extended-thinkingLa tâche comporte plusieurs étapes ou l’outil met plusieurs secondes à répondreMode asynchrone uniquement, avec un niveau de réflexion low, medium ou highAttendre interaction_status: "IDLE"

La dernière colonne cache le principal piège en production. Avec Extended Thinking, turnComplete: true peut simplement indiquer qu’un point d’avancement oral vient de se terminer. La recherche, elle, est peut-être encore en cours. Fermer la session, activer le bouton de réservation ou déclarer la tâche terminée à ce moment-là créerait de faux statuts de fin.

Scène pédagogique en pâte à modeler montrant un appelant, une recherche en arrière-plan, un point d’avancement et un registre de tâches finalisées
Le workflow utile réunit une conversation en direct, une tâche en arrière-plan et une preuve vérifiable de sa finalisation.

Le bon indicateur : le coût par tâche menée à terme

Parler pendant une recherche n’entraîne pas automatiquement des économies. Cela peut ajouter de la sortie générée par le modèle pendant l’exécution d’un outil, tandis qu’une conversation plus longue peut accroître le volume de contexte retraité lors des tours suivants. Cette fonctionnalité n’a d’intérêt que si cette continuité se traduit par davantage de réservations finalisées, moins d’appels abandonnés ou moins de reprises manuelles.

Google affiche les mêmes tarifs standards pour les deux nouveaux modèles : l’entrée audio coûte $0.005 par minute et la sortie audio $0.018 par minute. L’entrée texte coûte $0.75 par 1 million de tokens, contre $4.50 par 1 million de tokens pour la sortie texte, tokens de réflexion compris.

Prenons un appel de réservation de cinq minutes durant lequel le modèle parle pendant deux minutes. Comme l’audio proactif est activé en permanence, le calcul audio de base donne $0.025 pour cinq minutes d’entrée, auxquels s’ajoutent $0.036 pour deux minutes de sortie. Soit un sous-total audio brut de $0.061.

Ce n’est pas le coût final de l’appel.

Le guide de facturation de la Live API précise qu’une session persistante peut retraiter le contexte accumulé lors des tours suivants. Les transcriptions ajoutent des frais liés aux tokens texte. Extended Thinking peut générer des tokens de réflexion supplémentaires. Votre agenda, votre CRM, votre opérateur téléphonique, l’hébergement, les nouvelles tentatives et le transfert vers un conseiller ne sont pas inclus dans le sous-total audio de Google.

Utilisez plutôt cette formule :

Coût par tâche menée à terme = ensemble des dépenses liées au modèle, aux outils, au téléphone, à l’infrastructure, aux nouvelles tentatives et aux escalades, divisé par le nombre de tâches dont l’achèvement est vérifié.

Une tâche achevée ne se résume pas à une transcription agréable. Pour une ligne de prise de rendez-vous, il faut qu’un identifiant de réservation soit enregistré une seule fois, relu correctement et accepté par l’appelant. Pour le suivi de commande, la bonne action doit être associée au bon compte. Pour un transfert, l’appel doit atteindre la file prévue avec tout son contexte.

Google renvoie régulièrement le total des tokens consommés dans usageMetadata. Reliez cet enregistrement à l’identifiant de l’appel d’outil, à la session de l’opérateur, au résultat métier final et à toute intervention humaine. Vous obtenez ainsi un registre par appel que vous pouvez auditer, plutôt qu’une estimation à la minute qu’il faudrait accepter sans preuve.

Les chiffres de lancement ne remplacent pas ce pilote. Google annonce 68.6% sur le benchmark de tâches tau-Voice et 35.1% sur sa déclinaison bancaire pour Extended Thinking. Ces scores indiquent que le modèle peut être évalué sur des tâches vocales agentiques. Ils ne disent pas quelle part de vos appelants finalisera une réservation dans votre agenda, avec vos règles et votre connexion téléphonique.

Quatre workflows où l’attente compte vraiment

Un cabinet dentaire qui prend un rendez-vous

Un responsable des opérations peut laisser l’agent recueillir le jour souhaité par l’appelant, lancer une recherche de disponibilité et préciser que la vérification continue pendant que l’agenda répond. Le bénéfice ne se limite pas à raccourcir le silence. Il se mesure au nombre de rendez-vous confirmés et à la baisse des rappels par le personnel.

La règle de sécurité est stricte : un point d’avancement oral ne vaut pas réservation. Le système ne doit créer le rendez-vous qu’après le choix d’un créneau retourné par l’outil, et les nouvelles tentatives doivent réutiliser une clé d’idempotence pour qu’un même appel ne puisse pas générer deux fois le même rendez-vous.

Une équipe e-commerce qui vérifie une commande

Le service client peut garder l’appelant dans la même conversation pendant que l’agent interroge le système de commandes. Si la demande passe de « où est mon colis ? » à « modifiez l’adresse de livraison », votre application doit considérer la plus récente comme active et annuler ou ignorer le travail devenu obsolète.

Le bénéfice attendu est une baisse des transferts sur les cas courants. Le risque, lui, consiste à fournir la bonne réponse à une ancienne question alors que l’appelant est déjà passé à autre chose.

Une équipe voyage qui gère un changement de réservation

La recherche de vols, la vérification des règles, la disponibilité des hôtels et la comparaison des tarifs rendent ce cas plus adapté à Extended Thinking. Le modèle peut annoncer sa progression pendant l’exécution de plusieurs fonctions non bloquantes.

Le paiement et les modifications de billets doivent rester soumis à une étape de confirmation. Une voix naturelle ne réduit pas le niveau d’approbation requis pour une action irréversible.

Un support technique qui diagnostique un problème de compte

Une consultation rapide du compte relève de Gemini 3.8 Live. Un diagnostic qui rassemble plusieurs journaux et vérifie une configuration peut justifier Extended Thinking.

Cette distinction compte, car un raisonnement plus poussé n’est pas gratuit. Orientez les appels selon la complexité de la tâche, puis comparez les taux de résolution et d’escalade. Inutile de faire passer chaque réinitialisation de mot de passe par le parcours le plus lourd simplement parce que le nom du modèle paraît plus rassurant.

Fiabilisez le cycle en arrière-plan avant de brancher la téléphonie

Commencez par une session déclenchée par du texte et un outil factice. Vous pourrez ainsi isoler le comportement asynchrone avant qu’un opérateur, un microphone, une passerelle audio et un agenda de production n’ajoutent quatre couches supplémentaires à déboguer.

L’exemple ci-dessous reprend le SDK Python actuel de Google, la configuration Extended Thinking, une déclaration de fonction non bloquante, le schéma de réponse de l’outil ainsi que les champs interaction_status et usageMetadata. Il enregistre l’audio 24 kHz renvoyé dans response.wav. Le résultat de l’outil est simulé localement : aucun agenda réel n’est sollicité.

Bash
pip install -U google-genai
export GEMINI_API_KEY="YOUR_API_KEY"
Python
import asyncio
import wave

from google import genai
from google.genai import types

client = genai.Client()
model = "gemini-3.8-live-extended-thinking"

check_availability = types.FunctionDeclaration(
    name="check_availability",
    description="Checks the calendar for the next available appointment.",
    behavior="NON_BLOCKING",
    parameters={
        "type": "OBJECT",
        "properties": {},
    },
)

config = types.LiveConnectConfig(
    response_modalities=["AUDIO"],
    thinking_config=types.ThinkingConfig(thinking_level="low"),
    tools=[types.Tool(function_declarations=[check_availability])],
)


async def main():
    async with client.aio.live.connect(model=model, config=config) as session:
        await session.send_client_content(
            turns={
                "parts": [
                    {"text": "Find the next available appointment and keep me updated."}
                ]
            }
        )

        with wave.open("response.wav", "wb") as audio:
            audio.setnchannels(1)
            audio.setsampwidth(2)
            audio.setframerate(24000)

            async for message in session.receive():
                status = getattr(message, "interaction_status", None)

                if message.data is not None:
                    audio.writeframes(message.data)

                if message.usage_metadata:
                    print("Tokens:", message.usage_metadata.total_token_count)

                if message.tool_call:
                    replies = []
                    for call in message.tool_call.function_calls:
                        replies.append(
                            types.FunctionResponse(
                                id=call.id,
                                name=call.name,
                                response={"result": "Tuesday morning is available."},
                            )
                        )
                    await session.send_tool_response(function_responses=replies)

                if status == "IDLE":
                    print("Interaction complete")
                    break


if __name__ == "__main__":
    asyncio.run(main())

L’erreur la plus probable consiste à interrompre la boucle au premier turnComplete. Extended Thinking peut avoir annoncé « je vérifie » alors que l’outil n’a pas encore répondu. Continuez à écouter jusqu’à ce que interaction_status passe à IDLE, et conservez l’identifiant de l’appel d’outil avec le résultat métier obtenu ensuite.

Pour un agent téléphonique en production, n’ajoutez la passerelle audio qu’une fois cette boucle fiable. Le comparatif plus large des coûts des agents vocaux aide à choisir l’opérateur et les couches d’orchestration autour du modèle. Et pour comparer la facturation par tokens de Google à un tarif vocal frontal plus simple, le détail du coût d’un appel avec GPT-Live-1 montre pourquoi le dénominateur doit rester la tâche menée à terme dans les deux cas.

Pilotez avec un registre, pas avec une démo

  1. Choisissez un seul événement d’achèvement

    Partez d’un workflow étroit, par exemple un rendez-vous confirmé. Définissez précisément l’événement de base de données qui prouve son achèvement, puis nommez chaque état correspondant à un échec, un abandon, un doublon ou un transfert vers un conseiller.

  2. Journalisez tout le cycle de la session

    Conservez l’identifiant de session, chaque identifiant d’appel d’outil, les changements d’interaction_status, les heures de début et de fin des outils ainsi que usageMetadata. Une phrase destinée à meubler l’attente signale une progression, pas un achèvement.

  3. Rattachez chaque poste facturé

    Associez au même enregistrement d’appel l’usage de Gemini, les frais d’agenda ou de CRM, les coûts de l’opérateur, l’infrastructure, les nouvelles tentatives et le temps du personnel. Ne comparez pas le sous-total audio indicatif de $0.061 chez Google à la facture tout compris de votre solution actuelle.

  4. Testez les scénarios d’échec

    Interrompez l’agent, changez la date demandée pendant une recherche, provoquez un délai d’expiration de l’outil, ne renvoyez aucune disponibilité, puis raccrochez avant le résultat. Vérifiez qu’un appel d’outil devenu obsolète ne peut jamais enregistrer une réservation.

  5. Comparez les tâches réellement achevées

    Faites passer les mêmes types d’appels par le parcours actuel et par le nouveau. Comparez les achèvements vérifiés, les abandons, la charge liée aux escalades, les actions en double et le coût total par tâche menée à terme. Ne revendiquez une économie qu’après rapprochement de ces enregistrements.

Les limites à regarder en face

Le modèle peut combler un silence. Il ne peut ni accélérer un agenda lent, ni réparer une mauvaise connexion téléphonique, ni décider de ce que votre entreprise considère comme terminé.

Les sessions audio uniquement sont limitées à 15 minutes, sauf à mettre en place des techniques de gestion de session pour prolonger la conversation. La limite de contexte de l’audio natif est de 128,000 tokens. Le coût des appels longs et riches en échanges s’écarte aussi d’une simple estimation fondée sur la durée, car l’ancien contexte peut être traité à nouveau.

La sécurité reste du ressort de votre application. Un navigateur qui se connecte directement doit utiliser des tokens éphémères, et non une clé API standard. Une réservation, un remboursement ou une modification de compte exige toujours une authentification, une validation, de l’idempotence et une piste d’audit.

Le parcours asynchrone ajoute un risque de production : le travail obsolète. Si l’appelant modifie sa demande pendant l’exécution d’un outil, l’ancien résultat peut arriver plus tard. Suivez explicitement l’état de la tâche et rejetez tout résultat qui ne correspond plus à l’intention en cours.

À faire lundi : instrumenter une seule file d’appels

Agissez cette semaine si l’attente silencieuse des outils pousse les appelants à se répéter, à abandonner une réservation ou à imposer une reprise manuelle. Réservez Gemini 3.8 Live aux recherches directes et Extended Thinking à un workflow réellement composé de plusieurs étapes. Faites passer les deux par le même registre d’achèvement.

Attendez si vous ne pouvez pas encore prouver l’achèvement dans votre propre système, si le parcours opérateur n’est pas stabilisé ou si le workflow comporte une action irréversible sans étape de confirmation. Il vous faut d’abord une trace fiable, pas un nouveau modèle.

Cette sortie ne change rien pour les produits exclusivement textuels, les parcours vocaux dont les outils répondent déjà immédiatement ou les agents téléphoniques qui atteignent déjà leurs objectifs de finalisation, d’escalade et de coût. Un nouveau modèle ne justifie pas de remplacer un système dont les résultats sont mesurés.

Pour recevoir d’autres analyses claires sur les évolutions qui changent les coûts d’exploitation et les workflows, inscrivez-vous à la newsletter.

Dernière mise à jour
16 sept. 2026
Catégorie
Explained

Préférez ce site dans Google

Ajouter omidsaffari.com comme source préférée dans la recherche Google

Marquez omidsaffari.com comme source préférée et Google le met en avant pour vous dans Top Stories, AI Overviews et AI Mode.

Cloudflare Worker : cloisonner les droits de déploiement par client

Cloudflare Worker : cloisonner les droits de déploiement par client

Cloudflare permet de limiter un token de déploiement à un seul Worker et de séparer diagnostic, revue de code et mise en production pour chaque client.15 sept. 2026Explained
Claude Code peut limiter l’accès réseau à une seule commande

Claude Code peut limiter l’accès réseau à une seule commande

Claude Code peut désormais limiter l’accès réseau à une seule commande en mode auto sandboxé, pour installer des dépendances sans élargir toute la session.15 sept. 2026Explained
Abonnement Claude Code : qui paie avec Vercel AI SDK ?

Abonnement Claude Code : qui paie avec Vercel AI SDK ?

Vercel AI SDK peut imputer les agents à un abonnement Claude Code ou ChatGPT existant. Comprenez l’ordre des identifiants, les coûts et les limites.15 sept. 2026Explained
Cloudflare Browser Run : des sessions client limitées aux domaines approuvés

Cloudflare Browser Run : des sessions client limitées aux domaines approuvés

Cloudflare Browser Run limite les sessions aux domaines approuvés et ajoute une Live View en lecture seule pour mieux encadrer la validation côté client.14 sept. 2026Explained
Agent vocal IA : le vrai coût d’un appel avec GPT-Live-1

Agent vocal IA : le vrai coût d’un appel avec GPT-Live-1

GPT-Live-1 facture la voix $0.05 par minute, mais le budget réel inclut aussi le backend et le transport téléphonique. Voici comment le calculer.14 sept. 2026Explained
ChatGPT Windows : ce qu’Appshots change dans vos workflows

ChatGPT Windows : ce qu’Appshots change dans vos workflows

ChatGPT Windows reçoit Appshots pour joindre une fenêtre en un raccourci. Voici comment gagner du temps tout en maîtrisant le contexte réellement partagé.14 sept. 2026Explained
Vercel Functions : les fichiers statiques FastAPI passent au CDN

Vercel Functions : les fichiers statiques FastAPI passent au CDN

Les fichiers statiques FastAPI éligibles passent par le CDN de Vercel : moins d’invocations de Vercel Functions, sans supprimer les coûts de transfert.13 sept. 2026Explained
Clé API OpenAI : anticiper l’expiration sans coupure

Clé API OpenAI : anticiper l’expiration sans coupure

Une clé API OpenAI peut désormais expirer. Voici comment budgéter sa rotation, déployer sa remplaçante et vérifier vos agents avant toute coupure.13 sept. 2026Explained
Newsletter

Une lettre, chaque dimanche.Des systèmes qui tournent, pas des hot takes.

Hebdomadaire. Pas de spam. Désabonnement à tout moment.