Gemini vidéo passe au mode agentique : ce que valent vraiment les 88% de tokens en moins
Gemini vidéo adopte une analyse agentique qui cible transcription, images et audio. Voici quand la baisse annoncée de 88% des tokens tient vraiment.

Le 1er septembre 2026, Google a changé la façon dont l’API Gemini analyse les vidéos longues. Avec Gemini vidéo en mode agentique, le modèle ne charge plus toute la timeline à cadence fixe : il n’examine que la transcription, les images ou l’audio utiles à la question. Google annonce jusqu’à 88% de tokens en moins sur les vidéos longues, mais il s’agit d’un plafond, pas d’une remise automatique sur chaque facture.
Gemini vidéo agentique : de quoi parle-t-on vraiment ?
Jusqu’ici, le fonctionnement par défaut reposait sur un traitement statique. Gemini extrait une image par seconde, traite l’audio, place l’ensemble dans la fenêtre de contexte, puis répond en un seul passage. Cette méthode est prévisible : le modèle parcourt la timeline selon un échantillonnage fixe, que la question exige ou non d’en voir l’intégralité.
La nouvelle option introduit un traitement agentique. Le modèle commence par déterminer les éléments dont il a besoin. Il peut demander un passage de la transcription, charger les images d’un moment pertinent, examiner l’audio, puis recommencer cette boucle avant de formuler sa réponse. Autrement dit, Gemini cherche désormais dans la vidéo avant de répondre à son sujet.
Imaginez un documentaliste face à des archives vidéo. En mode statique, tous les films défilent devant son bureau. En mode agentique, il consulte d’abord le catalogue, sort la bobine la plus probable, vérifie la scène précise et ne revient chercher un autre extrait que si le premier ne suffit pas.
La fonction est disponible sur gemini-3.7-flash, gemini-3.6-flash et gemini-3.5-flash-lite. Elle fonctionne avec l’Interactions API comme avec la GenerateContent API. Google recommande l’Interactions API ; c’est donc celle utilisée ci-dessous, car sa réponse rend visibles les étapes de traitement du modèle.

Deux nouveaux types d’étapes rendent cette boucle possible. Une étape processing_call signifie que le modèle a demandé un autre segment vidéo ou un passage de la transcription. L’étape processing_result correspondante contient le résultat obtenu. Si ces deux types apparaissent dans interaction.steps, la navigation agentique a bien été exécutée. Une application peut les afficher comme indicateurs de progression, sans avoir à y répondre comme elle le ferait pour un appel de fonction personnalisé.
Une limite doit être claire : il s’agit de compréhension vidéo, pas de génération vidéo. Ces trois modèles reçoivent une vidéo et renvoient du texte. Pour créer ou modifier une vidéo, il faut passer par le workflow distinct de Gemini Omni Flash.
Pourquoi les 88% changent la donne pour l’analyse vidéo IA
Avec le traitement statique, le coût d’une vidéo augmente de façon très mécanique. En basse résolution média, le guide estime la consommation à environ 100 tokens par seconde de vidéo. Une heure représente donc près de 360,000 tokens d’entrée avant même la réponse. Au tarif Standard actuel de Gemini 3.7 Flash ou 3.6 Flash, soit $0.75 pour 1 million de tokens d’entrée jusqu’au 31 décembre 2026, cet input coûte environ $0.27.
En appliquant la réduction maximale de 88% à ce budget d’entrée, on tombe à 43,200 tokens, soit environ $0.0324 au même tarif. Voilà le scénario le plus favorable : une question ciblée sur un long enregistrement n’oblige plus à placer chaque image échantillonnée dans le contexte.
Mais ce n’est pas toute la facture. L’exploration agentique génère des tokens de réflexion, facturés au tarif de sortie, ainsi que des tokens d’utilisation d’outils pour la transcription, l’audio et les images chargés. Le modèle peut aussi examiner davantage de contenu si la question est large ou si la vidéo est visuellement dense. Google annonce une qualité supérieure d’environ 7% sur les contenus longs, sans toutefois publier dans son guide le benchmark qui étaye ce chiffre.
Le choix du modèle change également le prix unitaire. Gemini 3.5 Flash-Lite coûte $0.30 pour 1 million de tokens d’entrée et $2.50 pour 1 million de tokens de sortie au tarif Standard. Gemini 3.7 Flash et 3.6 Flash coûtent $0.75 en entrée et $3.75 en sortie jusqu’à la fin de 2026 ; les deux tarifs prévus doubleront ensuite le 1er janvier 2027.
La vidéo agentique agit donc sur deux fronts. Elle permet de faire tenir une source plus longue dans le budget de contexte et de réduire le volume de contenu payant que le modèle doit examiner. Le gain maximal apparaît quand la source est longue et la question, précise.
Qui ne verra pas la différence ? Une équipe qui traite des clips produit de trente secondes a peu de chances d’obtenir le même bénéfice. Si un workflow connaît déjà les cinq minutes exactes à analyser, mieux vaut parfois découper ce passage et rester en mode statique. Quant aux utilisateurs de l’application Gemini, ils n’obtiennent aucun nouveau bouton : Google a livré un paramètre de traitement pour l’API, pas une commande grand public.
Qui peut en profiter dès demain ?
Une responsable formation face à des enregistrements d’une heure
Dans une grande entreprise, une responsable formation peut importer l’enregistrement d’un atelier et demander les principales procédures, les exemples associés à chacune, puis un quiz. Le mode agentique peut commencer par la transcription, récupérer des images lorsqu’une diapositive ou une démonstration physique compte, et ignorer les passages sans rapport avec la demande.
L’intérêt ne se limite pas à produire un résumé moins cher. La même source peut répondre à des questions ciblées comme « Qu’a dit la personne qui présentait au sujet de l’escalade ? », sans remplir d’abord la fenêtre de contexte avec chaque image.
Une responsable de recherche SaaS qui analyse des entretiens clients
Une responsable de recherche produit peut parcourir un entretien d’une heure pour retrouver chaque moment où le client évoque des difficultés d’onboarding, une tarification confuse ou un workflow manquant. La réponse peut inclure des horodatages afin de revenir à l’enregistrement d’origine avant de transformer la sortie du modèle en décision produit.
Le gain porte sur la vitesse d’analyse, sans sacrifier la traçabilité. Gemini resserre la sélection ; la personne chargée de la recherche vérifie toujours l’extrait qui soutient l’affirmation.
Une équipe d’exploitation média qui fouille ses archives
Une équipe média peut confier à Gemini un long webinaire, une réunion publique ou un entretien, puis lui demander à quel moment un sujet précis apparaît. C’est exactement le type de tâche pour lequel le mode agentique a été conçu : une vaste timeline et une recherche très ciblée.
Le passage au montage est plus rapide. Au lieu d’un résumé vague de l’ensemble du programme, la personne qui monte reçoit les moments probables et leurs horodatages.
Une ingénieure qualité qui trie des vidéos d’inspection
Une ingénieure qualité peut utiliser le mode agentique pour rechercher dans un long enregistrement caméra un événement donné, par exemple l’ouverture d’un carter de protection ou le changement d’un voyant d’alerte. Une fois l’intervalle suspect repéré par Gemini, elle peut traiter ce court passage en mode statique.
Cette seconde étape est importante. Le mode statique reste le bon outil lorsque chaque image échantillonnée compte, et Google prévient qu’un traitement à une image par seconde peut manquer une action rapide. Ce workflow utilise le mode agentique pour localiser la zone, puis le mode statique ou un système de vision dédié pour vérifier l’événement.
Un produit éducatif qui prolonge l’échange autour d’un cours
L’équipe qui développe un produit éducatif peut créer une interaction autour d’un cours, puis permettre à l’élève de poser des questions complémentaires avec previous_interaction_id. Le serveur conserve le contexte vidéo, ce qui évite de reconstruire toute la conversation à chaque tour.
On obtient ainsi une véritable séance d’étude plutôt qu’un résumé ponctuel. Attention toutefois à l’état : en fonctionnement stateless, le produit doit rejouer toutes les étapes de traitement renvoyées, sinon la réponse suivante perd le contexte vidéo.
Utiliser le mode agentique avec l’Interactions API
Pour une intégration proche des conditions de production, le chemin le plus court passe par le SDK Python officiel Google Gen AI et la Files API. Privilégiez la Files API pour une vidéo d’une durée significative, pour tout fichier que vous comptez interroger plusieurs fois et dès que la requête totale dépasse 20 MB.
Configurer la clé API et installer le SDK
Créez une clé API Gemini dans Google AI Studio, placez-la dans
GEMINI_API_KEY, puis installez la version actuelle du SDK :Bashexport GEMINI_API_KEY="YOUR_API_KEY" pip install -U google-genaiImporter la vidéo et demander le traitement agentique
Remplacez le chemin par celui d’une vidéo locale. Cet exemple reprend le workflow Python présenté dans le guide Google sur la vidéo agentique :
Pythonimport time from google import genai client = genai.Client() # Upload a long video video_file = client.files.upload(file="path/to/lecture.mp4") while video_file.state.name == "PROCESSING": time.sleep(2) video_file = client.files.get(name=video_file.name) # Use agentic processing interaction = client.interactions.create( model="gemini-3.7-flash", input=[ { "type": "video", "uri": video_file.uri, "mime_type": video_file.mime_type, "processing": "agentic" }, {"type": "text", "text": "What are the three main arguments presented?"} ] ) print(interaction.output_text)Vérifier le mode avant de valider le test
Inspectez
interaction.steps. Les entréesprocessing_calletprocessing_resultdoivent précéder lemodel_outputfinal. Si elles n’apparaissent pas, rien ne prouve que la requête a utilisé la navigation dynamique.Comparer les bonnes métriques
Testez les mêmes vidéos et les mêmes questions représentatives en modes statique et agentique. Comparez l’ensemble des tokens d’entrée, les tokens de réflexion, les tokens d’utilisation d’outils, le délai avant le premier token, la qualité de la réponse et le coût final. Les 88% constituent un maximum annoncé par le fournisseur. Seule votre combinaison de prompts dira si ce gain résiste aux conditions de production.
L’erreur la plus simple consiste à placer processing au niveau de la requête plutôt que dans l’objet vidéo. Ce paramètre doit se trouver à l’intérieur de l’input vidéo. Lorsqu’une requête contient plusieurs vidéos, chacune peut choisir son propre mode : un long cours peut être agentique tandis qu’un court extrait d’expérience reste statique.
L’ordre du prompt a aussi son importance. Pour une vidéo accompagnée de texte, Google recommande de placer la vidéo en premier et le prompt textuel ensuite, comme dans l’exemple.
Ce qu’il faut regarder en face
Le mode agentique remplace un balayage fixe par une boucle de recherche. Sur les clips de moins de cinq minutes, cette boucle peut légèrement allonger le délai avant le premier token : le modèle raisonne, demande du contenu et attend les résultats de ses outils internes avant de commencer sa réponse finale. Si le clip est court et que l’application privilégie la latence, le mode statique reste le choix le plus net.
Les réglages de découpage et de fréquence d’images constituent une autre limite stricte. start_offset, end_offset et une valeur fps personnalisée ne fonctionnent qu’en traitement statique. Si l’intervalle exact est déjà connu, découper une requête statique peut être plus simple et plus prévisible que de demander au modèle de le retrouver.
Les limites d’entrée exigent de la prudence, car le guide actuel de Google se contredit. Son tableau comparatif présente les données inline comme limitées à moins de 100 MB, tandis que la section détaillée fixe la requête totale à moins de 20 MB et demande explicitement d’utiliser la Files API au-delà de 20 MB. En attendant que Google harmonise la page, retenez le seuil prudent de 20 MB.
La Files API accepte des fichiers jusqu’à 20 GB sur les comptes payants et 2 GB sur les comptes gratuits. Les modèles dotés d’une fenêtre de contexte de 1,048,576 tokens peuvent traiter jusqu’à trois heures de vidéo en basse résolution ou une heure en haute résolution. Les URL YouTube publiques fonctionnent, contrairement aux vidéos privées et non répertoriées. L’offre gratuite plafonne également l’entrée YouTube à huit heures par jour.
Les échanges multi-tours cachent un piège en production. Les requêtes stateful qui utilisent previous_interaction_id conservent le contexte vidéo sur le serveur. Les requêtes stateless doivent renvoyer chaque étape processing_call et processing_result. Leur omission ne déclenche actuellement aucune erreur, mais Google indique que le contexte vidéo disparaît et que la qualité des réponses suivantes chute fortement. Rejouer ces étapes ajoute aussi des tokens d’entrée.
Enfin, retrouver une information ne revient pas à la vérifier. Dans ses propres consignes de sécurité, Google rappelle que les sorties du modèle peuvent être inexactes et juge indispensables le post-traitement et l’évaluation humaine. Pour les décisions médicales, juridiques, de sécurité, de conformité ou nécessitant une précision à l’image près, utilisez Gemini pour localiser les éléments, puis conservez une validation humaine ou un système déterministe dans le circuit d’approbation.
Que faire maintenant ?
Adoptez le mode agentique dès cette semaine si votre produit envoie de longs enregistrements à Gemini et pose des questions précises sur des moments, des sujets ou des arguments. Commencez avec Gemini 3.7 Flash si la qualité de réponse prime, puis testez Gemini 3.5 Flash-Lite lorsque le volume et le coût dominent.
Restez en mode statique si les clips sont courts, si la latence de démarrage compte, si vous avez besoin de découpage ou d’une fréquence d’images personnalisée, ou si la tâche exige un balayage uniforme de toute la timeline. La nouvelle option ne rend pas l’ancienne obsolète : elle ajoute une seconde stratégie de lecture.
Attendez si votre produit ne sait pas encore enregistrer séparément les différents champs d’usage ni comparer les réponses aux horodatages de la source. Sans ces preuves, impossible de savoir si la navigation agentique a réellement réduit les coûts ou simplement déplacé les tokens d’une catégorie à l’autre.
Vous n’êtes pas concerné si votre besoin porte sur la génération vidéo, une fonction grand public de Gemini ou une analyse déterministe image par image. Il s’agit de produits et de problèmes techniques différents.
Pour recevoir la prochaine évolution de plateforme sous la forme d’une décision directement applicable, inscrivez-vous à la newsletter.
2 sept. 2026






