Gemini lance la compréhension vidéo agentique : jusqu'à 88 % de tokens en moins, 66 % de coût en moins
Google DeepMind lance la compréhension vidéo agentique pour Gemini 3.7 Flash, 3.6 Flash et 3.5 Flash-Lite. Au lieu d'ingérer la vidéo à cadence fixe, le modèle cherche, balaie et inspecte les segments utiles dans les images, l'audio et les transcriptions, au sein d'une boucle agentique. Google annonce jusqu'à 88 % de tokens en moins, jusqu'à 66 % de coût en moins et jusqu'à 7 % de précision en plus sur des benchmarks standard. Les gains sont les plus forts sur les vidéos longues. Il suffit de régler l'API sur « agentic » dans Google AI Studio ou la Gemini Enterprise Agent Platform.
Google DeepMind a lancé la compréhension vidéo agentique pour Gemini. La fonction est disponible sur trois modèles : Gemini 3.7 Flash, Gemini 3.6 Flash et Gemini 3.5 Flash-Lite. L'annonce est signée de Rohan Doshi, chef de produit senior, et de Mario Lučić, directeur de recherche. Elle repose sur trois chiffres. Sur des benchmarks standard d'analyse vidéo, la fonction réduit la consommation de tokens jusqu'à 88 %, le coût d'analyse jusqu'à 66 %, et améliore la précision jusqu'à 7 %. Ce sont des plafonds, pas des moyennes. Le résultat réel dépendra de la durée de la vidéo et du type de tâche. Pour comprendre l'enjeu, il faut regarder la méthode actuelle. Dans le traitement dit « statique », le modèle ingère la vidéo à une cadence fixe d'images par seconde. La valeur par défaut est de 1 image par seconde, réglable par l'API. C'est simple, mais cela coûte cher de deux façons. D'abord, la consommation de tokens croît avec la durée : une conférence de 90 minutes ou un enregistrement de plusieurs heures pèse lourd. Ensuite, le développeur doit choisir entre une facture élevée et des raccourcis, comme la suppression d'images, la troncature ou le résumé, qui peuvent faire perdre des détails décisifs. Google indique que ce dilemme est le plus net sur les vidéos longues, des tutoriels de 10 minutes aux conférences de 90 minutes et aux enregistrements de plusieurs heures. C'est aussi là que la nouvelle fonction apporte le plus.
Le mécanisme change le rôle du modèle. Au lieu de recevoir chaque image de façon passive, Gemini associe son raisonnement de base à des outils vidéo natifs. Il peut chercher, balayer et inspecter des segments ciblés à travers trois types de signaux : les images, l'audio et les transcriptions. Le modèle décide quoi regarder, à quelle vitesse et par quelle modalité. Il ne récupère que les moments et les signaux utiles. Google décrit cela comme une boucle agentique : Gemini appelle un outil interne pour charger la partie pertinente du fichier vidéo, observe le résultat, puis décide de la suite. Les développeurs pouvaient déjà construire un dispositif proche à la main, avec leur propre code de découpage, de transcription et de recherche. Désormais, la boucle s'exécute dans le modèle, ce qui réduit la charge de développement. L'idée prolonge la vision agentique (agentic vision), une fonction antérieure qui combine l'exécution de code et la compréhension d'image native des modèles Gemini. La nouvelle fonction applique le même schéma à la vidéo. Google cite de nouvelles capacités : la récupération de moments à la sous-seconde, une détection d'anomalies plus précise et un comptage exact. Ces tâches ont un point commun. La réponse tient souvent en quelques instants très courts, qu'un échantillonnage uniforme à 1 image par seconde peut manquer. Un modèle capable de revenir en arrière, de ralentir et de revoir la scène a plus de chances de les trouver. Sur les performances, Google affirme que les gains couvrent les trois modèles pris en charge. Il met en avant Gemini 3.7 Flash avec compréhension agentique, qui offre la meilleure qualité globale et le meilleur compromis entre qualité et coût. Sur le graphique de Google, il se situe sur la frontière de Pareto précision-coût parmi les modèles testés. Autrement dit, dans l'ensemble testé, aucune autre configuration n'atteint une précision plus haute pour un coût plus bas. Une réserve s'impose : ces résultats viennent de benchmarks standard choisis par Google. Le texte source que nous avons lu ne nomme pas chaque benchmark et ne fournit pas de tableaux détaillés. Il faut donc tester sur ses propres vidéos avant de se fier aux chiffres d'annonce.
L'accès est simple. La fonction prend en charge les vidéos téléversées et les vidéos YouTube, via l'API Gemini dans Google AI Studio et dans la Gemini Enterprise Agent Platform. Selon le résumé de Google, il suffit de régler la configuration de l'API sur « agentic ». Le changement est mineur et les pipelines vidéo existants ne devraient pas exiger de réécriture. Pour les développeurs et les entreprises, trois effets ressortent. Le premier touche la structure des coûts. L'analyse de vidéos longues était souvent difficile à étendre à cause des tokens : revue d'images de sécurité, synthèse de réunions et de cours, recherche dans des archives média, contrôles de conformité par échantillonnage. Une baisse de coût allant jusqu'à 66 % peut rendre certains de ces usages viables. Le deuxième effet touche l'effort d'ingénierie. La sélection d'images, la segmentation, l'alignement des transcriptions et la logique de recherche que les équipes construisaient elles-mêmes peuvent passer dans la boucle d'outils du modèle. Le troisième est que qualité et coût cessent de s'opposer : la précision monte pendant que le coût baisse, ce qui séduit pour la production.
Des questions restent ouvertes. Une boucle agentique implique plusieurs étapes du modèle par requête. Le texte source ne donne aucune donnée de latence : les équipes devront mesurer le temps de réponse et la stabilité d'une exécution à l'autre. Comme le modèle décide où regarder, il peut, dans de rares cas, sauter un segment clé. Pour les usages à fort enjeu, comme la surveillance de sécurité ou l'imagerie médicale, la relecture humaine et les contrôles par échantillon restent nécessaires. Google n'a pas non plus précisé si d'autres modèles ou d'autres sources d'entrée seront pris en charge. Pour l'avenir, cette annonce montre la direction de la concurrence multimodale. L'enjeu passe de la quantité de vidéo qu'un modèle peut contenir à l'intelligence avec laquelle il regarde. Une fenêtre de contexte plus grande ne rend pas bon marché l'envoi de toutes les images. Laisser le modèle parcourir, localiser puis inspecter de près ressemble davantage à la manière dont les gens travaillent sur des enregistrements. On peut s'attendre à ce que d'autres éditeurs proposent des fonctions de récupération active similaires. L'attention des développeurs ira probablement des pipelines de prétraitement vers l'évaluation et le suivi des coûts.
Conseil pratique : choisissez un jeu de vidéos représentatives, séparez les clips courts et longs, et exécutez chacun en mode statique puis agentique. Notez les tokens, le coût total et la précision par tâche. Google annonce les plus forts gains sur les vidéos longues : attendez-vous à des gains plus faibles sur les clips courts. Décidez de la migration après cette comparaison seulement.