Gemini führt agentisches Videoverständnis ein: bis zu 88 % weniger Tokens, 66 % geringere Kosten

Published · AI Daily — AI-assisted deep research, methodology & disclosure

Google DeepMind führt agentisches Videoverständnis für Gemini 3.7 Flash, 3.6 Flash und 3.5 Flash-Lite ein. Statt Video mit fester Bildrate aufzunehmen, sucht, scannt und prüft das Modell in einer agentischen Schleife relevante Abschnitte in Bildern, Audio und Transkripten. Laut Google sinken Tokens um bis zu 88 % und Kosten um bis zu 66 %, die Genauigkeit steigt um bis zu 7 % bei Standard-Benchmarks. Am stärksten sind die Gewinne bei langen Videos. Aktiviert wird die Funktion über die API-Einstellung »agentic« in Google AI Studio oder der Gemini Enterprise Agent Platform.

Google DeepMind hat agentisches Videoverständnis für Gemini eingeführt. Die Funktion steht für drei Modelle bereit: Gemini 3.7 Flash, Gemini 3.6 Flash und Gemini 3.5 Flash-Lite. Der Beitrag stammt von Rohan Doshi, Senior Product Manager, und Mario Lučić, Research Director. Er nennt drei Kernzahlen. Bei gängigen Benchmarks zur Videoanalyse senkt die Funktion den Token-Verbrauch um bis zu 88 %, die Analysekosten um bis zu 66 % und steigert die Genauigkeit um bis zu 7 %. Das sind Höchstwerte, keine Durchschnitte. Das echte Ergebnis hängt von Videolänge und Aufgabentyp ab. Um die Bedeutung zu verstehen, hilft ein Blick auf das bisherige Verfahren. Bei der sogenannten statischen Verarbeitung nimmt das Modell das Video mit einer festen Bildrate auf. Der Standard liegt bei 1 Bild pro Sekunde und lässt sich per API ändern. Das ist einfach, hat aber zwei Nachteile. Erstens wächst der Token-Verbrauch mit der Videolänge: Ein Vortrag von 90 Minuten oder eine mehrstündige Aufnahme ist teuer. Zweitens müssen Entwickler wählen zwischen hohen Token-Kosten und Abkürzungen wie dem Weglassen von Bildern, dem Kürzen oder dem Zusammenfassen, die wichtige Details kosten können. Google sagt, dieser Zielkonflikt sei bei langen Videos am schärfsten, von zehnminütigen Anleitungen über 90-minütige Vorlesungen bis zu mehrstündigen Aufnahmen. Genau dort hilft die neue Funktion am meisten.

Der Mechanismus ändert die Rolle des Modells. Statt jedes Bild passiv zu empfangen, verbindet Gemini sein grundlegendes Schlussfolgern mit nativen Videowerkzeugen. Es kann gezielte Abschnitte suchen, abtasten und prüfen, und zwar über drei Signalarten: Bilder, Audio und Transkripte. Das Modell entscheidet, was es ansieht, in welchem Tempo und über welche Modalität. Es holt nur die Momente und Signale, die es braucht. Google beschreibt das als agentische Schleife: Gemini ruft ein internes Werkzeug auf, lädt den relevanten Teil der Videodatei, bewertet das Ergebnis und entscheidet über den nächsten Schritt. Entwickler konnten Ähnliches zuvor von Hand bauen, etwa mit eigenem Code für Zerlegung, Transkription und Suche. Jetzt läuft die Schleife im Modell, was den Entwicklungsaufwand senkt. Die Idee knüpft an agentisches Sehen (agentic vision) an, eine frühere Funktion, die Codeausführung mit dem nativen Bildverständnis der Gemini-Modelle verbindet. Die neue Funktion überträgt dasselbe Muster auf Video. Google nennt neue Fähigkeiten: das Auffinden von Momenten im Sub-Sekunden-Bereich, genauere Erkennung von Anomalien und präzises Zählen. Diese Aufgaben haben etwas gemeinsam. Die Antwort steckt oft in wenigen kurzen Augenblicken, die eine gleichmäßige Abtastung mit 1 Bild pro Sekunde verpassen kann. Ein Modell, das zurückgehen, langsamer werden und noch einmal hinsehen kann, findet sie eher. Zur Leistung sagt Google, die Verbesserungen gälten für alle drei unterstützten Modelle. Hervorgehoben wird Gemini 3.7 Flash mit agentischem Verständnis: Es biete die beste Gesamtqualität und die beste Kombination aus Qualität und Kosten. In Googles Diagramm liegt es auf der Pareto-Grenze von Genauigkeit zu Kosten unter den getesteten Modellen. Einfach gesagt: Im getesteten Feld erreicht keine andere Konfiguration höhere Genauigkeit bei niedrigeren Kosten. Eine Einschränkung gilt. Die Ergebnisse stammen aus Standard-Benchmarks, die Google ausgewählt hat. Der von uns gesichtete Quelltext nennt die einzelnen Benchmarks nicht und liefert keine detaillierten Tabellen. Teams sollten deshalb mit eigenen Videos testen, bevor sie den Schlagzeilenwerten trauen.

Der Zugang ist einfach. Die Funktion unterstützt hochgeladene Videos und YouTube-Videos, über die Gemini API in Google AI Studio und in der Gemini Enterprise Agent Platform. Laut Googles Zusammenfassung genügt es, die API-Konfiguration auf »agentic« zu setzen. Das ist ein kleiner Schalter, und bestehende Videopipelines sollten sich ohne Neuschreiben weiterverwenden lassen. Für Entwickler und Unternehmen fallen drei Effekte auf. Der erste betrifft die Kostenstruktur. Die Analyse langer Videos ließ sich wegen der Token-Rechnung oft schwer skalieren, zum Beispiel bei der Sichtung von Sicherheitsaufnahmen, bei Zusammenfassungen von Meetings und Kursen, bei der Suche in Medienarchiven und bei stichprobenartigen Compliance-Prüfungen. Eine Kostensenkung von bis zu 66 % kann einige dieser Fälle tragfähig machen. Der zweite Effekt betrifft den Engineering-Aufwand. Bildauswahl, Segmentierung, Abgleich von Transkripten und Suchlogik, die Teams selbst gebaut haben, können in die Werkzeugschleife des Modells wandern. Der dritte: Qualität und Kosten stehen nicht mehr zwingend im Widerspruch. Die Genauigkeit steigt, während die Kosten sinken, was für den Produktivbetrieb attraktiv ist.

Offene Fragen bleiben. Eine agentische Schleife bedeutet mehrere Modellschritte pro Anfrage. Der Quelltext enthält keine Latenzdaten, daher müssen Teams Antwortzeit und Stabilität von Lauf zu Lauf selbst messen. Weil das Modell entscheidet, wohin es schaut, kann es in seltenen Fällen einen entscheidenden Abschnitt überspringen. Bei Anwendungen mit hohem Risiko, etwa Sicherheitsüberwachung oder medizinischer Bildgebung, bleiben menschliche Kontrolle und Stichproben nötig. Google hat auch nicht gesagt, ob weitere Modelle oder Eingabequellen folgen. Mit Blick nach vorn zeigt die Veröffentlichung, wohin der multimodale Wettbewerb geht. Es geht weniger darum, wie viel Video ein Modell fassen kann, sondern wie klug es hinsieht. Ein größeres Kontextfenster macht die Eingabe aller Einzelbilder nicht billig. Das Modell erst überfliegen, dann lokalisieren und dann genau prüfen zu lassen, ähnelt eher dem Vorgehen von Menschen bei Aufnahmen. Wir erwarten, dass andere Anbieter ähnliche Funktionen zur aktiven Suche bringen. Die Aufmerksamkeit der Entwickler dürfte sich von Vorverarbeitungspipelines zu Bewertung und Kostenüberwachung verschieben.

Ein praktischer Rat: Wählen Sie repräsentative Videos, teilen Sie sie in kurze und lange Clips und lassen Sie jeden mit statischer und agentischer Einstellung laufen. Erfassen Sie Tokens, Gesamtkosten und Genauigkeit je Aufgabe. Google nennt die größten Gewinne bei langen Videos, bei kurzen Clips fallen sie vermutlich kleiner aus. Entscheiden Sie erst nach diesem Vergleich über die Umstellung.

Sources