Google Gemini reduziert den Tokenverbrauch bei der Videoanalyse um bis zu 88%

By: www.diariobitcoin.com|2026/09/02 15:09:29

**Google hat agentenbasiertes Video-Analysen in mehrere Gemini Flash-Modelle integriert. Das Tool wählt autonom relevante Szenen, Frames, Audio oder Transkriptionen aus und kann laut dem Unternehmen den Tokenverbrauch um bis zu 88% reduzieren, während es die Genauigkeit bei bestimmten Bewertungen leicht verbessert.


Die Modelle Gemini 3.7 Flash, 3.6 Flash und 3.5 Flash-Lite können Segmente von weniger als einer Sekunde analysieren, einschließlich Statusänderungen und Schnitte, die bei einer herkömmlichen Abtastung von einem Frame pro Sekunde möglicherweise verloren gehen. Diese Fähigkeit ist relevant für die automatisierte Bearbeitung, bei der ein kurzer Übergang oder eine sofortige Änderung die Bedeutung einer Szene verändern kann.

Das System kann auch spezifische Momente in Stunden von Aufnahmen lokalisieren, ohne während des Prozesses Millionen von Tokens zu verbrauchen. Dazu identifiziert es potenziell relevante Zeitfenster und sampelt sie mit einer höheren Bildrate, wenn es eine Anomalie oder ein Signal erkennt, das eine höhere zeitliche Auflösung erfordert.

Neben der Auffindung von Szenen kann Gemini wiederholte Bewegungen und einzelne Objekte im Zeitverlauf zählen. Das Tool beschränkt sich nicht nur auf die Beobachtung von Bildern, da es Frames, Audio und Transkriptionen je nach Art der Aufgabe, die der Entwickler ihm gestellt hat, kombiniert.

Google behauptet, dass diese autonome Auswahl es dem Modell ermöglicht, seine Ressourcen auf die Momente und Signale zu konzentrieren, die wirklich wichtig sind. Das Ergebnis ist ein weniger starrer Analysefluss, in dem die künstliche Intelligenz entscheidet, was zu untersuchen ist, mit welcher Geschwindigkeit und in welcher Modalität, bevor sie eine Antwort liefert.

Bis jetzt verwendete Gemini eine statische Verarbeitung, die standardmäßig das Video mit einem Frame pro Sekunde abtastete, obwohl die Entwickler diese Einstellung über die API anpassen konnten. Seit der Einführung der nativen Videoanalyse im Jahr 2025 kombinierte das System die Untersuchung der Frames mit der Transkription des Audiospuren.

Der agentenbasierte Ansatz verbindet das Denken des Modells direkt mit den nativen Video-Tools. Laut Google kann Gemini einen Suchzyklus starten, einen bestimmten Teil der Datei abrufen, das Ergebnis beobachten und entscheiden, ob es ein anderes Segment konsultieren, die Abtastgeschwindigkeit erhöhen oder die Modalität ändern muss.

Die Effizienzvorteile sind bei langen Materialien am sichtbarsten, die von 10-minütigen Tutorials bis hin zu 90-minütigen Vorträgen und mehreren Stunden langen Dateien reichen können. Mit der statischen Methode mussten die Entwickler zwischen einem hohen Tokenverbrauch oder der Verwendung eigener selektiver Techniken wählen, die relevante Details ausschließen konnten.

Google gibt an, dass ihre Ergebnisse in 1H-VideoQA und LVBench einen Rückgang von 88% im Tokenverbrauch zeigen, begleitet von einem leichten Anstieg der Genauigkeit. In der 1H-VideoQA-Bewertung des Unternehmens erreicht Gemini 3.7 Flash mit agentenbasierter Analyse die höchste Genauigkeit bei den geringsten Kosten pro Anfrage, gemäß den von der Firma präsentierten Daten.

Das Unternehmen hat auch LongVideoBench in die Tests einbezogen, die verwendet wurden, um die Leistung der Modelle zu vergleichen. In diesem Bewertungsset beschreibt Google Gemini 3.7 Flash als die Alternative mit der besten Gesamtqualität und der besten Kombination aus Genauigkeit und Kosteneffizienz.

Diese Ergebnisse sind Behauptungen von Google und spiegeln ihre eigenen Benchmarks wider, weshalb sie nicht allein eine unabhängige Validierung aller Nutzungsszenarien darstellen. Dennoch kann die potenzielle Einsparung für Anwendungen, die große audiovisuelle Bibliotheken verarbeiten, relevant sein, insbesondere wenn jede Anfrage erfordert, einen bestimmten Moment zu suchen und nicht das gesamte Video zu beschreiben.

Die agentenbasierte Analyse ist bereits für hochgeladene Videos und YouTube-Videos über die Gemini-API in Google AI Studio und auf der Gemini Enterprise Agent Platform aktiv. Entwickler müssen den Verarbeitungsmodus in der API als "agentisch" konfigurieren, um das selektive Verhalten zu aktivieren.

Google plant, die Technologie zu einem späteren Zeitpunkt auf seine eigenen Produkte auszuweiten. Das Unternehmen hofft, sie bald allen Nutzern der Gemini-Anwendung zur Verfügung zu stellen, die Flash- und Flash Lite-Geräte verwenden, während es in den kommenden Monaten auch plant, sie in der Funktion "Ask YouTube" auf der Wiedergabeseite zu verwenden.

Dieser Inhalt wird nur zu allgemeinen Informationszwecken bereitgestellt und stellt keine finanzielle, Anlage-, Rechts- oder Steuerberatung dar. Alle erwähnten Ereignisse, Prämien, Online-Aktionen oder zugehörige Informationen sollten nicht als Empfehlung, Aufforderung oder Einladung zum Kauf, Verkauf, Handel oder anderweitigem Umgang mit Krypto-Assets betrachtet werden. Krypto-Assets sind sehr volatil und können zu Verlusten führen. Die Verfügbarkeit von WEEX Services, Produkten und zugehörigen Aktionen kann je nach Region unterschiedlich sein. Sie sind dafür verantwortlich sicherzustellen, dass Ihre Teilnahme mit geltenden lokalen Gesetzen und Vorschriften übereinstimmt.

Das könnte Ihnen auch gefallen

iconiconiconiconiconiconicon
Kundenservice:@weikecs
Geschäftliche Zusammenarbeit:@weikecs
Quant-Trading & MM:[email protected]
VIP-Programm:[email protected]