Google bringt Gemini 3.8 Flash mit dem herausragenden Vorteil auf den Markt, native Videoverarbeitung zu unterstützen, während GPT-6 Astra und Claude Fable 5.1 direkte Videoeingaben noch nicht unterstützen.
Das Modell akzeptiert verschiedene Datentypen wie Text, Bilder, Video, Audio und PDFs sowie ein Kontextfenster von über 1 Million Token.
Gemini verwendet einen Mechanismus des „agentischen Videoverständnisses“ (agentic video understanding) und entscheidet autonom, welche Videosegmente, Frames, Audiodaten und Transkripte analysiert werden müssen, anstatt das gesamte Video einheitlich zu verarbeiten.
Laut Google reduziert diese Methode den Token-Verbrauch bei langen Videos um bis zu 88 % und erhöht gleichzeitig die Ergebnisqualität um etwa 7 %.
Nutzer können kontextbezogene Fragen stellen, wie beispielsweise, wann ein Thema erwähnt wurde, welche Ereignisse vor oder nach einem bestimmten Moment stattfanden oder welcher Inhalt zu einem bestimmten Zeitpunkt auf dem Bildschirm angezeigt wird.
GPT-6 Astra verfügt über ein Kontextfenster von etwa 1,05 Millionen Token, unterstützt jedoch nur Text und Bilder und bietet keine Unterstützung für Audio- und Videoeingaben.
Claude Fable 5.1 verfügt ebenfalls über ein Kontextfenster von 1 Million Token und unterstützt Bildverständnis, erfordert jedoch das Extrahieren von Frames oder Transkripten mit einem anderen Tool, um Videos zu analysieren.
Gemini 3.8 Flash verarbeitet zudem Audio direkt und kombiniert Bilder, Sprache und Zeitstempel in einer einzigen Aufgabe, wodurch es sich ideal für die Analyse von Vorlesungen, Meetings und langen Videos eignet.
📌 Gemini 3.8 Flash hebt sich durch seine Fähigkeit ab, direkte Video- und Audiodaten in einem einzigen multimodalen Modell zu verstehen. Durch die automatische Auswahl der zu analysierenden Inhaltsabschnitte werden laut Google bis zu 88 % der Token eingespart und gleichzeitig die Qualität um etwa 7 % verbessert. Obwohl GPT-6 Astra und Claude Fable 5.1 bei Schlussfolgerungen (Reasoning) und Agents stark bleiben, hat Gemini derzeit einen klaren Vorteil bei Anwendungen im Zusammenhang mit Videos, Aufzeichnungen, Vorlesungen und Multimedia-Inhalten.
