谷歌推出Gemini 3.8 Flash,其显著优势在于支持原生视频处理,而GPT-6 Astra和Claude Fable 5.1目前尚不支持直接视频输入。

该模型接受多种数据类型,包括文本、图像、视频、音频和PDF,并拥有超过100万个token的上下文窗口。

Gemini采用“自主视频理解(agentic video understanding)”机制,自主决定需要分析哪些视频片段、帧、音频和转录文本,而不是以相同的方式处理整个视频。

谷歌表示,对于长视频,这种方法可将token消耗量减少高达88%,同时将结果质量提高约7%。

用户可以提出上下文相关的问题,例如某个主题被提及的时间、特定时刻之前或之后发生的事件、或任何给定时间内屏幕上显示的内容。

GPT-6 Astra拥有约105万个token的上下文窗口,但仅支持文本和图像,不支持音频和视频输入。

Claude Fable 5.1同样拥有100万个token的上下文窗口,支持图像理解,但如果要分析视频,则必须使用其他工具提取帧或转录文本。

Gemini 3.8 Flash还能直接处理音频,将图像、语音和时间戳结合在同一个任务中,非常适合分析讲座、会议和长视频。

📌 Gemini 3.8 Flash通过在单一的多模态(Multimodal)模型中直接理解视频和音频而脱颖而出。根据谷歌的数据,通过自动选择需要分析的内容部分,它不仅减少了高达88%的token消耗,还将质量提升了约7%。尽管GPT-6 Astra和Claude Fable 5.1在推理和Agent(智能体)方面依然强劲,但Gemini目前在视频、录像、讲座及多媒体内容相关的应用中具有明显的优势。

Share.
VIET NAM CONSULTING AND MEASUREMENT JOINT STOCK COMPANY
联系方式

电子邮件: info@vietmetric.vn
地址:河内市安和坊陈维兴街91巷34号

© 2026 Vietmetric
Exit mobile version