- Google ra mắt Gemini 3.8 Flash với lợi thế nổi bật là hỗ trợ xử lý video gốc, trong khi GPT-6 Astra và Claude Fable 5.1 chưa hỗ trợ đầu vào video trực tiếp.
- Mô hình chấp nhận nhiều loại dữ liệu gồm văn bản, hình ảnh, video, âm thanh và PDF, cùng cửa sổ ngữ cảnh hơn 1 triệu token.
- Gemini sử dụng cơ chế “agentic video understanding”, tự quyết định đoạn video, khung hình, âm thanh và bản chép lời cần phân tích thay vì xử lý toàn bộ video theo cùng một cách.
- Google cho biết phương pháp này giảm tới 88% lượng token tiêu thụ đối với video dài, đồng thời tăng khoảng 7% chất lượng kết quả.
- Người dùng có thể hỏi các câu hỏi theo ngữ cảnh như thời điểm một chủ đề được nhắc đến, sự kiện xảy ra trước hoặc sau một khoảnh khắc cụ thể, hoặc nội dung hiển thị trên màn hình tại từng thời điểm.
- GPT-6 Astra có cửa sổ ngữ cảnh khoảng 1,05 triệu token nhưng chỉ hỗ trợ văn bản và hình ảnh, không hỗ trợ đầu vào âm thanh và video.
- Claude Fable 5.1 cũng có cửa sổ ngữ cảnh 1 triệu token, hỗ trợ hiểu hình ảnh nhưng muốn phân tích video phải trích xuất khung hình hoặc bản chép lời bằng công cụ khác.
- Gemini 3.8 Flash còn xử lý trực tiếp âm thanh, kết hợp hình ảnh, lời nói và mốc thời gian trong cùng một tác vụ, phù hợp phân tích bài giảng, cuộc họp và video dài.
📌 Gemini 3.8 Flash tạo khác biệt nhờ khả năng hiểu video và âm thanh trực tiếp trong một mô hình Multimodal duy nhất. Việc tự động lựa chọn phần nội dung cần phân tích giúp giảm tới 88% token nhưng vẫn cải thiện khoảng 7% chất lượng theo Google. Dù GPT-6 Astra và Claude Fable 5.1 vẫn mạnh ở suy luận và Agent, Gemini hiện có lợi thế rõ rệt trong các ứng dụng liên quan đến video, ghi hình, bài giảng và nội dung đa phương tiện.
Tổng hợp
