구글(Google)은 GPT-6 Astra와 Claude Fable 5.1이 아직 직접적인 비디오 입력을 지원하지 않는 상황에서, 네이티브 비디오 처리 지원이라는 두드러진 장점을 가진 Gemini 3.8 Flash를 출시했습니다.

이 모델은 텍스트, 이미지, 비디오, 오디오, PDF를 포함한 다양한 데이터 유형을 수용하며, 100만 토큰이 넘는 컨텍스트 윈도우를 갖추고 있습니다.

Gemini는 전체 비디오를 일괄적으로 처리하는 대신 분석해야 할 비디오 세그먼트, 프레임, 오디오, 대본을 스스로 결정하는 “에이전틱 비디오 이해(agentic video understanding)” 메커니즘을 사용합니다.

구글에 따르면 이 방식은 긴 비디오의 경우 토큰 소비량을 최대 88%까지 줄이면서도 결과물의 품질을 약 7% 향상시킵니다.

사용자는 특정 주제가 언급된 시점, 특정 순간 전후에 발생한 이벤트, 또는 특정 시간에 화면에 표시되는 콘텐츠와 같은 문맥 기반 질문을 할 수 있습니다.

GPT-6 Astra는 약 105만 토큰의 컨텍스트 윈도우를 가지고 있으나 텍스트와 이미지마저 지원할 뿐 오디오 및 비디오 입력은 지원하지 않습니다.

Claude Fable 5.1 역시 100만 토큰의 컨텍스트 윈도우를 가지며 이미지 이해를 지원하지만, 비디오를 분석하려면 다른 도구를 사용하여 프레임이나 대본을 추출해야 합니다.

Gemini 3.8 Flash는 오디오도 직접 처리하여 이미지, 음성, 타임스탬프를 하나의 작업으로 결합하므로 강의, 회의, 장편 비디오 분석에 적합합니다.

📌 Gemini 3.8 Flash는 단일 멀티모달(Multimodal) 모델 내에서 비디오와 오디오를 직접 이해하는 능력으로 차별화됩니다. 분석할 콘텐츠 부분을 자동으로 선택함으로써 토큰을 최대 88%까지 줄이면서도 구글에 따르면 품질은 약 7% 향상시킵니다. GPT-6 Astra와 Claude Fable 5.1이 여전히 추론 및 에이전트(Agent) 분야에서 강력하지만, Gemini는 현재 비디오, 녹화, 강의 및 멀티미디어 콘텐츠 관련 애플리케이션에서 명백한 우위를 점하고 있습니다.

Share.
VIET NAM CONSULTING AND MEASUREMENT JOINT STOCK COMPANY
연락처

이메일: info@vietmetric.vn
주소: 베트남 하노이시 옌호아 동 쩐주이흥 거리 91번 골목 34번

© 2026 Vietmetric
Exit mobile version