• xAI는 수만 대의 엔비디아(Nvidia) GB300 GPU에서 학습되어 프로그래밍, 에이전트(Agent) 및 지식 기반 작업에 초점을 맞춘 ‘Grok 4.5’를 출시했습니다.
  • Terminal Bench 2.1에서 Grok 4.5는 83.3%를 기록하여 GPT 5.5의 83.4%와 거의 대등했으며, Fable 5의 84.3%보다는 약간 낮았습니다.
  • DeepSWE 1.1에서 Grok 4.5는 53%에 그쳐, 실제 GitHub 오류(Issue) 처리 능력에서 GPT 5.5의 67%, Fable 5의 70%보다 낮았습니다.
  • SWE Bench Pro에서 Grok 4.5는 64.7%를 기록해 GLM 5.2의 62.1%를 넘어섰으나, Opus 4.8의 69.2%와 Fable 5의 80.4%보다는 낮았습니다.
  • xAI는 해당 모델이 엄격한 데이터 필터링 프로세스를 거치고 중복 데이터를 제거했으며, 품질 향상을 위해 산업 분야별로 엄선된 데이터를 통해 학습되었다고 밝혔습니다.
  • 강화 학습 단계에서는 주로 소프트웨어 엔지니어링에 관한 수십만 개의 태스크가 활용되었으며, 자동 채점 시스템과 수 시간 동안 실행되는 에이전트를 위한 비동기 학습 인프라가 적용되었습니다.
  • Grok 4.5의 가격은 입력 토큰 100만 개당 2달러, 출력 토큰 100만 개당 6달러로 고성능 모델 군 중에서 가장 저렴합니다.
  • 반면 Opus 4.8은 5달러와 25달러, GPT 5.5 및 GPT 5.6은 5달러와 30달러이며, Fable 5는 입력 및 출력 100만 토큰당 각각 10달러와 50달러에 달합니다.
  • xAI는 Grok 4.5가 SWE Bench Pro 테스트에서 Opus 4.8보다 약 4.2배 적은 토큰을 사용하며, 초당 약 80개 토큰의 속도를 낸다고 전했습니다.
  • xAI의 전략은 지푸(Zhipu), 딥시크(DeepSeek)와 같은 중국 기업들과 유사합니다. 성능 격차를 좁힌 후 저가 공세로 경쟁하는 방식입니다.
  • Grok 4.5는 이미 Grok Build, Cursor 및 xAI Console 플랫폼에서 사용할 수 있으며, Word, PowerPoint, Excel용 플러그인도 지원합니다.
  • 이 모델은 현재 유럽연합(EU) 지역에는 출시되지 않았으며(7월 중순 출시 예정), SpaceX가 600억 달러 규모의 전량 주식 교환 방식으로 해당 회사를 인수한 후 Cursor 에디터와 병행하여 공동 개발되고 있습니다.
  • 📌 결론: Grok 4.5가 모든 벤치마크 차트에서 1위를 차지한 것은 아니지만, 초저가 가격 전략을 통해 시장에 거센 압박을 가하고 있습니다. Fable 5의 약 20%에 불과하고 GPT 5.5보다 눈에 띄게 저렴한 비용 구조는 더 적은 토큰 소비량과 결합되어 운영 비용을 획기적으로 낮춰줍니다. 실제 효율성이 발표된 바와 같다면, Grok 4.5는 단순히 가장 높은 벤치마크 점수를 가진 모델을 쫓는 대신 성능과 비용의 균형을 도모해야 하는 기업들에게 매우 매력적인 대안이 될 것입니다.
Share.
VIET NAM CONSULTING AND MEASUREMENT JOINT STOCK COMPANY
연락처

이메일: info@vietmetric.vn
주소: 베트남 하노이시 옌호아 동 쩐주이흥 거리 91번 골목 34번

© 2026 Vietmetric
Exit mobile version