- xAIは、プログラミング、エージェント、および知識タスク向けに、数万台のNvidia GB300 GPUで訓練された「Grok 4.5」をリリースしました。
- Terminal Bench 2.1において、Grok 4.5は83.3%を記録し、GPT 5.5の83.4%とほぼ互角、Fable 5の84.3%よりわずかに低い結果となりました。
- DeepSWE 1.1において、Grok 4.5は53%にとどまり、実際のGitHubのバグ処理能力においてGPT 5.5の67%やFable 5の70%を下回りました。
- SWE Bench Proにおいて、Grok 4.5は64.7%を達成し、GLM 5.2の62.1%を上回ったものの、Opus 4.8の69.2%やFable 5の80.4%より低いスコアとなりました。
- xAIは、本モデルが厳格なデータフィルタリングプロセス、重複データの削除、および品質向上のためのセクター別データ選定を通じて訓練されたと述べています。
- 強化学習フェーズでは、主にソフトウェア工学に関する数十万のタスクが利用され、自動採点システムと、数時間実行されるエージェントのための非同期訓練インフラが備えられています。
- Grok 4.5の価格は、入力トークン100万枚あたり2米ドル、出力トークン100万枚あたり6米ドルであり、高性能モデルグループの中で最も低価格です。
- 一方、Opus 4.8は5米ドルと25米ドル、GPT 5.5およびGPT 5.6は5米ドルと30米ドル、Fable 5は入力・出力100万トークンあたりそれぞれ10米ドルと50米ドルに達します。
- xAIによると、Grok 4.5はSWE Bench ProのテストにおいてOpus 4.8と比較して約4.2倍少ないトークンしか消費せず、秒間約80トークンの速度を達成しています。
- xAIの戦略は、智譜(Zhipu)やDeepSeekなどの中国企業と類似しています。まず性能の格差を縮め、その後に低価格で競争を仕掛けるという点です。
- Grok 4.5はすでにGrok Build、Cursor、およびxAI Consoleプラットフォームで利用可能であり、Word、PowerPoint、Excelのプラグインもサポートしています。
- 本モデルは欧州連合(EU)内ではまだリリースされておらず(7月中旬に登場予定)、SpaceXが600億米ドル相当の株式による取引で同社を買収したことを受け、コードエディタ「Cursor」と並行して共同開発が進められています。
- 📌 結論: Grok 4.5はすべてのベンチマークランキングでトップに立ったわけではありませんが、非常に低い価格戦略によって市場に大きなプレッシャーを与えています。Fable 5の約20%にすぎず、GPT 5.5よりも大幅に安い料金体系は、トークン消費量の少なさと相まって、運用コストを劇的に削減します。実際の費用対効果が公表通りであれば、Grok 4.5は、最高スコアのベンチマークモデルを追い求める代わりに、性能とコストのバランスを必要とする企業にとって極めて魅力的な選択肢となる可能性があります。
Previous ArticleCPUが突如としてAIの最も熱い戦場に、2,200億ドル超の市場規模へ
Next Article トークンエコノミーが爆発:中国のAI、わずか2年で1,000倍以上に加速
