- xAI 推出了 Grok 4.5,该模型在数万块英伟达(Nvidia)GB300 GPU 上训练而成,面向编程、智能体(Agent)及知识型任务。
- 在 Terminal Bench 2.1 上,Grok 4.5 达到了 83.3%,几乎与 GPT 5.5 的 83.4% 持平,仅略低于 Fable 5 的 84.3%。
- 在 DeepSWE 1.1 上,Grok 4.5 的得分为 53%,在处理真实 GitHub 错误(Issue)的能力上低于 GPT 5.5 的 67% 和 Fable 5 的 70%。
- 在 SWE Bench Pro 上,Grok 4.5 达到了 64.7%,超过了 GLM 5.2 的 62.1%,但低于 Opus 4.8 的 69.2% 和 Fable 5 的 80.4%。
- xAI 表示,该模型通过严格的数据过滤流程进行训练,去除了重复数据并按领域精选数据以提升质量。
- 强化学习阶段利用了数十万个任务(主要关于软件工程),并配备了自动评分系统以及针对运行数小时的智能体的异步训练基础设施。
- Grok 4.5 的定价为每百万输入 Token 2 美元,每百万输出 Token 6 美元,在高性能模型阵营中价格最低。
- 与此同时,Opus 4.8 的每百万输入和输出 Token 定价分别为 5 美元和 25 美元;GPT 5.5 和 GPT 5.6 为 5 美元和 30 美元;而 Fable 5 则高达 10 美元和 50 美元。
- xAI 表示,在 SWE Bench Pro 测试中,Grok 4.5 消耗的 Token 数量比 Opus 4.8 少约 4.2 倍,且达到了每秒约 80 个 Token 的速度。
- xAI 的策略与智谱(Zhipu)和深度求索(DeepSeek)等中国公司相似:缩小性能差距,然后以低价进行竞争。
- Grok 4.5 已在 Grok Build、Cursor 和 xAI Console 平台上架,同时支持 Word、PowerPoint 和 Excel 的插件。
- 该模型目前尚未在欧盟发布,预计将于 7 月中旬推出。在 SpaceX 以 600 美元股票的形式收购 Cursor 母公司后,该模型正与 Cursor 编辑器同步并行开发。
- 📌 结论: Grok 4.5 虽然没有在每个基准测试榜单中夺冠,但凭借极低的定价策略带来了巨大的竞争压力。其费用仅为 Fable 5 的 20% 左右,且明显低于 GPT 5.5,再加上更低的 Token 消耗,大幅降低了实际运营成本。如果其实际效能如公布的那样,Grok 4.5 可能会成为那些需要在性能与成本之间取得平衡的企业的诱人选择,而不是一味追求基准测试分数最高的模型。
Previous ArticleCPU 意外成为 AI 最热门战场,市场规模将超 2200 亿美元
Next Article 代币经济爆发:中国人工智能在短短两年内加速超千倍
Related Posts
© 2026 Vietmetric

