- 戴尔科技(Dell Technologies)认为,尽管 Token 价格大幅下降,但企业 AI 成本仍在上升,因为智能体 AI(Agentic AI)系统消耗的 Token 和上下文(Context)体量正变得越来越大。
- 据高盛(Goldman Sachs)称,得益于更高效的模型、更强大的硬件以及市场竞争,生成 Token 的成本每年下降了约 60-70%。
- 然而,FinOps 基金会表示,近四分之三的企业在过去一年中超出了其 AI 成本预算。
- 高盛预测,到 2030 年,全球 AI Token 的使用量将增加 24 倍。
- 戴尔指出,主要原因不再是计算能力,而是尚未针对 AI 智能体和长上下文窗口进行设计的存储基础设施。
- 在大型语言模型中,GPU 显存目前必须同时执行两项任务:计算和 KV 缓存(KV cache)存储,这会导致工作负载增加时性能下降。
- 戴尔提议将 KV 缓存转移到专用的存储系统中,以释放 GPU 显存用于计算。
- 根据戴尔在 4 块 NVIDIA H100 GPU 上的测试结果,在使用 KV 缓存转移机制后,首字延迟(Time to First Token,即生成第一个 Token 的时间)从 17 秒缩短至约 1 秒。
- 经过存储优化后,处理多轮对话的吞吐量也几乎翻了三倍。
- 戴尔表示,其存储系统的延迟几乎只有其最接近的竞争对手的一半,并且比未转移 KV 缓存的配置快了多达 14 倍。
- 文章强调,企业应当同步部署来自单一供应商的服务器、存储和网络,以减少集成时间并加速 AI 投入运营。
- 戴尔总结道,在智能体 AI 时代,竞争优势将取决于优化整个基础设施(尤其是存储)的能力,而不仅仅是投资购买更多的 GPU。
- 📌 结论: 企业 AI 的瓶颈正在从 GPU 算力转向上下文管理和数据存储能力。当智能体 AI 频繁处理长会话以及多个智能体并发时,KV 缓存成为了决定性能和成本的关键因素。戴尔认为,优化存储架构可以大幅降低延迟、提高吞吐量并改善 AI 投资回报率,而无需一味地继续添加 GPU。
Previous Article中国试图通过低成本与全球普及在全球AI竞赛中击败美国
Next Article 中国为AI代理发放“数字身份证”以规范并增强安全性
Related Posts
© 2026 Vietmetric
