• 戴尔科技(Dell Technologies)认为,尽管 Token 价格大幅下降,但企业 AI 成本仍在上升,因为智能体 AI(Agentic AI)系统消耗的 Token 和上下文(Context)体量正变得越来越大。
  • 据高盛(Goldman Sachs)称,得益于更高效的模型、更强大的硬件以及市场竞争,生成 Token 的成本每年下降了约 60-70%。
  • 然而,FinOps 基金会表示,近四分之三的企业在过去一年中超出了其 AI 成本预算。
  • 高盛预测,到 2030 年,全球 AI Token 的使用量将增加 24 倍。
  • 戴尔指出,主要原因不再是计算能力,而是尚未针对 AI 智能体和长上下文窗口进行设计的存储基础设施。
  • 在大型语言模型中,GPU 显存目前必须同时执行两项任务:计算和 KV 缓存(KV cache)存储,这会导致工作负载增加时性能下降。
  • 戴尔提议将 KV 缓存转移到专用的存储系统中,以释放 GPU 显存用于计算。
  • 根据戴尔在 4 块 NVIDIA H100 GPU 上的测试结果,在使用 KV 缓存转移机制后,首字延迟(Time to First Token,即生成第一个 Token 的时间)从 17 秒缩短至约 1 秒。
  • 经过存储优化后,处理多轮对话的吞吐量也几乎翻了三倍。
  • 戴尔表示,其存储系统的延迟几乎只有其最接近的竞争对手的一半,并且比未转移 KV 缓存的配置快了多达 14 倍。
  • 文章强调,企业应当同步部署来自单一供应商的服务器、存储和网络,以减少集成时间并加速 AI 投入运营。
  • 戴尔总结道,在智能体 AI 时代,竞争优势将取决于优化整个基础设施(尤其是存储)的能力,而不仅仅是投资购买更多的 GPU。
  • 📌 结论: 企业 AI 的瓶颈正在从 GPU 算力转向上下文管理和数据存储能力。当智能体 AI 频繁处理长会话以及多个智能体并发时,KV 缓存成为了决定性能和成本的关键因素。戴尔认为,优化存储架构可以大幅降低延迟、提高吞吐量并改善 AI 投资回报率,而无需一味地继续添加 GPU。
Share.
VIET NAM CONSULTING AND MEASUREMENT JOINT STOCK COMPANY
联系方式

电子邮件: info@vietmetric.vn
地址:河内市安和坊陈维兴街91巷34号

© 2026 Vietmetric
Exit mobile version