- Dell Technologiesは、トークン価格が大幅に下落しているにもかかわらず、企業におけるAIコストが上昇し続けているのは、エージェンティックAI(Agentic AI)システムが消費するトークンとコンテキストの量がますます巨大化しているためだと指摘しています。
- ゴールドマン・サックス(Goldman Sachs)によると、より効率的なモデル、より強力なハードウェア、そして市場競争のおかげで、トークンの生成コストは毎年約60〜70%減少しています。
- しかし、FinOps Foundationは、ほぼ4分の3の企業が過去1年間にAIコストの予算を超過したと述べています。
- ゴールドマン・サックスは、世界のAIトークン量が2030年までに24倍に増加すると予測しています。
- Dellは、主な原因はもはや計算能力ではなく、AIエージェントや長いコンテキストウィンドウ向けに設計されていないストレージインフラにあると分析しています。
- 大規模言語モデルでは、現在GPUメモリが計算とKVキャッシュ(KV cache)の保存という2つのタスクを同時に実行しなければならず、ワークロードが増加するとパフォーマンスが低下します。
- Dellは、計算のためのGPUメモリを解放するために、KVキャッシュを専用のストレージシステムに転送することを提案しています。
- 4台のNVIDIA H100 GPUを使用したDellのテスト結果によると、KVキャッシュ転送メカニズムを使用すると、最初のトークン生成時間(Time to First Token)が17秒から約1秒に短縮されました。
- ストレージ最適化の後、マルチターンの会話を処理するスループットもほぼ3倍に向上しました。
- Dellは、自社のストレージシステムが最も近い競合他社のほぼ半分、そしてKVキャッシュ転送を行わない構成と比べて最大14倍高速なレイテンシ(低遅延)を達成したと述べています。
- 記事は、統合時間を短縮し、AIの本格運用を加速させるために、企業は単一のベンダーからサーバー、ストレージ、およびネットワークを同期的に導入すべきだと強調しています。
- Dellは、エージェンティックAIの時代において、競争優位性は単にGPUを追加投資することではなく、インfra全体、特にストレージを最適化する能力に依存するようになると結論づけています。
- 📌 結論: 企業向けAIのボトルネックは、GPUのパワーから、コンテキスト管理およびデータストレージの能力へと移行しています。エージェンティックAIが長時間のセッションや複数のエージェントを同時に処理する場合、KVキャッシュがパフォーマンスとコストを決定する要因になります。Dellによると、ストレージアーキテクチャの最適化は、ただ単にGPUを追加し続けることなく、レイテンシを大幅に削減し、スループットを向上させ、AI投資の効率を高めるのに役立ちます。
Previous Article中国、低価格とグローバルな普及で米国のAIレースに勝利することを目指す
Next Article 中国、AIエージェントに「デジタル身分証」を交付、標準化とセキュリティ強化を図る

