- Dell Technologies estime que les coûts de l’IA en entreprise continuent d’augmenter malgré une baisse drastique du prix des tokens, car les systèmes d’IA agentielle (Agentic AI) consomment des volumes de tokens et des contextes de plus en plus gigantesques.
- Selon Goldman Sachs, le coût de génération des tokens a diminué d’environ 60 à 70 % par an grâce à des modèles plus efficaces, un matériel plus puissant et la concurrence sur le marché.
- Cependant, la FinOps Foundation a déclaré que près des trois quarts des entreprises ont dépassé leur budget prévisionnel de coûts d’IA au cours de l’année écoulée.
- Goldman Sachs prévoit que le volume mondial de tokens d’IA sera multiplié par 24 d’ici 2030.
- Dell note que la cause principale ne réside plus dans la capacité de calcul, mais dans l’infrastructure de stockage qui n’a pas été conçue pour les agents d’IA et les fenêtres de contexte étendues.
- Dans les grands modèles de langage, la mémoire des GPU doit actuellement exécuter simultanément deux tâches, à savoir le calcul et le stockage du KV cache, ce qui réduit les performances à mesure que la charge de travail augmente.
- Dell propose de transférer le KV cache vers un système de stockage dédié afin de libérer la mémoire du GPU pour le calcul.
- Selon les résultats des tests effectués par Dell sur 4 GPU NVIDIA H100, le temps d’émission du premier token (Time to First Token) est passé de 17 secondes à environ 1 seconde lors de l’utilisation du mécanisme de transfert du KV cache.
- Le débit de traitement des conversations à plusieurs tours a également presque triplé après l’optimisation du stockage.
- Dell a indiqué que son système de stockage atteint une latence presque deux fois inférieure à celle de son concurrent le plus proche et jusqu’à 14 fois plus rapide qu’une configuration sans transfert de KV cache.
- L’article souligne que les entreprises devraient déployer de manière synchrone des serveurs, du stockage et des réseaux provenant d’un seul et même fournisseur afin de réduire le temps d’intégration et d’accélérer la mise en exploitation de l’IA.
- Dell conclut que dans l’ère de l’Agentic AI, l’avantage concurrentiel dépendra de la capacité à optimiser l’ensemble de l’infrastructure, en particulier le stockage, plutôt que d’investir uniquement dans des GPU supplémentaires.
- 📌 Conclusion : Le goulot d’étranglement de l’IA en entreprise est en train de passer de la puissance des GPU à la capacité de gestion du contexte et du stockage des données. Lorsque l’IA agentielle traite de longues sessions et de multiples agents en simultané, le KV cache devient le facteur décisif pour les performances et les coûts. Selon Dell, l’optimisation de l’architecture de stockage peut aider à réduire considérablement la latence, à augmenter le débit et à améliorer l’efficacité des investissements dans l’IA sans avoir à simplement continuer d’ajouter des GPU.
Les coûts de l’IA augmentent malgré des tokens moins chers car le goulot d’étranglement s’est déplacé des GPU vers le stockage
Related Posts
Contact
E-mail: info@vietmetric.vn
Adresse : N° 34, Allée 91, Rue Tran Duy Hung, Quartier Yen Hoa, Ville de Hanoï
© 2026 Vietmetric
