- Dell Technologies ritiene che i costi dell’IA aziendale continuino a salire nonostante il forte calo dei prezzi dei token, poiché i sistemi di Agentic AI consumano quantità sempre maggiori di token e contesti.
- Secondo Goldman Sachs, il costo di generazione dei token è diminuito di circa il 60-70% all’anno grazie a modelli più efficienti, hardware più potente e alla concorrenza di mercato.
- Tuttavia, la FinOps Foundation ha dichiarato che quasi tre quarti delle imprese hanno superato il budget stimato per i costi dell’IA nell’ultimo anno.
- Goldman Sachs prevede che il volume globale di token IA aumenterà di 24 volte entro il 2030.
- Dell rileva che la causa principale non risiede più nella capacità di calcolo, bensì nell’infrastruttura di storage che non è stata progettata per gli AI Agent e per finestre di contesto lunghe.
- Nei grandi modelli linguistici, la memoria delle GPU deve attualmente eseguire simultaneamente due compiti, calcolo e memorizzazione della KV cache, riducendo le prestazioni all’aumentare del carico di lavoro.
- Dell propone di trasferire la KV cache a un sistema di storage dedicato per liberare la memoria della GPU per il calcolo.
- Secondo i risultati dei test condotti da Dell su 4 GPU NVIDIA H100, il tempo di emissione del primo token (Time to First Token) è sceso da 17 secondi a circa 1 secondo quando si utilizza il meccanismo di trasferimento della KV cache.
- Anche il throughput per la gestione di conversazioni a più turni è quasi triplicato dopo l’ottimizzazione dello storage.
- Dell ha dichiarato che il suo sistema di storage raggiunge una latenza pari a quasi la metà rispetto al concorrente più vicino ed è fino a 14 volte più veloce rispetto a una configurazione senza trasferimento della KV cache.
- L’articolo sottolinea che le aziende dovrebbero implementare in modo sincrono server, storage e reti da un unico fornitore per ridurre i tempi di integrazione e accelerare la messa in funzione dell’IA.
- Dell conclude che nell’era dell’Agentic AI, il vantaggio competitivo dipenderà dalla capacità di ottimizzare l’intera infrastruttura, in particolare lo storage, piuttosto che investire solo in ulteriori GPU.
- 📌 Conclusione: Il collo di bottiglia dell’IA aziendale si sta spostando dalla potenza delle GPU alla capacità di gestione del contesto e dello storage dei dati. Quando l’Agentic AI gestisce sessioni lunghe e molteplici Agent in contemporanea, la KV cache diventa il fattore decisivo per le prestazioni e i costi. Secondo Dell, l’ottimizzazione dell’architettura di storage può aiutare a ridurre significativamente la latenza, aumentare il throughput e migliorare l’efficienza degli investimenti in IA senza dover unicamente continuare ad aggiungere GPU.
I costi dell’IA aumentano nonostante i token più economici perché il collo di bottiglia si è spostato dalle GPU allo storage
Related Posts
CONTATTI
Email: info@vietmetric.vn
Indirizzo: Numero 34, Vicolo 91, Via Tran Duy Hung, Quartiere Yen Hoa, Città di Hanoi
© 2026 Vietmetric
