- Dell Technologies ist der Ansicht, dass die KI-Kosten für Unternehmen trotz eines starken Rückgangs der Token-Preise weiter steigen, da Agentische KI-Systeme (Agentic AI) immer größere Mengen an Token und Kontext verbrauchen.
- Nach Angaben von Goldman Sachs sind die Kosten für die Token-Generierung dank effizienterer Modelle, leistungsstärkerer Hardware und des Marktwettbewerbs jährlich um etwa 60–70 % gesunken.
- Die FinOps Foundation teilte jedoch mit, dass fast drei Viertel der Unternehmen ihre KI-Kostenbudgets im vergangenen Jahr überschritten haben.
- Goldman Sachs prognostiziert, dass sich das weltweite KI-Token-Volumen bis 2030 vervierundzwanzigfachen wird.
- Dell stellt fest, dass die Hauptursache nicht mehr in der Rechenleistung liegt, sondern in der Speicherinfrastruktur, die nicht für KI-Agenten und lange Kontextfenster ausgelegt ist.
- Bei großen Sprachmodellen muss der GPU-Speicher derzeit zwei Aufgaben gleichzeitig erfüllen: Berechnung und KV-Cache-Speicherung (KV cache), was die Leistung bei steigender Arbeitslast verringert.
- Dell schlägt vor, den KV-Cache auf ein dediziertes Speichersystem zu verlagern, um den GPU-Speicher für Berechnungen freizugeben.
- Gemäß den Testergebnissen von Dell auf 4 NVIDIA H100-GPUs sank die Zeit bis zum ersten Token (Time to First Token) von 17 Sekunden auf etwa 1 Sekunde, wenn der KV-Cache-Übertragungsmechanismus verwendet wurde.
- Der Durchsatz bei der Verarbeitung von Multi-Turn-Unterhaltungen hat sich nach der Speicheroptimierung ebenfalls fast verdreifacht.
- Dell gab an, dass sein Speichersystem eine Latenzzeit erreicht, die fast halb so groß ist wie die des nächsten Konkurrenten und bis zu 14-mal schneller als eine Konfiguration ohne KV-Cache-Übertragung.
- Der Artikel betont, dass Unternehmen Server, Speicher und Netzwerke synchron von einem einzigen Anbieter bereitstellen sollten, um die Integrationszeit zu verkürzen und die KI-Inbetriebnahme zu beschleunigen.
- Dell kommt zu dem Schluss, dass im Zeitalter der Agentic AI der Wettbewerbsvorteil von der Fähigkeit abhängen wird, die gesamte Infrastruktur, insbesondere den Speicher, zu optimieren, anstatt nur in weitere GPUs zu investieren.
- 📌 Fazit: Der Flaschenhals der Unternehmens-KI verlagert sich von der GPU-Leistung hin zur Fähigkeit des Kontextmanagements und der Datenspeicherung. Wenn Agentic AI lange Sitzungen und mehrere Agenten gleichzeitig verarbeitet, wird der KV-Cache zum entscheidenden Faktor für Leistung und Kosten. Laut Dell kann die Optimierung der Speicherarchitektur dazu beitragen, die Latenz erheblich zu verringern, den Durchsatz zu erhöhen und die Effizienz von KI-Investitionen zu verbessern, ohne dass einfach immer nur mehr GPUs hinzugefügt werden müssen.
KI-Kosten steigen trotz günstigerer Token, weil sich der Flaschenhals von GPUs auf Speicher verlagert hat
Related Posts
KONTAKT
E-mail: info@vietmetric.vn
Adresse: Nr. 34, Gasse 91, Tran-Duy-Hung-Straße, Bezirk Yen Hoa, Stadt Hanoi
© 2026 Vietmetric
