- Dell Technologies считает, что затраты предприятий на ИИ продолжают расти, несмотря на резкое снижение цен на токены, поскольку системы агентного ИИ (Agentic AI) потребляют все больший объем токенов и контекста.
- По данным Goldman Sachs, стоимость генерации токенов снижается примерно на 60–70% ежегодно благодаря более эффективным моделям, более мощному оборудованию и рыночной конкуренции.
- Однако FinOps Foundation заявляет, что почти три четверти компаний превысили свои бюджеты на ИИ-расходы за прошлый год.
- Goldman Sachs прогнозирует, что глобальный объем ИИ-токенов увеличится в 24 раза к 2030 году.
- Dell отмечает, что основная причина кроется уже не в вычислительной мощности, а в инфраструктуре хранения, которая не была спроектирована под ИИ-агентов и длинные контекстные окна.
- В больших языковых моделях память GPU в настоящее время должна одновременно выполнять две задачи: вычисления и хранение KV-кеша (KV cache), что снижает производительность при росте нагрузки.
- Dell предлагает перенести KV-кеш в выделенную систему хранения, чтобы освободить память GPU для вычислений.
- Согласно результатам тестов Dell на 4 графических процессорах NVIDIA H100, время до выдачи первого токена (Time to First Token) сократилось с 17 секунд до примерно 1 секунды при использовании механизма переноса KV-кеша.
- Пропускная способность при обработке многодиалоговых сессий также увеличилась почти в три раза после оптимизации хранения.
- В Dell заявили, что задержка в их системе хранения почти вдвое меньше, чем у ближайшего конкурента, и до 14 раз меньше по сравнению с конфигурацией без переноса KV-кеша.
- В статье подчеркивается, что предприятиям следует внедрять серверы, системы хранения и сети синхронно от одного поставщика, чтобы сократить время интеграции и ускорить запуск ИИ в эксплуатацию.
- Dell делает вывод, что в эпоху агентного ИИ конкурентное преимущество будет зависеть от способности оптимизировать всю инфраструктуру, особенно хранение данных, а не просто от закупки дополнительных GPU.
- 📌 Заключение: Узкое место корпоративного ИИ смещается от мощности GPU к возможностям управления контекстом и хранения данных. Когда агентный ИИ обрабатывает длительные сессии и множество агентов одновременно, KV-кеш становится определяющим фактором производительности и затрат. По мнению Dell, оптимизация архитектуры хранения может помочь значительно снизить задержку, увеличить пропускную способность и повысить эффективность инвестиций в ИИ без необходимости просто продолжать наращивать количество GPU.
Затраты на ИИ растут, несмотря на удешевление токенов, поскольку узкое место сместилось с GPU на хранение данных
Related Posts
KONTAKT
Электронная почта: info@vietmetric.vn
Адрес: Дом 34, переулок 91, улица Чан Зуй Хынг, район Йен Хоа, город Ханой
© 2026 Vietmetric
