DeepSeek подняла цены, а ИИ-железо уперлось в память
ИИ-рынок, который два года жил в ожидании удешевления токенов и ускорителей, начал меняться в обратную сторону. DeepSeek резко пересмотрела цены на API, а на конференции Hot Chips крупные вендоры показали, что главная проблема ИИ теперь не только вычисления, но и память, сеть и охлаждение.
Почему август стал переломным для ИИ-инфраструктуры
Раньше компании часто планировали ИИ-проекты по простой логике: подождать квартал — и тот же объём вычислений станет дешевле. На этом строили бюджеты, считали окупаемость и надеялись, что софт и новое железо сами улучшат экономику инфраструктуры.
Но в августе это представление начало ломаться сразу в нескольких местах. DeepSeek подняла стоимость API в пиковые часы на 355–371% и стала брать плату в зависимости от времени суток. Одновременно Micron на Hot Chips показала, что в современных двухкристальных GPU-сборках память уже занимает около 90% площади кремния, а стоит примерно в пять раз дороже DDR5 за бит.
Что показали на Hot Chips 2026
Конференция в Стэнфорде 24–25 августа собрала почти всех крупных игроков, и общий вывод у докладов оказался одинаковым: индустрия упёрлась не столько в арифметику, сколько в перемещение данных. Поэтому новые архитектуры всё сильнее завязаны на память, сеть и способы охлаждения.
NVIDIA показала стойку Vera Rubin NVL72 и связанный с ней стек решений для ИИ-фабрик: NVLink 6, жидкостное охлаждение тёплой водой без чиллеров, а также сеть Spectrum-X, которую можно масштабировать до 512 000 GPU. AMD ответила ускорителем MI455X с 432 ГБ HBM4 и пропускной способностью 23,3 ТБ/с, а Google разделила обучение и инференс по разным кристаллам, представив TPU v8t и TPU v8i.
Что это значит для бизнеса и разработчиков
Главный практический вывод простой: ИИ становится не только сильнее, но и сложнее в размещении и обслуживании. Теперь мало купить ускоритель — нужно ещё понимать, хватит ли памяти, как пойдёт трафик между чипами и выдержит ли дата-центр энергопотребление и охлаждение.
Для компаний это означает, что цена одного токена и стоимость инференса могут быть менее предсказуемыми, чем раньше. Если вы строите чат-ботов, внутренние помощники или аналитические сервисы, стоит заранее считать не только вычисления, но и стоимость памяти, сетевой инфраструктуры и пиковых нагрузок. Похожую оценку сценариев удобно делать через ИИ-сервисы и прототипы до закупки тяжёлого железа.