DeepSeek: как китайская модель встряхнула рынок и ИИ
В январе 2025 года DeepSeek неожиданно стала главным именем в ИИ-новостях: бесплатная open source-модель быстро набрала популярность, а затем ударила по акциям крупных американских компаний. Разбираемся, что именно сделала китайская команда, почему это оказалось так дёшево и чем история полезна бизнесу и обычным пользователям.
Что произошло в январе 2025 года
20 января DeepSeek выложила модель R1 под MIT-лицензией, и разработчики начали быстро проверять её на своих задачах. Уже 26 января приложение DeepSeek вышло на первое место в App Store США и обогнало ChatGPT.
На следующий день рынок отреагировал очень резко: акции Nvidia упали на 17%, а капитализация компании сократилась на $589 млрд за сутки. Вслед за Nvidia просели Broadcom, Oracle, Microsoft и Google, а суммарная оценка потерь рынка приблизилась к $1 трлн.
Почему DeepSeek удалось удивить отрасль
DeepSeek оказалась не обычным стартапом, а подразделением хедж-фонда High-Flyer из Ханчжоу. Его основатель Лян Вэньфэн ещё с 2016 года строил инфраструктуру под модели глубокого обучения, а деньги на исследования шли внутри группы — без внешних инвесторов.
Сама компания не появилась из ниоткуда: до R1 у неё уже были DeepSeek Coder и DeepSeek LLM 67B в 2023 году, модель V2 с MLA в 2024-м и V3 в декабре 2024-го. То есть январский релиз стал результатом нескольких лет работы, а не внезапного успеха за одну ночь.
За счёт чего удалось снизить стоимость
Главным ограничением у DeepSeek были чипы H800 — по сути, урезанная версия H100 с более слабым каналом обмена данными между картами. Поэтому команда постоянно искала способы экономить память и ускорять передачу данных.
Для этого использовали несколько приёмов: MLA сжимала KV-кэш и позволяла обслуживать больше запросов на одной карте, DeepSeekMoE включала только часть экспертов на каждый токен, FP8 применяли уже во время обучения, а DualPipe и работа на уровне PTX помогали меньше простаивать на обмене данными между GPU. Благодаря этому итоговый финальный прогон V3 оценили примерно в $5,576 млн, хотя это не включает исследования, эксперименты и другие затраты.
Что это значит для пользователей и компаний
Для обычных людей история DeepSeek показывает, что мощные модели больше не обязаны быть запредельно дорогими или закрытыми. Для бизнеса это сигнал: качество и стоимость ИИ уже зависят не только от размера дата-центра, но и от того, насколько грамотно выстроена инженерия.
Если вы работаете с контентом, аналитикой, поддержкой клиентов или внутренними документами, такие модели полезны как пример того, что ИИ можно внедрять экономнее. А для повседневных задач — от текстов до разборов информации — удобно выбирать сервисы, которые быстро дают результат без сложной настройки.