Новости DeepSeek

DeepSeek: как китайская модель встряхнула рынок и ИИ

Человек за ноутбуком в офисе на фоне рабочего стола и монитора

В январе 2025 года DeepSeek неожиданно стала главным именем в ИИ-новостях: бесплатная open source-модель быстро набрала популярность, а затем ударила по акциям крупных американских компаний. Разбираемся, что именно сделала китайская команда, почему это оказалось так дёшево и чем история полезна бизнесу и обычным пользователям.

Что произошло в январе 2025 года

20 января DeepSeek выложила модель R1 под MIT-лицензией, и разработчики начали быстро проверять её на своих задачах. Уже 26 января приложение DeepSeek вышло на первое место в App Store США и обогнало ChatGPT.

На следующий день рынок отреагировал очень резко: акции Nvidia упали на 17%, а капитализация компании сократилась на $589 млрд за сутки. Вслед за Nvidia просели Broadcom, Oracle, Microsoft и Google, а суммарная оценка потерь рынка приблизилась к $1 трлн.

Почему DeepSeek удалось удивить отрасль

DeepSeek оказалась не обычным стартапом, а подразделением хедж-фонда High-Flyer из Ханчжоу. Его основатель Лян Вэньфэн ещё с 2016 года строил инфраструктуру под модели глубокого обучения, а деньги на исследования шли внутри группы — без внешних инвесторов.

Сама компания не появилась из ниоткуда: до R1 у неё уже были DeepSeek Coder и DeepSeek LLM 67B в 2023 году, модель V2 с MLA в 2024-м и V3 в декабре 2024-го. То есть январский релиз стал результатом нескольких лет работы, а не внезапного успеха за одну ночь.

За счёт чего удалось снизить стоимость

Главным ограничением у DeepSeek были чипы H800 — по сути, урезанная версия H100 с более слабым каналом обмена данными между картами. Поэтому команда постоянно искала способы экономить память и ускорять передачу данных.

Для этого использовали несколько приёмов: MLA сжимала KV-кэш и позволяла обслуживать больше запросов на одной карте, DeepSeekMoE включала только часть экспертов на каждый токен, FP8 применяли уже во время обучения, а DualPipe и работа на уровне PTX помогали меньше простаивать на обмене данными между GPU. Благодаря этому итоговый финальный прогон V3 оценили примерно в $5,576 млн, хотя это не включает исследования, эксперименты и другие затраты.

Что это значит для пользователей и компаний

Для обычных людей история DeepSeek показывает, что мощные модели больше не обязаны быть запредельно дорогими или закрытыми. Для бизнеса это сигнал: качество и стоимость ИИ уже зависят не только от размера дата-центра, но и от того, насколько грамотно выстроена инженерия.

Если вы работаете с контентом, аналитикой, поддержкой клиентов или внутренними документами, такие модели полезны как пример того, что ИИ можно внедрять экономнее. А для повседневных задач — от текстов до разборов информации — удобно выбирать сервисы, которые быстро дают результат без сложной настройки.

Частые вопросы

Почему вокруг DeepSeek было столько шума?
Потому что модель быстро стала популярной, обогнала ChatGPT в App Store США и одновременно вызвала сильную реакцию на фондовом рынке. Для ИИ-отрасли это стало сигналом, что дорогая инфраструктура — не единственный путь к сильному результату.
DeepSeek действительно обучили всего за несколько миллионов долларов?
Речь идёт о стоимости финального прогона V3, а не обо всех расходах компании. В суммарные затраты не входят исследования, неудачные эксперименты, сбор данных и зарплаты.
Что в этой истории полезно для бизнеса?
Она показывает, что экономия на ИИ возможна за счёт архитектуры и оптимизации, а не только за счёт покупки большего числа GPU. Это важно для компаний, которые хотят внедрять ИИ без огромного бюджета.
Можно ли использовать такой подход в обычной работе?
Да, как минимум на уровне выбора инструментов: стоит искать сервисы, которые быстрее и дешевле решают задачу. Для текстов, анализа и рутинных операций это помогает экономить время и деньги.

Читайте также

Попробовать Lord GPT бесплатно →