DeepSeek и внутренние модели OpenAI: почему это важно
Внутренние модели крупных ИИ-лабораторий часто отличаются от тех, что видят обычные пользователи. История с OpenAI, дистилляцией и успехами DeepSeek показывает, что «публичный чатбот» — это лишь часть более большой системы.
Почему у компании может быть не одна модель, а целая линейка
У фронтирных ИИ-компаний обычно есть не один «главный» нейросетевой продукт, а целая цепочка моделей для разных этапов работы. Сначала появляются research-чекпоинты и экспериментальные версии, потом reward-модели, учителя, генераторы синтетических данных, evaluators, а уже затем — облегчённые студенты и production-модели для внешнего использования.
Из этого следует простой вывод: модель, которую используют исследователи внутри компании, и модель, доступная через API или чат, не обязаны совпадать. Для внутренних задач можно держать очень дорогую и тяжёлую систему, а для массового продукта — более дешёвую и быструю версию.
Зачем нужна дистилляция и как она помогает удешевлять ИИ
Если сильная модель хорошо пишет код, решает математику и рассуждает, но каждый её ответ стоит дорого, её часто используют как учителя. Она генерирует качественные ответы, шаги рассуждения, синтетические данные и даже вероятностные распределения, а на этом обучают меньшую модель-студента.
Такой подход называют дистилляцией знаний, и OpenAI сама предлагает разработчикам официальный workflow для этого: брать ответы более сильной модели, например GPT-4o или o1-preview, и обучать на них более дешёвую модель. Это особенно полезно там, где важны стоимость, скорость ответа, нагрузка на GPU, надёжность и безопасность.
Именно поэтому лучшая исследовательская модель и лучшая продуктовая модель могут быть оптимизированы по разным целям. Первая старается максимально расширить возможности, а вторая должна ещё и работать быстро, стабильно и недорого для миллионов пользователей.
Что это говорит о DeepSeek и публичных моделях
За последние годы похожую схему показывали Apple, Google, Meta, Microsoft и DeepSeek. Apple описывала внутреннего учителя для маленькой on-device модели, Google использовала более мощный Gemini при обучении EmbeddingGemma, Meta применяла логиты Llama 3.1 для более компактных версий, Microsoft писала о дистилляции ранних Phi из GPT-4, а DeepSeek после R1 выпустила и саму модель, и линейку дистиллированных версий от 1.5B до 70B.
Поэтому неправильно думать, что любая публичная модель — это просто «урезанная копия» секретной суперсети. Иногда учитель тоже публичный, а иногда студент вообще лучше показывает себя на узкой задаче. Но общее правило всё же видно: каталог публичных моделей почти наверняка не отражает весь фронтир возможностей лаборатории.
В математических публикациях это особенно заметно: в 2026 году несколько работ прямо указывали, что доказательства получены внутренней моделью OpenAI. Позже Noam Brown объяснял, что часть возможностей может быть скрыта и в публичной модели, если правильно выстроить scaffolding, верификацию, поиск и test-time compute. Для обычного пользователя это означает одно: в ИИ важна не только сама модель, но и то, как вы её запускаете и чем обвязываете.