ChatGPT и чип Jalapeño: OpenAI бросает вызов Nvidia
OpenAI показала собственный чип Jalapeño для инференса и заявила о сильных результатах в тестах на производительность и энергоэффективность. Это важный сигнал для рынка ИИ: компании всё чаще хотят считать модели на своем железе, а не полностью зависеть от готовых GPU.
Что именно сделала OpenAI
По данным SemiAnalysis, OpenAI несколько лет тихо работала над собственным ASIC-чипом Jalapeño вместе с Broadcom. Проект стартовал в середине 2024 года, а от найма первых специалистов до tapeout прошло примерно 16 месяцев — для аппаратной разработки это очень быстрый срок.
Чип создавался не как узкое решение под одну модель, а как универсальная платформа для инференса больших языковых моделей. OpenAI показала его на Hot Chips и пригласила исследователей в лабораторию, чтобы те смогли проверить работу чипа и прогнать собственные тесты InferenceX.
Почему вокруг Jalapeño столько внимания
Судя по результатам, Jalapeño выглядит неожиданно сильным даже для первого поколения. В опубликованных тестах он обгоняет чипы Nvidia, AMD и Google на ряде популярных открытых моделей, а по показателю токенов на мегаватт системы показывает особенно высокую эффективность.
Отдельный акцент делается на том, что чип не опирается на Multi Token Prediction и не требует экзотических трюков вроде speculative decoding или разделения prefill/decode. В одном из сценариев на модели DeepSeek R1 OpenAI показала больше 700 токенов в секунду на пользователя при concurrency 1, а на других моделях, включая Kimi-K2.5 и GPT-OSS, — около 1400 токенов в секунду на пользователя.
Что это значит для бизнеса и обычных пользователей
Если выводы SemiAnalysis подтвердятся на практике, OpenAI сможет дешевле и быстрее запускать свои модели в продакшене, не полагаясь только на сторонние GPU. Для бизнеса это означает потенциально более низкую стоимость ИИ-сервисов и лучшую доступность быстрых ответов в чатах, поиске и агентных сценариях.
Для пользователей это может вылиться в более отзывчивые продукты на базе ChatGPT и других моделей OpenAI: меньше задержек, больше пропускная способность и стабильнее работа при высокой нагрузке. Для рынка же это еще и намек, что у Nvidia появляется всё больше конкурентов не только среди облачных провайдеров, но и среди самих разработчиков ИИ.