Новости ИИ

GigaChat 3.5 Reasoning стал первой открытой моделью с рассуждениями

Стол с кодом, распечатками и оборудованием для обучения ИИ-модели

Сбер представил GigaChat 3.5 Reasoning — новую версию GigaChat, которую обучили не просто выдавать ответы, а выстраивать шаги рассуждения. Модель уже доступна на Hugging Face, а попробовать её можно и через giga.chat.

Что именно выпустили

Новая версия называется GigaChat 3.5 Reasoning. Это первая в России открытая модель GigaChat с полноценным режимом рассуждений и обучением через online RL — подход, при котором модель учится на собственных попытках решить задачу, а не только по заранее собранным примерам.

Разработчики выложили веса и код запуска на Hugging Face. Ещё один способ протестировать модель — открыть giga.chat. Для обычного пользователя это значит, что у ИИ появляется больше шансов не просто угадать ответ, а пройти к нему по шагам, перепроверяя себя по ходу решения.

Как её обучали

Команда не стала учить одну модель сразу всему подряд. Сначала был SFT-чекпоинт — базовая версия, которая умеет воспроизводить готовые ответы. Потом из него сделали шесть отдельных экспертов, каждый под свою область: математику, код, агентные сценарии, работу с пользовательским диалогом, следование инструкции и другие задачи.

У каждого эксперта была своя награда, то есть свои критерии успеха. После этого модели снова объединили в одну через on-policy distillation. По словам авторов, на этот процесс ушло больше девяти месяцев, потому что приходилось отдельно отлаживать обучение, награды и сборку результата обратно в единую систему.

Почему это важно для качества

В статье отдельно объясняют разницу между обычным SFT и online RL. При SFT модель запоминает, как выглядит правильный ответ, но не всегда понимает, как к нему прийти. Из-за этого на незнакомых задачах она может уверенно начать и затем «споткнуться» на середине решения.

Online RL решает эту проблему иначе: модель сама генерирует попытки, получает оценку и постепенно закрепляет полезные стратегии — например, перепроверять промежуточный результат или возвращаться на шаг назад. Отдельно авторы отмечают, что для таких моделей особенно важны редкие слова и развилки вроде сомнений и самопроверки. Для этого они использовали алгоритм CISPO, который, по их наблюдениям, лучше подходит для reasoning-моделей, чем GRPO.

Что может пригодиться на практике

Для бизнеса, учёбы и офисных задач это означает более удобный инструмент для сценариев, где нужен не один короткий ответ, а цепочка действий: разбор задачи, поиск ошибки в коде, работа с инструкциями, диалог с пользователем или помощь с форматом ответа.

В статье также есть важная деталь про расписание обучения: из процесса убирали задачи, которые модель уже начала решать слишком уверенно, и оставляли те, где она ошибалась не всегда. Такой подход помогает тратить ресурсы эффективнее и быстрее продвигать модель к более сложным задачам. Для пользователя это обычно выливается в более стабильный результат при сложных запросах.

Частые вопросы

Чем GigaChat 3.5 Reasoning отличается от обычной версии?
Новая версия обучалась с упором на рассуждение, а не только на воспроизведение готовых ответов. Это помогает лучше справляться с задачами, где нужно пройти несколько шагов и не потерять логику по дороге.
Можно ли уже попробовать эту модель?
Да, авторы сообщили, что веса и код доступны на Hugging Face. Ещё модель можно протестировать через сервис giga.chat.
Зачем делили обучение на шесть экспертов?
Так меньше конфликтов между доменами и проще точнее настроить награду под каждую область.
Кому это может быть полезно на практике?
Тем, кто работает с текстами, кодом, инструкциями и сложными многошаговыми задачами. Такая модель полезна, когда нужен не просто ответ, а аккуратное решение с проверкой по пути.

Читайте также

Попробовать Lord GPT бесплатно →