GigaChat 3.5 Reasoning стал первой открытой моделью с рассуждениями
Сбер представил GigaChat 3.5 Reasoning — новую версию GigaChat, которую обучили не просто выдавать ответы, а выстраивать шаги рассуждения. Модель уже доступна на Hugging Face, а попробовать её можно и через giga.chat.
Что именно выпустили
Новая версия называется GigaChat 3.5 Reasoning. Это первая в России открытая модель GigaChat с полноценным режимом рассуждений и обучением через online RL — подход, при котором модель учится на собственных попытках решить задачу, а не только по заранее собранным примерам.
Разработчики выложили веса и код запуска на Hugging Face. Ещё один способ протестировать модель — открыть giga.chat. Для обычного пользователя это значит, что у ИИ появляется больше шансов не просто угадать ответ, а пройти к нему по шагам, перепроверяя себя по ходу решения.
Как её обучали
Команда не стала учить одну модель сразу всему подряд. Сначала был SFT-чекпоинт — базовая версия, которая умеет воспроизводить готовые ответы. Потом из него сделали шесть отдельных экспертов, каждый под свою область: математику, код, агентные сценарии, работу с пользовательским диалогом, следование инструкции и другие задачи.
У каждого эксперта была своя награда, то есть свои критерии успеха. После этого модели снова объединили в одну через on-policy distillation. По словам авторов, на этот процесс ушло больше девяти месяцев, потому что приходилось отдельно отлаживать обучение, награды и сборку результата обратно в единую систему.
Почему это важно для качества
В статье отдельно объясняют разницу между обычным SFT и online RL. При SFT модель запоминает, как выглядит правильный ответ, но не всегда понимает, как к нему прийти. Из-за этого на незнакомых задачах она может уверенно начать и затем «споткнуться» на середине решения.
Online RL решает эту проблему иначе: модель сама генерирует попытки, получает оценку и постепенно закрепляет полезные стратегии — например, перепроверять промежуточный результат или возвращаться на шаг назад. Отдельно авторы отмечают, что для таких моделей особенно важны редкие слова и развилки вроде сомнений и самопроверки. Для этого они использовали алгоритм CISPO, который, по их наблюдениям, лучше подходит для reasoning-моделей, чем GRPO.
Что может пригодиться на практике
Для бизнеса, учёбы и офисных задач это означает более удобный инструмент для сценариев, где нужен не один короткий ответ, а цепочка действий: разбор задачи, поиск ошибки в коде, работа с инструкциями, диалог с пользователем или помощь с форматом ответа.
В статье также есть важная деталь про расписание обучения: из процесса убирали задачи, которые модель уже начала решать слишком уверенно, и оставляли те, где она ошибалась не всегда. Такой подход помогает тратить ресурсы эффективнее и быстрее продвигать модель к более сложным задачам. Для пользователя это обычно выливается в более стабильный результат при сложных запросах.