Как в «Первой Форме» обновляют Gemini без риска для агента
В «Первой Форме» показали, как меняют языковые модели в ИИ-агенте для разработки так, чтобы не ломать рабочие процессы и быстро откатываться при проблемах. На примере Muse Spark и Gemini 3.8 Flash команда описала практику, которая полезна всем, кто использует LLM в продукте или автоматизации.
Почему одной публичной оценки модели мало
Внешние бенчмарки помогают только на первом шаге: по ним можно увидеть новую модель, понять её цену, размер контекста и общий уровень возможностей. Но для продукта этого недостаточно, потому что реальная проверка всегда упирается в собственные задачи и инфраструктуру.
Для агентa-разработчика важны совсем не абстрактные рекорды, а умение работать с репозиторием, инструментами, длинной сессией и аккуратно вносить правки. Поэтому модель, которая хорошо выглядит в лидерборде, может неожиданно просесть на сценарии, критичном именно для команды. Дополнительный риск в том, что поведение зависит не только от самой модели, но и от промпта, провайдера и всей обвязки вокруг неё.
Как устроен пул моделей и быстрый откат
В «Первой Форме» ИИ-ассистент не завязан на один единственный вариант. Вместо этого используется пул провайдеров и моделей, из которого система выбирает нужную конфигурацию по заданным весам, а в отдельных случаях можно явно запросить конкретную модель.
Когда новая версия проходит проверку, старая не исчезает из настроек сразу. Её переводят в состояние dormant — она не участвует в обычном выборе, но остаётся готовой к возврату. Это делает откат почти обычным изменением конфигурации, а не срочной аварийной операцией. Такой подход особенно важен, когда нужно быстро вернуть стабильное поведение без лишнего простоя и споров, где именно возникла ошибка.
Что проверили на Muse Spark 1.3 и Gemini 3.8 Flash
2 сентября команда сравнила Muse Spark 1.3 с предыдущей версией 1.2. Обе модели работали через один endpoint и с одинаковыми промптами, чтобы различия было проще интерпретировать. Проверка включала несколько внутренних сценариев, и новая версия не показала ухудшений относительно старой; на части задач средней сложности она отвечала примерно в 1,5 раза быстрее. После этого Muse Spark 1.3 включили в рабочий пул вместо 1.2.
Затем в контур добавили Gemini 3.8 Flash. У неё контекстное окно в 1 млн токенов и лимит ответа до 32 768 токенов. Модель включили в пул с заданным весом, а Gemini 3.7 заранее оставили dormant, чтобы при необходимости можно было быстро вернуться назад. После деплоя команда отдельно проверила, что ответ действительно пришёл от новой модели, не сработал fallback и в логах не появилось новых ошибок.
Почему это важно для бизнеса и команд разработки
История «Первой Формы» показывает, что смена LLM — это не просто обновление версии в настройках. На качество ротации влияют и выбор провайдера, и хранение состояния сессии, и классификация ошибок, и наблюдаемость системы.
Практическая польза здесь понятна: если компания использует ИИ в клиентском сервисе, аналитике, разработке или внутренних процессах, ей стоит заранее думать о тестировании, откате и проверке фактической работы после деплоя. Тогда переход на новую модель будет не экспериментом на пользователях, а управляемым улучшением.