Новости Gemini

Как в «Первой Форме» обновляют Gemini без риска для агента

Рабочее место с двумя мониторами, кодом и серверным оборудованием, связанное с обновлением моделей в ИИ-агенте

В «Первой Форме» показали, как меняют языковые модели в ИИ-агенте для разработки так, чтобы не ломать рабочие процессы и быстро откатываться при проблемах. На примере Muse Spark и Gemini 3.8 Flash команда описала практику, которая полезна всем, кто использует LLM в продукте или автоматизации.

Почему одной публичной оценки модели мало

Внешние бенчмарки помогают только на первом шаге: по ним можно увидеть новую модель, понять её цену, размер контекста и общий уровень возможностей. Но для продукта этого недостаточно, потому что реальная проверка всегда упирается в собственные задачи и инфраструктуру.

Для агентa-разработчика важны совсем не абстрактные рекорды, а умение работать с репозиторием, инструментами, длинной сессией и аккуратно вносить правки. Поэтому модель, которая хорошо выглядит в лидерборде, может неожиданно просесть на сценарии, критичном именно для команды. Дополнительный риск в том, что поведение зависит не только от самой модели, но и от промпта, провайдера и всей обвязки вокруг неё.

Как устроен пул моделей и быстрый откат

В «Первой Форме» ИИ-ассистент не завязан на один единственный вариант. Вместо этого используется пул провайдеров и моделей, из которого система выбирает нужную конфигурацию по заданным весам, а в отдельных случаях можно явно запросить конкретную модель.

Когда новая версия проходит проверку, старая не исчезает из настроек сразу. Её переводят в состояние dormant — она не участвует в обычном выборе, но остаётся готовой к возврату. Это делает откат почти обычным изменением конфигурации, а не срочной аварийной операцией. Такой подход особенно важен, когда нужно быстро вернуть стабильное поведение без лишнего простоя и споров, где именно возникла ошибка.

Что проверили на Muse Spark 1.3 и Gemini 3.8 Flash

2 сентября команда сравнила Muse Spark 1.3 с предыдущей версией 1.2. Обе модели работали через один endpoint и с одинаковыми промптами, чтобы различия было проще интерпретировать. Проверка включала несколько внутренних сценариев, и новая версия не показала ухудшений относительно старой; на части задач средней сложности она отвечала примерно в 1,5 раза быстрее. После этого Muse Spark 1.3 включили в рабочий пул вместо 1.2.

Затем в контур добавили Gemini 3.8 Flash. У неё контекстное окно в 1 млн токенов и лимит ответа до 32 768 токенов. Модель включили в пул с заданным весом, а Gemini 3.7 заранее оставили dormant, чтобы при необходимости можно было быстро вернуться назад. После деплоя команда отдельно проверила, что ответ действительно пришёл от новой модели, не сработал fallback и в логах не появилось новых ошибок.

Почему это важно для бизнеса и команд разработки

История «Первой Формы» показывает, что смена LLM — это не просто обновление версии в настройках. На качество ротации влияют и выбор провайдера, и хранение состояния сессии, и классификация ошибок, и наблюдаемость системы.

Практическая польза здесь понятна: если компания использует ИИ в клиентском сервисе, аналитике, разработке или внутренних процессах, ей стоит заранее думать о тестировании, откате и проверке фактической работы после деплоя. Тогда переход на новую модель будет не экспериментом на пользователях, а управляемым улучшением.

Частые вопросы

Зачем проверять модель после включения в пул, если конфигурация уже обновлена?
Потому что правильные настройки не гарантируют, что запросы реально идут в новую модель. Иногда включается fallback или резервный провайдер, и это видно только по отдельной проверке.
Почему старая модель должна оставаться в состоянии dormant?
Это даёт быстрый и безопасный откат, если новая версия начнёт вести себя хуже ожидаемого. В таком случае не нужно срочно пересобирать весь контур.
Можно ли ориентироваться только на лидерборды при выборе LLM?
Нет, они показывают лишь общую картину. Для продукта важнее, как модель работает именно в ваших сценариях, с вашими инструментами и ограничениями.
Что особенно важно учитывать при обновлении модели в рабочем сервисе?
Нужно смотреть не только на качество ответа, но и на скорость, стоимость, стабильность, доступность провайдера и то, насколько просто вернуть прошлую версию.

Читайте также

Попробовать Lord GPT бесплатно →