Gemini получила аватара для живого общения в реальном времени
Google показала Gemini 3.8 Live with Live Avatar — версию модели, которая отвечает не просто текстом или голосом, а анимированным персонажем с мимикой и движением губ. Это может упростить создание виртуальных консультантов, помощников и обучающих сервисов, где важны живое общение и визуальное присутствие.
Что умеет новый режим Gemini
Gemini 3.8 Live принимает голос, текст, изображения и видео, а в ответ выдаёт аватара, который говорит с пользователем синхронно с речью. У персонажа меняется мимика, а губы подстраиваются под произнесённые слова.
Google подчёркивает, что это не отдельная «говорящая голова», прикрученная к чат-боту. Аватар встроен прямо в разговорную модель: он может видеть собеседника, слушать его и, если нужно, обращаться к внешним сервисам во время беседы.
Для каких задач это может пригодиться
В демонстрации Google виртуальный сотрудник помогает регистрировать гостя в отеле: он разговаривает с человеком и одновременно проверяет данные в системе бронирования. Именно в таких сценариях технология выглядит наиболее полезной — когда человеку нужен быстрый ответ, а системе нужно параллельно что-то проверить.
Google прямо называет несколько направлений, где формат может сработать лучше всего: поддержка клиентов, обучение, игровые персонажи, цифровые экскурсоводы, администраторы и консультанты. Для бизнеса это шанс дать сервису «лицо» без отдельной команды аниматоров и без сложной связки из нескольких инструментов.
Как работает разговор и что у него внутри
Модель умеет вести диалог с переключением между 97 языками прямо по ходу разговора. При этом синхронизация губ и выражение лица должны подстраиваться под новую речь без перезапуска сессии.
В Gemini 3.8 Live по умолчанию включены две дополнительные функции. Affective dialogue помогает учитывать темп, паузы, интонацию и эмоциональные сигналы собеседника, а Proactive audio отсеивает фоновые шумы и посторонние разговоры, чтобы агент реагировал только когда обращаются именно к нему. Это особенно полезно для офиса, магазина или гостиницы, где вокруг постоянно что-то происходит.
Отдельно Google сделала ставку на вызов внешних функций. Модель может, например, проверить бронь, найти заказ в CRM или запросить данные из внутренней системы, не обрывая беседу. Вся связка работает через WebSocket, а значит приложение и модель обмениваются данными постоянно, без нового запроса на каждую реплику.
Ограничения и защита от злоупотреблений
Google разрешает использовать готовых персонажей и наборы голосов, а компаниям — создавать собственных аватаров по одному референсному изображению. Но это доступно пока не всем: пользовательские аватары открывают только отдельным клиентам после согласования с Google Cloud. Также нельзя использовать изображения несовершеннолетних и знаменитостей, а на лицо и голос должны быть права.
Чтобы отличать сгенерированный контент от реального, аудио и видео получают невидимую маркировку SynthID. При этом Google сама предупреждает, что Live Avatar рассчитан только на короткие сессии — несколько минут, а не на долгую непрерывную работу. Возможны задержки, тайм-ауты и ошибки, а знания модели актуальны только до января 2025 года, поэтому для свежих данных ей нужен внешний источник.