Новости Gemini

Gemini получила аватара для живого общения в реальном времени

Планшет, микрофон, камера и мониторы в переговорной для демонстрации голосового AI-аватара

Google показала Gemini 3.8 Live with Live Avatar — версию модели, которая отвечает не просто текстом или голосом, а анимированным персонажем с мимикой и движением губ. Это может упростить создание виртуальных консультантов, помощников и обучающих сервисов, где важны живое общение и визуальное присутствие.

Что умеет новый режим Gemini

Gemini 3.8 Live принимает голос, текст, изображения и видео, а в ответ выдаёт аватара, который говорит с пользователем синхронно с речью. У персонажа меняется мимика, а губы подстраиваются под произнесённые слова.

Google подчёркивает, что это не отдельная «говорящая голова», прикрученная к чат-боту. Аватар встроен прямо в разговорную модель: он может видеть собеседника, слушать его и, если нужно, обращаться к внешним сервисам во время беседы.

Для каких задач это может пригодиться

В демонстрации Google виртуальный сотрудник помогает регистрировать гостя в отеле: он разговаривает с человеком и одновременно проверяет данные в системе бронирования. Именно в таких сценариях технология выглядит наиболее полезной — когда человеку нужен быстрый ответ, а системе нужно параллельно что-то проверить.

Google прямо называет несколько направлений, где формат может сработать лучше всего: поддержка клиентов, обучение, игровые персонажи, цифровые экскурсоводы, администраторы и консультанты. Для бизнеса это шанс дать сервису «лицо» без отдельной команды аниматоров и без сложной связки из нескольких инструментов.

Как работает разговор и что у него внутри

Модель умеет вести диалог с переключением между 97 языками прямо по ходу разговора. При этом синхронизация губ и выражение лица должны подстраиваться под новую речь без перезапуска сессии.

В Gemini 3.8 Live по умолчанию включены две дополнительные функции. Affective dialogue помогает учитывать темп, паузы, интонацию и эмоциональные сигналы собеседника, а Proactive audio отсеивает фоновые шумы и посторонние разговоры, чтобы агент реагировал только когда обращаются именно к нему. Это особенно полезно для офиса, магазина или гостиницы, где вокруг постоянно что-то происходит.

Отдельно Google сделала ставку на вызов внешних функций. Модель может, например, проверить бронь, найти заказ в CRM или запросить данные из внутренней системы, не обрывая беседу. Вся связка работает через WebSocket, а значит приложение и модель обмениваются данными постоянно, без нового запроса на каждую реплику.

Ограничения и защита от злоупотреблений

Google разрешает использовать готовых персонажей и наборы голосов, а компаниям — создавать собственных аватаров по одному референсному изображению. Но это доступно пока не всем: пользовательские аватары открывают только отдельным клиентам после согласования с Google Cloud. Также нельзя использовать изображения несовершеннолетних и знаменитостей, а на лицо и голос должны быть права.

Чтобы отличать сгенерированный контент от реального, аудио и видео получают невидимую маркировку SynthID. При этом Google сама предупреждает, что Live Avatar рассчитан только на короткие сессии — несколько минут, а не на долгую непрерывную работу. Возможны задержки, тайм-ауты и ошибки, а знания модели актуальны только до января 2025 года, поэтому для свежих данных ей нужен внешний источник.

Частые вопросы

Чем Live Avatar отличается от обычного чат-бота с голосом?
Здесь аватар встроен прямо в модель и участвует в разговоре в реальном времени. Он не только говорит, но и видит, слышит, реагирует на интонацию и может запускать внешние сервисы во время беседы.
Где такая технология может быть полезна в работе?
В поддержке клиентов, на ресепшене, в обучении, в гостиницах, магазинах и других сервисах, где важны короткие диалоги и визуальное общение. Это помогает сделать интерфейс более живым без отдельной анимационной системы.
Можно ли сделать собственного аватара?
Да, но не для всех сразу. Google разрешает создавать своих персонажей по референсному изображению только отдельным клиентам после согласования с Google Cloud.
Как понять, что это не живой человек?
Google добавляет в сгенерированные аудио и видео невидимую маркировку SynthID. Она не заметна пользователю, но помогает проверить происхождение контента, если платформа поддерживает такую проверку.

Читайте также

Попробовать Lord GPT бесплатно →