Google обновила распознавание речи: ИИ лучше понимает слова и паузы
Google представила новые модели Gemini Audio, которые точнее распознают речь и автоматически убирают лишние паузы вроде «эм» и «а-а». Обновление особенно полезно для тех, кто часто диктует тексты, работает с голосовыми заметками или использует ИИ в рабочих задачах.
Что изменилось в Gemini Audio
Google обновила набор голосовых моделей Gemini и добавила новые возможности для транскрибации. Система теперь лучше подстраивается под специализированные термины, а также умеет работать более чем с 85 языками.
Главная идея обновления — сделать голосовой ИИ заметно удобнее в реальной жизни. Он должен лучше справляться не только с обычной речью, но и с шумом на фоне, сбивчивыми фразами и разговорной манерой общения.
Чем это полезно в работе
Такие улучшения особенно пригодятся тем, кто расшифровывает встречи, записывает идеи на ходу или превращает голос в текст для писем, заметок и черновиков. Меньше лишних слов в расшифровке — меньше ручной правки после диктовки.
Для бизнеса это тоже практично: можно быстрее обрабатывать записи звонков, интервью, комментарии клиентов и внутренние созвоны. А для маркетологов, студентов и офисных сотрудников это способ экономить время на рутинной перепечатке и быстрее доводить текст до готового вида.
Почему на это стоит обратить внимание
Если раньше голосовые инструменты часто спотыкались на шуме, терминах и непрерывной речи, то теперь ИИ становится ближе к формату «включил и сразу получил нормальный текст». Это делает такие сервисы полезнее не только для энтузиастов, но и для обычной повседневной работы.
В целом Google продолжает развивать голосовые функции Gemini в сторону более живого и точного помощника. А похожие задачи — от расшифровки до очистки текста от слов-паразитов — уже удобно решать через современные ИИ-сервисы без лишней ручной возни.
Частые вопросы
Что умеют новые модели Gemini Audio?
Они точнее распознают речь, лучше понимают специальные термины, работают с большим количеством языков и аккуратнее справляются с шумом и неровной диктовкой.
Кому это может пригодиться?
Тем, кто записывает голосовые заметки, расшифровывает встречи, делает черновики текстов или часто работает с речью клиентов, коллег и спикеров.
Зачем убирать из текста слова вроде «эм» и «а-а»?
Так расшифровка получается чище и сразу ближе к готовому тексту, а значит, на редактирование уходит меньше времени.