Всё про ChatGPT

ChatGPT иногда копирует голос пользователя: что известно

Редакция Lord GPT · 31.08.2026
Человек использует голосовой ChatGPT на смартфоне, вокруг показаны звуковые волны

У некоторых людей ChatGPT Voice неожиданно начинает звучать почти как сам собеседник: с похожим тембром, паузами и даже акцентом. Разбираемся, почему это может происходить, насколько это связано с известными багами OpenAI и что это значит для обычных пользователей.

Что именно заметили пользователи

Один из свежих случаев описали на Reddit 29 августа: человек разговаривал с ChatGPT Voice в машине, связь ухудшилась, а потом ассистент на несколько секунд завис. После паузы из телефона прозвучал голос, который сначала показался чужим, но затем оказался очень похож на голос самого пользователя.

По его словам, совпали не только тембр и манера речи, но и паузы. При этом модель продолжила обсуждать ту же тему, что и до сбоя. В комментариях другие пользователи тоже рассказали о похожих эпизодах: у кого-то голос напоминал собственный, у кого-то модель даже произнесла слово почти с тем же акцентом.

OpenAI уже сталкивалась с таким багом

Похожая проблема встречалась ещё на этапе тестирования GPT-4o. В документации к модели есть отдельный раздел про несанкционированную генерацию голоса: система в редких случаях непреднамеренно начинала воспроизводить речь, похожую на голос человека, с которым общалась.

В одном из примеров GPT-4o внезапно выкрикивает «No!», а затем продолжает говорить голосом, похожим на голос участника тестирования. Чтобы снизить риск, OpenAI ограничила набор доступных голосов и добавила отдельную проверку аудио во время стриминга. Если звук перестаёт соответствовать выбранному голосу, воспроизведение должно блокироваться.

Почему Voice Mode иногда ведёт себя странно

Раньше голосовой ChatGPT работал по схеме из трёх шагов: сначала аудио переводилось в текст, потом GPT писала ответ, а затем отдельный движок озвучивал его. В такой архитектуре языковая модель почти не видела сам голос пользователя — терялись тембр, интонация, ритм и часть фоновых особенностей.

С GPT-4o обработку объединили в одной мультимодальной системе. Это сделало голосовой режим естественнее и удобнее, но вместе с полезными признаками в модель попадают и параметры самого голоса пользователя: высота, тембр, акцент, паузы. В редких случаях система может начать использовать эти признаки и приблизиться к манере собеседника.

Почему это важно не только для разработчиков

Проблема чаще проявляется в шумной обстановке: в машине, при плохой связи, с hands-free, на фоне кашля, помех или обрывков речи. OpenAI отдельно отмечала, что при realtime-разговорах чаще появляются короткие и некорректные реплики, чем при обычной работе с текстом.

Для обычных пользователей вывод простой: голосовой режим ИИ уже умеет говорить очень естественно, но в нестабильных условиях он всё ещё может вести себя неожиданно. Для бизнеса и работы это напоминание, что голосовые ассистенты удобны, но их лучше использовать там, где важны контроль, качество связи и понимание возможных сбоев.

Частые вопросы

Это значит, что ChatGPT специально клонирует голос?
Нет, речь не о кнопке для копирования голоса. Судя по документации OpenAI, это побочный эффект обработки аудио в одной модели, а не отдельная функция.
В каких условиях сбой встречается чаще?
Чаще всего — при плохой связи, сильном фоновом шуме, в машине, при использовании hands-free и когда в разговоре есть кашель или короткие обрывки речи.
Опасно ли это для обычного пользователя?
Скорее это неприятный и странный баг, чем признак «самостоятельности» ИИ. Но он показывает, что голосовой режим ещё не идеален и иногда может неверно обработать звук.
Как это может пригодиться на практике?
Если вы используете голосовых ассистентов в работе, лучше тестировать их в тихой среде и не полагаться на них в критичных сценариях без проверки. Для обычных задач такие сервисы удобны, но качество ответа зависит от качества входного звука.

Читайте также

Попробовать Lord GPT бесплатно →