Новости Qwen

Почему Qwen и другие LLM иногда отказывают в ответе

Стол с распечатками, планшетом, двумя мониторами с кодом и серверным оборудованием, связанными с исследованием отказов LLM

Если модель внезапно пишет, что не может помочь, это не всегда «характер» нейросети. Отказ может идти из системной инструкции, фильтра сервиса или даже из самих весов модели, и это важно понимать тем, кто использует ИИ в работе или тестирует открытые версии.

Откуда берётся отказ в чате

Пользователь видит один и тот же результат — вежливый отказ, — но внутри сервисов причины могут быть разными. Запрос может остановить системная инструкция, отдельный классификатор до генерации ответа, фильтр после генерации или даже перевод на более ограниченную модель.

Поэтому надпись Uncensored на Hugging Face не означает, что модель «с нуля» заново обучили на огромном объёме данных. Иногда речь идёт о том, что разработчики изменили поведение на уровне инструкции, фильтров или отдельных параметров модели.

Как модель учится отвечать безопасно

Базовая LLM сначала учится следующему токену: она просто предсказывает продолжение текста по огромному массиву данных. Но это ещё не помощник для чата — на этом этапе модель может продолжать фразы как угодно, в том числе писать от лица пользователя или выдавать бессвязный текст.

Чтобы превратить её в помощника, применяют настройку после базового обучения. Сначала идёт SFT — обучение на парах «запрос — хороший ответ», где модель учится следовать инструкции и держать формат диалога. Потом часто используют предпочтения: люди или другая модель сравнивают варианты ответов, а полезный и безопасный вариант получает больше веса. Для этого применяют RLHF, RLAIF и DPO.

В статьях по теме это часто называют alignment, а его безопасную часть — safety alignment. Именно на этой стадии в модель могут заложить привычку отказываться от опасных запросов или мягко переводить разговор в безопасное русло.

Можно ли убрать отказ из самой модели

Да, и именно этим занимаются некоторые авторы открытых моделей. Но речь не о простом выключателе censorship=false: поведение распределено по множеству весов, то есть по миллиардам чисел, которые меняются во время обучения или специального редактирования.

В 2024 году исследователи описали идею, что отказ в языковых моделях может опираться на одно направление в векторном пространстве. Если упростить, это значит, что у модели есть внутренний сигнал, который подталкивает её к ответу «не могу помочь» вместо прямого ответа. Важный вывод здесь практический: отказ — это не только правило в коде, а выученное поведение, которое можно ослаблять или усиливать.

Зачем это знать обычному пользователю

Для разработчиков, маркетологов, аналитиков и студентов это полезно хотя бы потому, что помогает выбирать подходящую модель под задачу. Если нужен спокойный разбор текста, работа с кодом, черновики ответов или менее строгий стиль, стоит понимать, где именно сервис ограничивает поведение: в самой модели или на уровне платформы.

Это также объясняет, почему две версии одной и той же Qwen, Gemma или GLM могут вести себя по-разному. В одной будет жёсткий фильтр, в другой — ослабленный отказ, а в третьей часть ограничений перенесут прямо в обучение. Для повседневной работы это значит одно: если модель упирается в отказ, иногда проще попробовать другую версию или другой сервис, чем считать, что ИИ «ничего не умеет».

Частые вопросы

Почему одна и та же модель в разных сервисах отвечает по-разному?
Потому что сервис может добавлять свои фильтры, системные инструкции или даже отправлять запрос в другую модель. Название модели может быть одинаковым, а поведение — заметно отличаться.
Uncensored означает, что модель вообще без ограничений?
Не обязательно. Часто это просто версия с ослабленными фильтрами или изменённой настройкой поведения, а не полностью «свободная» модель.
Можно ли просто удалить отказ одной строкой?
Если бы отказ был обычной проверкой в коде, так и было бы. Но в реальности он часто распределён по весам модели и связан с обучением, поэтому его не так просто убрать.
Зачем обычному человеку разбираться в этих механизмах?
Чтобы лучше выбирать модель под задачу и понимать, почему ИИ внезапно отказывается работать. Это экономит время, когда нужен ответ для работы, учёбы или черновика текста.

Читайте также

Попробовать Lord GPT бесплатно →