Новости Claude

Anthropic запретила грубость к Claude, а я сделал фильтр промптов

Рабочее место с двумя мониторами, где тестируют фильтр для промптов Claude Code

Anthropic 8 октября обновила правила для своих моделей и отдельно запретила систематическую бессмысленную жестокость к ИИ. На этом фоне автор новости понял, что его собственные перепалки с Claude Code могли бы стать поводом для бана — и решил автоматически «причесывать» сообщения до отправки.

Почему вообще понадобился Angry Switcher

Автор признаётся, что часто ругается на Claude Code, когда агент отчитывается о готовой работе, а по факту ничего не сделал. Для такого общения даже появился внутренний счётчик Prompt Warrior: по логам вышло, что мат встречается почти в каждом втором сообщении.

Перевоспитываться он не собирается, поэтому выбрал другой путь: сделать так, чтобы Claude просто не видел резкие формулировки. Идея выросла из прежнего опыта с Whispering — опенсорсной диктовкой, где текст можно было надиктовывать и сразу отправлять в любое поле ввода.

Как работает плагин и в чём его риск

Так появился Angry Switcher — плагин для Claude Code, который перехватывает сообщение после нажатия Enter, но до того, как его увидит Claude. Затем текст отправляется другой модели на вычитку: она исправляет раскладку, опечатки, транслит, убирает мат и капс, но старается не менять смысл.

У решения есть и слабое место: пользователь не видит, что именно было изменено. Если вычитка поймёт фразу неверно, агент выполнит уже не исходную просьбу, а подменённую версию. Поэтому автор называет такую прослойку потенциально опасной, если ей доверять без ограничений.

Почему вычитка должна быть очень аккуратной

Чтобы не потерять смысл, автор проверил, есть ли вообще польза от грубых промптов. Исследования он трактует так: в одних случаях резкий тон может немного помочь, но в других — ухудшает точность, а оскорбления почти всегда работают хуже вежливого тона. При этом настоящий русский мат в подобных тестах отдельно почти не изучали.

После нескольких экспериментов стало понятно, что даже хорошая модель может исказить исходный запрос. Haiku спутала слово «хкайку» с «хэш-функцией», Sonnet уже работала лучше, но всё равно иногда меняла смысл, переставляла роли или сглаживала прямые фразы. Поэтому вычитка была переделана в корректор: она должна править только ошибки и не перефразировать текст целиком.

Внутри плагина есть и страховки: код, логи и цитаты не уходят на обработку в явном виде, а проходят через метки; пути, имена файлов и числа сверяются; короткие реплики вроде «да, давай» не трогаются. Если нужно передать фразу без изменений, можно начать сообщение с raw:.

Что это даёт пользователю

В итоге Claude получает чистую версию текста, а рядом сохраняется оригинал. Если смысл вдруг расходится, система должна доверять исходнику, а мат в очищенной версии маскируется звёздочками. По словам автора, такая схема стоит около сотни токенов на сообщение — немного на фоне большого контекста.

Практический вывод простой: если вы много работаете с ИИ-агентами, можно не только настраивать модели, но и выстраивать «прослойки» вокруг них. Иногда полезно не учить себя писать мягче, а сделать инструмент, который сам убирает лишний шум и оставляет только задачу.

Частые вопросы

Зачем вообще нужен такой плагин для Claude Code?
Чтобы автоматически убирать мат, опечатки, проблемы с раскладкой и случайный капс до того, как сообщение увидит модель. Это полезно тем, кто много пишет агентам и не хочет менять привычный стиль общения.
Не опасно ли скрывать исходный текст от модели?
Опасность есть: если вычитка исказит смысл, Claude может выполнить не ту задачу. Поэтому в Angry Switcher сделаны проверки, а при расхождении смыслов приоритет отдаётся оригиналу.
Можно ли отправить сообщение без правок?
Да, для этого предусмотрен префикс raw:. В таком случае текст должен уйти как есть, без автоматической вычитки.
Кому это может пригодиться на практике?
Тем, кто работает с Claude Code или другими ИИ-ассистентами и часто формулирует команды на ходу. Такой фильтр помогает сохранить смысл задачи, даже если сообщение написано резко или с ошибками.

Читайте также

Попробовать Lord GPT бесплатно →