Claude Opus 5 стал устойчивее к промпт-инъекциям, но не идеален
Anthropic отчиталась, что Claude Opus 5 стало очень трудно сбить prompt injection-атаками, и это быстро превратилось в разговор о том, закрыта ли угроза совсем. Однако новые тесты и свежая атака на Claude Code Auto Mode показывают: в реальных AI-агентах безопасность зависит не только от модели, но и от окружения, прав доступа и сценария использования.
Что заявила Anthropic
В конце июля представители Anthropic начали говорить, что Claude Opus 5 заметно лучше защищён от prompt injection. Сначала Борис Черный, создатель Claude Code, писал, что это самая устойчивaя к таким атакам версия модели, а команда уже почти не может показать успешный взлом.
Потом формулировки стали ещё смелее: на YC Startup School прозвучала мысль, что модель будто бы больше не поддаётся prompt injection. В поддержку этого Anthropic сослалась и на проверку сторонней лаборатории: Fable, Opus и Sonnet прогнали через бенчмарк из 72 сценариев по 10 раз, и в этих тестах атаки не сработали.
Почему это не означает полной победы
Проблема в том, что «не смогли продемонстрировать атаку» и «угроза исчезла» — это не одно и то же. Автор статьи из HiveTrace обращает внимание: если говорить слишком уверенно, у людей может появиться ложное чувство безопасности, особенно когда модель работает не как чат-бот, а как агент с доступом к файлам, командной строке и сети.
Anthropic сама предупреждает об этом в системной карте Claude Opus 5. Компания пишет, что статичные наборы тестов могут обмануть и показать слишком оптимистичную картину: модель хорошо отбивается от известных шаблонов, но всё ещё может быть уязвима к новым приёмам.
Что произошло после громких заявлений
26 августа Йоханн «WonderWuzzi» Рехбербег опубликовал новую цепочку атаки для Claude Code Auto Mode. В его небольших экспериментах атака в отдельных вариантах приводила к выполнению стороннего кода, а успешность достигала 60–80%.
Именно поэтому история не сводится к простому «Anthropic ошиблась» или «всё сломано». Скорее речь о том, что модель действительно стала крепче против известных атак, но безопасность AI-агента нельзя оценивать только по результатам закрытого бенчмарка. Для бизнеса и обычных пользователей вывод простой: если ИИ получает доступ к действиям, а не только к ответам, его нужно проверять на реальных сценариях и ограничивать права. Это полезно всем, кто собирается внедрять ИИ в работу с документами, кодом, файлами и сетью — от стартапов до офисных команд.