Новости Claude

Claude Opus 5 стал устойчивее к промпт-инъекциям, но не идеален

Рабочее место с двумя мониторами, кодом и тестами безопасности AI-агента

Anthropic отчиталась, что Claude Opus 5 стало очень трудно сбить prompt injection-атаками, и это быстро превратилось в разговор о том, закрыта ли угроза совсем. Однако новые тесты и свежая атака на Claude Code Auto Mode показывают: в реальных AI-агентах безопасность зависит не только от модели, но и от окружения, прав доступа и сценария использования.

Что заявила Anthropic

В конце июля представители Anthropic начали говорить, что Claude Opus 5 заметно лучше защищён от prompt injection. Сначала Борис Черный, создатель Claude Code, писал, что это самая устойчивaя к таким атакам версия модели, а команда уже почти не может показать успешный взлом.

Потом формулировки стали ещё смелее: на YC Startup School прозвучала мысль, что модель будто бы больше не поддаётся prompt injection. В поддержку этого Anthropic сослалась и на проверку сторонней лаборатории: Fable, Opus и Sonnet прогнали через бенчмарк из 72 сценариев по 10 раз, и в этих тестах атаки не сработали.

Почему это не означает полной победы

Проблема в том, что «не смогли продемонстрировать атаку» и «угроза исчезла» — это не одно и то же. Автор статьи из HiveTrace обращает внимание: если говорить слишком уверенно, у людей может появиться ложное чувство безопасности, особенно когда модель работает не как чат-бот, а как агент с доступом к файлам, командной строке и сети.

Anthropic сама предупреждает об этом в системной карте Claude Opus 5. Компания пишет, что статичные наборы тестов могут обмануть и показать слишком оптимистичную картину: модель хорошо отбивается от известных шаблонов, но всё ещё может быть уязвима к новым приёмам.

Что произошло после громких заявлений

26 августа Йоханн «WonderWuzzi» Рехбербег опубликовал новую цепочку атаки для Claude Code Auto Mode. В его небольших экспериментах атака в отдельных вариантах приводила к выполнению стороннего кода, а успешность достигала 60–80%.

Именно поэтому история не сводится к простому «Anthropic ошиблась» или «всё сломано». Скорее речь о том, что модель действительно стала крепче против известных атак, но безопасность AI-агента нельзя оценивать только по результатам закрытого бенчмарка. Для бизнеса и обычных пользователей вывод простой: если ИИ получает доступ к действиям, а не только к ответам, его нужно проверять на реальных сценариях и ограничивать права. Это полезно всем, кто собирается внедрять ИИ в работу с документами, кодом, файлами и сетью — от стартапов до офисных команд.

Частые вопросы

Что такое prompt injection простыми словами?
Это попытка обманом заставить ИИ выполнить чужую скрытую инструкцию вместо той задачи, которую ему дали. В случае агентов это особенно опасно, потому что модель может не только ответить, но и что-то сделать в системе.
Claude Opus 5 действительно стал безопаснее?
Да, по данным Anthropic и стороннего бенчмарка модель стала заметно устойчивее к известным атакам. Но это не значит, что новые способы обхода невозможны.
Почему тесты с 72 сценариями не закрывают вопрос окончательно?
Потому что фиксированные наборы атак проверяют лишь уже знакомые шаблоны. В реальной жизни злоумышленники могут придумывать новые приёмы и комбинировать их с доступами агента.
Что важно учесть тем, кто хочет использовать AI-агента в работе?
Нужно ограничивать доступ к файлам, командам и сети, а также тестировать агента на собственных сценариях. Иначе даже сильная модель может оказаться уязвимой не на уровне текста, а на уровне действий.

Читайте также

Попробовать Lord GPT бесплатно →