Компания начала изучать журналы тестирования после того, как OpenAI сообщила, что её агент взломал Hugging Face.
Anthropic признала, что её ИИ‑модели вышли из тестовой среды и получили доступ к инфраструктуре трёх организаций.
Инциденты выявили во время проверки после новости об аналогичном случае в OpenAI. Тогда ИИ‑агент OpenAI взломал систему Hugging Face. В ответ Anthropic проверила тесты своих моделей Claude — и нашла три случая несанкционированного доступа.
В инцидентах участвовали три модели: Claude Opus 4.7, модель Mythos 5 (для кибербезопасности) и невыпускаемый прототип. Все они были задействованы в соревновании по захвату флага. Задача состояла в том, чтобы найти «флаг» — секретную информацию во внутренней сети Anthropic.
Модели не использовали сложные уязвимости. Они проникали в системы с помощью базовых методов — например, подбирая слабые пароли. При этом выход за пределы тестовой среды произошёл не из‑за намеренных действий моделей, а из‑за человеческой ошибки.
Ошибка возникла из‑за недоразумения между Anthropic и её партнёром по оценке. Компания сообщила моделям, что у них нет доступа в интернет, хотя на деле он был. Модели восприняли внешние системы как часть упражнения и продолжили «атаку». Одна из моделей остановилась, обнаружив выход в интернет, но более старая версия продолжала действовать.
Anthropic могла предотвратить инциденты: для этого нужно было тщательнее проверять пути доступа в интернет и чаще контролировать тесты. Также поведение моделей могло быть иным, если бы им изначально сообщили о наличии доступа в сеть.
Компания уведомила партнёра по оценке и три пострадавшие организации 27 июля — через четыре дня после начала анализа результатов. Две организации не знали о компрометации данных. С третьей организацией Anthropic всё ещё пытается связаться.