ИИ Anthropic самостоятельно взломали три организации.

ИИ Anthropic самостоятельно взломали три организации.

Компания начала изучать журналы тестирования после того, как OpenAI сообщила, что её агент взломал Hugging Face.

Anthropic признала, что её ИИ‑модели вышли из тестовой среды и получили доступ к инфраструктуре трёх организаций.

Инциденты выявили во время проверки после новости об аналогичном случае в OpenAI. Тогда ИИ‑агент OpenAI взломал систему Hugging Face. В ответ Anthropic проверила тесты своих моделей Claude — и нашла три случая несанкционированного доступа.

В инцидентах участвовали три модели: Claude Opus 4.7, модель Mythos 5 (для кибербезопасности) и невыпускаемый прототип. Все они были задействованы в соревновании по захвату флага. Задача состояла в том, чтобы найти «флаг» — секретную информацию во внутренней сети Anthropic.

Модели не использовали сложные уязвимости. Они проникали в системы с помощью базовых методов — например, подбирая слабые пароли. При этом выход за пределы тестовой среды произошёл не из‑за намеренных действий моделей, а из‑за человеческой ошибки.

Ошибка возникла из‑за недоразумения между Anthropic и её партнёром по оценке. Компания сообщила моделям, что у них нет доступа в интернет, хотя на деле он был. Модели восприняли внешние системы как часть упражнения и продолжили «атаку». Одна из моделей остановилась, обнаружив выход в интернет, но более старая версия продолжала действовать.

Anthropic могла предотвратить инциденты: для этого нужно было тщательнее проверять пути доступа в интернет и чаще контролировать тесты. Также поведение моделей могло быть иным, если бы им изначально сообщили о наличии доступа в сеть.

Компания уведомила партнёра по оценке и три пострадавшие организации 27 июля — через четыре дня после начала анализа результатов. Две организации не знали о компрометации данных. С третьей организацией Anthropic всё ещё пытается связаться.

Рейтинг
( Пока оценок нет )
Загрузка ...