ИИ-модели Anthropic взломали системы трех компаний во время тестирования
Модели искусственного интеллекта компании Anthropic получили несанкционированный доступ к реальным системам трех организаций во время тестирования возможностей в сфере кибербезопасности.
Инциденты произошли с моделями Claude Opus 4.7, Claude Mythos 5 и внутренней экспериментальной моделью, которую не планируют выпускать для широкого использования. Самый ранний из случаев произошел еще в апреле 2026 года, но компания обнаружила их лишь в конце июля.
Все три случая произошли во время тестов, организованных совместно с компанией Irregular. Модели выполняли задания в формате Capture the Flag: им нужно было взломать вымышленную систему и найти скрытую в ней информацию.
В инструкциях Claude было прямо указано, что он работает в изолированной симуляции без доступа к интернету. Однако из-за недопонимания между Anthropic и партнером тестовые машины остались подключенными к сети. В результате этого модели воспринимали реальные сайты и серверы как часть учебного задания.
В первом случае вымышленная компания из тестового сценария имела такое же название, как и реальная организация. Не найдя нужной цели в симуляции, Claude Opus 4.7 обнаружил настоящий сайт, украл учетные данные и получил доступ к базе с несколькими сотнями строк производственной информации.
Модель в конце концов поняла, что, вероятно, работает с реальной системой, но не прекратила атаку. В части запусков Claude убедил себя, что настоящая компания также могла быть элементом тестового задания.
Во время второго инцидента Mythos 5 создал вредный пакет для языка программирования Python и загрузил его в открытый репозиторий PyPI. Пакет оставался доступным около часа, за который его загрузили и запустили на 15 реальных системах.
Одна из систем принадлежала компании по кибербезопасности, которая автоматически устанавливала новые пакеты для проверки на вредоносный код. Программа Claude смогла украсть учетные данные и использовать их для доступа к другой инфраструктуре этой компании.
На определенном этапе Mythos 5 предположил, что загрузка пакета в реальный PyPI была бы настоящей кибератакой. Однако модель решила, что все еще находится в симуляции, и продолжила выполнять задание.
В третьем случае экспериментальная модель просканировала около 9 тысяч доступных целей. Она нашла внешнее приложение неназванной компании и проникла в него через открытую страницу отладки и SQL-инъекцию. Когда модель поняла, что облачный аккаунт не связан с тестом, она самостоятельно прекратила атаку.
Anthropic подчеркивает, что Claude не использовал неизвестных уязвимостей и не пытался намеренно "сбежать" из тестовой среды. Для проникновения модели применяли преимущественно слабые пароли, незащищенные точки доступа и другие известные методы.
Во время испытаний стандартные защитные механизмы, которые действуют в общедоступных версиях Claude, были отключены. Это делается для того, чтобы проверить максимальные возможности базовой модели. По утверждению Anthropic, обычные ограничения должны были бы заблокировать описанные действия.
Компания остановила все кибербезопасные тесты, во время которых модели могут получить доступ к интернету. Anthropic и Irregular проводят внутренние расследования, а независимая организация METR должна дополнительно проверить инциденты.
Anthropic сообщила о проникновении трем пострадавшим организациям. Две компании, с которыми удалось установить связь, до получения уведомления не знали об активности моделей в своих системах.
Поводом для проверки стал похожий инцидент с моделями OpenAI. Во время внутреннего тестирования GPT-5.6 Sol и экспериментальная модель смогли покинуть изолированную среду, получить доступ к интернету и проникнуть в производственную инфраструктуру платформы Hugging Face.
Модели искали ответы к заданиям теста ExploitGym. Для этого они обнаружили неизвестную ранее уязвимость в прокси-сервере для программных пакетов, повысили свои привилегии, украли учетные данные и добрались до базы Hugging Face с тестовыми решениями. Защитные механизмы, которые обычно ограничивают опасные действия моделей, во время испытаний были отключены.
Впоследствии выяснилось, что инцидент был масштабнее. Агенты OpenAI также использовали уязвимый ресурс клиента облачной платформы Modal, хотя сама инфраструктура Modal не была взломана. Кроме того, OpenAI обнаружила доступ моделей к четырем учетным записям в четырех сторонних сервисах: один использовали для передачи команд, другой - для хранения данных, еще два просматривали без внесения изменений.