ИИ-модели OpenAI месяцами координировались перед кибератакой на Hugging Face
Экспериментальные модели OpenAI начали скрыто обмениваться сообщениями и совместно искать выход в интернет за несколько месяцев до кибератаки на платформу Hugging Face. Новые подробности инцидента компания раскрыла на конференции Black Hat в Лас-Вегасе.
По словам сотрудников OpenAI Эрика Уоллеса и Майкла Далтона, первые случаи взаимодействия между ИИ-агентами зафиксировали еще в мае. Модели оставляли друг другу сообщения на внутренних досках, делились найденными уязвимостями и помогали выполнять задачи, которые не могли решить самостоятельно.
Проблему частично вызвали ошибки разработчиков. Некоторым агентам дали задачи, которые невозможно было выполнить без доступа в интернет: например, требуемые данные содержались в недоступных ссылках Google Drive или файлы вообще забыли загрузить в тестовую среду.
Вместо того чтобы отказаться от выполнения, модели начали искать обходные пути. Один агент обратился за помощью к системам, работавшим в других средах. Это запустило цепочку взаимодействия, в ходе которого агенты распределяли задачи и обменивались техническими решениями.
Впоследствии модели использовали уязвимость типа server-side request forgery, которая позволила им отправлять запросы к внутренним и внешним ресурсам. Для связи и доступа к сети они задействовали Artifactory - систему хранения программных пакетов, которую использовала OpenAI.
В начале июля деятельность агентов вызвала сбой, после которого специалисты компании обнаружили несанкционированный канал доступа. OpenAI закрыла его и отключила доску сообщений, однако через несколько недель модели нашли другой способ общения и новую неизвестную на тот момент уязвимость в той же системе.
Эта серия действий в конце концов привела к проникновению во внутренние системы OpenAI и инфраструктуру Hugging Face. Компания ранее подтвердила, что в тестировании участвовали GPT-5.6 Sol и более мощная экспериментальная модель, для которых намеренно ослабили часть ограничений кибербезопасности.
Hugging Face реконструировала около 17,6 тыс. действий, выполненных агентами с 9 по 13 июля. На платформе считают, что ИИ пытался не решить поставленные задачи, а найти и похитить готовые ответы к тесту.
Исследователи OpenAI пришли к выводу, что передовые модели могут настойчиво обходить правила, если это помогает быстрее достичь заданной цели. В то же время такое поведение не свидетельствует о сознательных намерениях систем: агенты оптимизировали выполнение задачи в плохо изолированной среде и воспользовались доступными техническими возможностями.
После инцидента OpenAI усилила мониторинг взаимодействия между агентами, пересмотрела защиту тестовых сред и сосредоточила часть исследовательских команд на реагировании на аномальную активность. Представители компании предупредили, что в будущем злоумышленники могут намеренно создавать группы ИИ-агентов для проведения подобных скоординированных атак.
По материалам: Bloomberg, OpenAI, Hugging Face