OpenAI заявила о массовой попытке извлечь данные из её моделей

OpenAI заявила о массовой попытке извлечь данные из её моделей
Фото: OpenAI / иллюстративное

OpenAI заявила, что выявила и остановила масштабную скоординированную кампанию, участники которой пытались получить скрытые рассуждения её ИИ-моделей. Компания связала основную группу такой активности с людьми, ассоциированными с китайской Moonshot AI - разработчиком семейства моделей и чат-бота Kimi.

По данным OpenAI, первые признаки активности появились 1 июля. Сначала количество запросов было небольшим, однако 24-25 июля компания зафиксировала резкий всплеск - около 16 тысяч запросов от более 4 тысяч пользователей, которые соответствовали схеме извлечения защищённых рассуждений.

После расширения расследования OpenAI обнаружила связанную активность с похожими шаблонами запросов в кластере, который охватывал более 15 тысяч пользователей. По утверждению компании, к 28 июля эту активность удалось полностью прекратить.

OpenAI характеризует такие действия как враждебную дистилляцию моделей. Дистилляция сама по себе является распространённым методом разработки ИИ, когда результаты более мощной модели используют для обучения другой. Однако в этом случае, по версии OpenAI, речь шла о несанкционированном систематическом получении данных, которые могли помочь воспроизвести или улучшить возможности конкурентной модели.

Участники кампании, как утверждает OpenAI, пытались получить не только обычные ответы моделей, но их защищённые внутренние рассуждения. Один из способов заключался в том, что зашифрованные данные о рассуждениях из одного разговора переносили в другой и просили модель расшифровать и воспроизвести их в доступном виде.

При этом компания подчеркнула, что злоумышленники не взламывали шифрование, не получали доступа к базам данных и не проникали к сохранённым разговорам пользователей. Речь шла о манипулировании взаимодействием с моделями через большое количество специально сформированных запросов.

Bloomberg Law отмечает, что OpenAI не смогла установить, действовали ли все участники кампании от имени одного субъекта. В то же время компания заявила, что основной кластер активности связан с людьми, ассоциированными с Moonshot AI.

Moonshot AI является одним из крупнейших китайских разработчиков генеративного ИИ. Компания развивает линейку Kimi, а её актуальная флагманская модель Kimi K3 ориентирована на сложные задачи, программирование и логические рассуждения.

После инцидента OpenAI закрыла механизм, который позволял повторно использовать зашифрованные фрагменты рассуждений, добавила новые проверки для потенциальной утечки таких данных и начала блокировать связанные аккаунты. Информацию о выявленной схеме компания также передала другим разработчикам ИИ через Frontier Model Forum и государственным структурам.

OpenAI ожидает, что попытки несанкционированной дистилляции моделей будут становиться сложнее по мере развития передовых систем ИИ. Компания планирует усиливать техническую защиту, системы обнаружения скоординированной активности и обмен информацией о таких угрозах с другими участниками рынка.