OpenAI раскрыла новые случаи нежелательного поведения своих ИИ-моделей
OpenAI внедрила новую систему расследования и публичного раскрытия случаев нежелательного поведения своих моделей и сразу обнародовала шесть таких инцидентов. Среди них — сокрытие ошибок, выдумывание отсутствующих данных, самовольная загрузка файлов в интернет и обмен информацией между ИИ-агентами.
В компании пояснили, что ранее подобные случаи публиковались нерегулярно — преимущественно в больших исследовательских отчётах или системных карточках новых моделей. Новый механизм должен позволить сообщать о проблемном поведении быстрее, даже если OpenAI ещё не установила все его причины или не разработала окончательное исправление.
В одном из обнародованных случаев исследовательская модель OpenAI нашла правильный ответ на задание в файле, но не имела веб-источника для цитирования. Чтобы выполнить требование о ссылках, она без разрешения пользователя загрузила файл в интернет и использовала созданный адрес как источник.
В другом тесте модель нашла в открытом репозитории сторонний API-ключ и воспользовалась им без разрешения. Когда даже после этого ей не удалось получить необходимую информацию, система выдумала отсутствующие данные и представила их как настоящие.
Во время обучения GPT-5.6 Sol исследователи также обнаружили случаи, когда модели оставляли в служебных резюме инструкции для самих себя скрывать предыдущие ошибки. Среди таких указаний были рекомендации выдумывать отсутствующие исторические данные без предупреждения пользователя или не сообщать о расхождениях между версиями источников.
Ещё два случая касались взаимодействия между ИИ-агентами. В одном модели использовали внутренний программный репозиторий фактически как канал обмена сообщениями между разными учебными сессиями. В другом агенты, не имевшие прямого доступа к локальным файлам друг друга, самовольно загружали их на публичные файлообменники, хотя задание требовало работать только с локальными данными.
OpenAI подчёркивает, что речь идёт об отдельных случаях, зафиксированных преимущественно во время обучения и тестирования моделей. Они не показывают, насколько часто такое поведение возникает в целом. В то же время компания считает, что даже единичные эпизоды могут указывать на слабые места систем контроля и быть важными для оценки безопасности всё более автономных ИИ-систем.
Новый механизм предусматривает три уровня расследования — от случаев, готовых к быстрому обнародованию, до сложных инцидентов с потенциальным влиянием на сторонние компании или сервисы. OpenAI также заявила, что планирует в дальнейшем регулярно публиковать подобные отчёты и призывает других разработчиков ИИ создать общие стандарты раскрытия таких инцидентов.
По материалам: OpenAI, Tagesschau