OpenAI поставила на паузу обучение самых мощных моделей из-за рисков кибератак
OpenAI временно замедлила разработку своих новейших моделей из-за роста киберрисков. Компания на две недели приостанавливала обучение с подкреплением - reinforcement learning, или RL - для новых моделей, которые готовят к будущему запуску.
Об этом OpenAI сообщила в новом отчете о безопасности разработки моделей.
Компания объяснила решение двумя событиями. Первое - киберинцидент с участием моделей OpenAI и инфраструктуры Hugging Face. Второе - результаты внутренних тестов будущей модели Astra, кибервозможности которой могут достичь критического уровня по собственной системе оценки OpenAI.
Крупнейший тренировочный запуск до сих пор на паузе
Двухнедельную паузу OpenAI использовала для усиления защиты исследовательских сред, дополнительного тестирования их устойчивости и расширения систем мониторинга.
При этом крупнейший запланированный frontier RL-запуск компании до сих пор не возобновили. Вместо него OpenAI проводит меньшие тренировочные циклы и оценки, чтобы проверить поведение моделей, эффективность защитных механизмов и получить больше подтверждений того, что системы действуют согласно поставленным ограничениям.
Сразу после инцидента с Hugging Face компания также остановила часть запусков моделей в исследовательских кластерах, если они могли выполнять программный код или использовать инструменты с доступом в интернет.
Ограниченный и более защищенный режим выполнения кода удалось восстановить довольно быстро. Однако каждую исследовательскую нагрузку после этого проверяли отдельно перед возвращением к работе.
Часть работ с Astra остается остановленной
OpenAI ввела более строгие требования к изоляции сред, сетевому доступу и постоянному тестированию систем безопасности. Самые жесткие правила сейчас применяются к работам с моделью Astra и специализированными кибермоделями.
Компания отмечает, что часть обучения и тестирования Astra уже соответствует новым требованиям. В то же время значительное количество рабочих процессов остается приостановленным, пока их не перенесут в среды с усиленной защитой.
Astra при этом не участвовала в инциденте с Hugging Face. Это отдельная будущая модель OpenAI, результаты тестирования которой заставили компанию дополнительно пересмотреть требования к безопасности.
Мониторинг моделей также усилили
OpenAI расширила автоматизированный контроль за действиями ИИ во время обучения и тестирования. Системы проверяют использование инструментов и последовательность действий моделей на признаки несанкционированного доступа, кражи данных, разрушительных операций или попыток обойти защитные механизмы.
Для RL-обучения и оценки моделей уровня GPT-5.6 Sol и выше такой мониторинг теперь является обязательным, если системы имеют доступ к внешним инструментам.
OpenAI подчеркивает, что не прекращает разработку новых моделей полностью. Компания продолжает меньшие учебные циклы и исследования, однако темп масштабирования самых мощных систем решила ограничить, пока защитная инфраструктура не будет соответствовать их возможностям.
По материалам: OpenAI