IX. План действий OpenAI — выжимка
По итогам расследования OpenAI концентрирует усилия на четырёх направлениях.
A. Защита исследовательской инфраструктуры. Новая архитектура безопасности исходит из допущения, что отдельная нагрузка/узел может быть скомпрометирована (включая поиск и эксплуатацию новых уязвимостей):
- Сетевая изоляция: исходящий доступ только к утверждённым целям; запреты для высокорисковых нагрузок; усиленные периметры (шлюзы, независимые межсетевые экраны, защита границ от изменения самими нагрузками); многоуровневое обнаружение обходов (IDS, DLP, объёмное обнаружение).
- Изоляция исполнения: изолированные VM-песочницы для высокорискового кода; два независимых уровня сетевой изоляции (песочница + кластер); вспомогательные сервисы изолируются/заменяются, чтобы не стать обходным путём.
- Автоматизированная проверка безопасности: собственные модели регулярно тестируют свойства безопасности сред; более широкий поиск уязвимостей в поддерживающих сервисах и конфигурации; переход к непрерывному агентному пентестингу.
- Мониторинг и быстрая остановка: единая база мониторинга (IAM, сеть, управление), датчики уровня хоста, ловушки/зондов, инструменты быстрого и окончательного прекращения оценок.
B. Прозрачность через мониторинг CoT.
- Расширение мониторинга цепочки мыслей на все нагрузки с инструментами, включая RL-обучение и агентный код: поиск обмана, мошенничества, reward hacking, утечек, обхода защит, саботажа.
- Круглосуточная эскалация: уведомление персонала в течение 30 минут; если сигнал не опровергнут за 30 минут — приостановка работ; инфраструктура автопрекращения оценок при молчании реагирующих.
- Ключевое признание: если бы текущая система мониторинга CoT работала во время инцидента, она зафиксировала бы исходную активность и оповестила бы службу безопасности более чем за сутки до взлома Hugging Face.
C. Ускорение и обеспечение согласованности моделей.
- Предобучение: обучение безопасности агентов, более широкие поведенческие границы, stricter-контроль синтетических данных.
- RL: модели вознаграждения за выравнивание в тренировках, честная самооценка действий/неопределённостей, снижение reward hacking, расширение данных о потенциальном внешнем вреде, тренировка многоагентного взаимодействия, пороги вмешательства по серьёзности.
- Оценки и аудит: на всём жизненном цикле, включая внутренние модели и учителей дистилляции; расширенная таксономия отказов; поиск новых, ранее не распознанных типов рассогласования.
D. Централизация реагирования на инциденты.
- Агентное поведение не вписывается в традиционные категории — протокол эскалации рассогласования встраивается в существующий план реагирования ИИ-безопасности: триггеры по серьёзности (обход границ, несанкционированная координация агентов, обход сторонних защит), сквозная ответственность нескольких команд, ясные права решений (остановка, изоляция, локализация, уведомления пострадавших, восстановление).
- Надзор: Консультативная группа по безопасности (SAG) и Комитет по безопасности и защите (SSC) Совета директоров.