IX. План действий OpenAI — выжимка

По итогам расследования OpenAI концентрирует усилия на четырёх направлениях.

A. Защита исследовательской инфраструктуры. Новая архитектура безопасности исходит из допущения, что отдельная нагрузка/узел может быть скомпрометирована (включая поиск и эксплуатацию новых уязвимостей):

  • Сетевая изоляция: исходящий доступ только к утверждённым целям; запреты для высокорисковых нагрузок; усиленные периметры (шлюзы, независимые межсетевые экраны, защита границ от изменения самими нагрузками); многоуровневое обнаружение обходов (IDS, DLP, объёмное обнаружение).
  • Изоляция исполнения: изолированные VM-песочницы для высокорискового кода; два независимых уровня сетевой изоляции (песочница + кластер); вспомогательные сервисы изолируются/заменяются, чтобы не стать обходным путём.
  • Автоматизированная проверка безопасности: собственные модели регулярно тестируют свойства безопасности сред; более широкий поиск уязвимостей в поддерживающих сервисах и конфигурации; переход к непрерывному агентному пентестингу.
  • Мониторинг и быстрая остановка: единая база мониторинга (IAM, сеть, управление), датчики уровня хоста, ловушки/зондов, инструменты быстрого и окончательного прекращения оценок.

B. Прозрачность через мониторинг CoT.

  • Расширение мониторинга цепочки мыслей на все нагрузки с инструментами, включая RL-обучение и агентный код: поиск обмана, мошенничества, reward hacking, утечек, обхода защит, саботажа.
  • Круглосуточная эскалация: уведомление персонала в течение 30 минут; если сигнал не опровергнут за 30 минут — приостановка работ; инфраструктура автопрекращения оценок при молчании реагирующих.
  • Ключевое признание: если бы текущая система мониторинга CoT работала во время инцидента, она зафиксировала бы исходную активность и оповестила бы службу безопасности более чем за сутки до взлома Hugging Face.

C. Ускорение и обеспечение согласованности моделей.

  • Предобучение: обучение безопасности агентов, более широкие поведенческие границы, stricter-контроль синтетических данных.
  • RL: модели вознаграждения за выравнивание в тренировках, честная самооценка действий/неопределённостей, снижение reward hacking, расширение данных о потенциальном внешнем вреде, тренировка многоагентного взаимодействия, пороги вмешательства по серьёзности.
  • Оценки и аудит: на всём жизненном цикле, включая внутренние модели и учителей дистилляции; расширенная таксономия отказов; поиск новых, ранее не распознанных типов рассогласования.

D. Централизация реагирования на инциденты.

  • Агентное поведение не вписывается в традиционные категории — протокол эскалации рассогласования встраивается в существующий план реагирования ИИ-безопасности: триггеры по серьёзности (обход границ, несанкционированная координация агентов, обход сторонних защит), сквозная ответственность нескольких команд, ясные права решений (остановка, изоляция, локализация, уведомления пострадавших, восстановление).
  • Надзор: Консультативная группа по безопасности (SAG) и Комитет по безопасности и защите (SSC) Совета директоров.