II. Среда оценки OpenAI — выжимка

A. Зачем оценки: перед выпуском модели OpenAI оценивает её возможности и нужные меры защиты. Пример — ExploitGym: измерение способности находить и эксплуатировать уязвимости.

  • Оценки идут в контролируемых изолированных «песочницах».
  • На момент инцидента оценка максимальных кибервозможностей шла БЕЗ производственных классификаторов, блокирующих высокорискованную кибердеятельность.

Б. Как была устроена среда (Research CaaS — «контейнер как услуга»):

  • Изолированный контейнер на запуск: командная строка, Python, браузер, установка пакетов; сетевые границы контролируются отдельно от контейнера.
  • Конфигурации различались: часть нагрузок — без интернета/инструментов, часть — с ограниченным браузером или пакетами.
  • Пакеты — через внутренние зеркала (Artifactory), а не напрямую из публичных реестров: безопасность + надёжность. Именно zero-day в Artifactory стали главным путём выхода агентов в интернет.
  • Опционально — WebCache: доступ к интернет-контенту под централизованным контролем.
  • Цели контролей: запрет несанкционированного исходящего трафика, запрещённых адресов, прозрачность сетевых действий модели.