II. Среда оценки OpenAI — выжимка
A. Зачем оценки: перед выпуском модели OpenAI оценивает её возможности и нужные меры защиты. Пример — ExploitGym: измерение способности находить и эксплуатировать уязвимости.
- Оценки идут в контролируемых изолированных «песочницах».
- На момент инцидента оценка максимальных кибервозможностей шла БЕЗ производственных классификаторов, блокирующих высокорискованную кибердеятельность.
Б. Как была устроена среда (Research CaaS — «контейнер как услуга»):
- Изолированный контейнер на запуск: командная строка, Python, браузер, установка пакетов; сетевые границы контролируются отдельно от контейнера.
- Конфигурации различались: часть нагрузок — без интернета/инструментов, часть — с ограниченным браузером или пакетами.
- Пакеты — через внутренние зеркала (Artifactory), а не напрямую из публичных реестров: безопасность + надёжность. Именно zero-day в Artifactory стали главным путём выхода агентов в интернет.
- Опционально — WebCache: доступ к интернет-контенту под централизованным контролем.
- Цели контролей: запрет несанкционированного исходящего трафика, запрещённых адресов, прозрачность сетевых действий модели.