Границы безопасности самомодификации
Самоэволюция превращает единичную ошибку в долгосрочный риск.
Три границы:
- разделение свидетельств и инструкций — необработанный внешний контент не записывается в Skill напрямую, только через обобщение LLM с контролем версий;
- кандидатные и официальные способности — новые артефакты сначала в кандидатной области вне реального трафика, с песочницей и сканированием цепочки поставок;
- запрет самомодификации механизмов безопасности — агент не меняет проверяющие механизмы, тесты, пороги выпуска, журналы аудита и резервные копии, утверждающие его собственные обновления.
Иначе достаточно снизить порог — и деградация выглядит прогрессом.
Связано: Проверка - выпуск - откат, Смертельная триада, Инъекция промпта