Границы безопасности самомодификации

Самоэволюция превращает единичную ошибку в долгосрочный риск. Три границы: (1) разделение свидетельств и инструкций — необработанный внешний контент не записывается в Skill напрямую, только через обобщение LLM с контролем версий; (2) кандидатные и официальные способности — новые артефакты сначала в кандидатной области вне реального трафика, с песочницей и сканированием цепочки поставок; (3) запрет самомодификации механизмов безопасности — агент не меняет проверяющие механизмы, тесты, пороги выпуска, журналы аудита и резервные копии, утверждающие его собственные обновления. Иначе достаточно снизить порог — и деградация выглядит прогрессом.

Связано: Проверка - выпуск - откат, Смертельная триада, Инъекция промпта