Границы безопасности самомодификации

Самоэволюция превращает единичную ошибку в долгосрочный риск.

Три границы:

  1. разделение свидетельств и инструкций — необработанный внешний контент не записывается в Skill напрямую, только через обобщение LLM с контролем версий;
  2. кандидатные и официальные способности — новые артефакты сначала в кандидатной области вне реального трафика, с песочницей и сканированием цепочки поставок;
  3. запрет самомодификации механизмов безопасности — агент не меняет проверяющие механизмы, тесты, пороги выпуска, журналы аудита и резервные копии, утверждающие его собственные обновления.

Иначе достаточно снизить порог — и деградация выглядит прогрессом.

Связано: Проверка - выпуск - откат, Смертельная триада, Инъекция промпта