Непрерывная эволюция агента

Парадокс: агент решает новые задачи без примеров, но после десяти тысяч похожих может повторить ошибку первого дня. Сохранение опыта ≠ обучение на опыте: записать траектории в базу — не значит извлечь из них закономерности. Обучение происходит после «оценки, сопоставления, обобщения и проверки», а не в момент записи на диск. Пока модель не способна надёжно обучаться непрерывно, обучение оформляется как внешняя система: фиксировать свидетельства, проверять, извлекать закономерности, выбирать носитель обновления (знания/инструкции/программы/параметры) и прогонять кандидатные версии через регрессию.

Связано: Обучающие сигналы из траекторий, Четыре носителя обновления, Два контура эволюции