Непрерывная эволюция агента

Парадокс: агент решает новые задачи без примеров, но после десяти тысяч похожих может повторить ошибку первого дня.

Сохранение опыта ≠ обучение на опыте: записать траектории в базу — не значит извлечь из них закономерности.

Обучение происходит после «оценки, сопоставления, обобщения и проверки», а не в момент записи на диск.

Пока модель не способна надёжно обучаться непрерывно, обучение оформляется как внешняя система: фиксировать свидетельства, проверять, извлекать закономерности, выбирать носитель обновления (знания/инструкции/программы/параметры) и прогонять кандидатные версии через регрессию.

Связано: Обучающие сигналы из траекторий, Четыре носителя обновления, Два контура эволюции