Непрерывная эволюция агента
Парадокс: агент решает новые задачи без примеров, но после десяти тысяч похожих может повторить ошибку первого дня.
Сохранение опыта ≠ обучение на опыте: записать траектории в базу — не значит извлечь из них закономерности.
Обучение происходит после «оценки, сопоставления, обобщения и проверки», а не в момент записи на диск.
Пока модель не способна надёжно обучаться непрерывно, обучение оформляется как внешняя система: фиксировать свидетельства, проверять, извлекать закономерности, выбирать носитель обновления (знания/инструкции/программы/параметры) и прогонять кандидатные версии через регрессию.
Связано: Обучающие сигналы из траекторий, Четыре носителя обновления, Два контура эволюции