VLA-модели
VLA (зрение-язык-действие) — «VLM + вывод действий»: увидеть и продумать плюс действовать руками.
Двухуровневая архитектура:
- медленное долгосрочное планирование — что делать: разбиение инструкции на подцели;
- быстрое VLA-управление — как делать: непрерывные управляющие сигналы.
Два направления представления действий:
- дискретные токены (RT-2, OpenVLA) — авторегрессия как генерация текста;
- непрерывная траектория (π₀) — flow matching, плавнее для точных манипуляций.
Основа — имитационное обучение на кросс-платформенных демонстрациях; RL — дополнительный слой. Разбиение действий на блоки: один вывод модели — последовательность будущих действий, исполнение с высокой частотой.
Связано: Computer Use, Sim2Real, Двухуровневая архитектура планирование-управление