VLA-модели

VLA (зрение-язык-действие) — «VLM + вывод действий»: увидеть и продумать плюс действовать руками. Двухуровневая архитектура: медленное долгосрочное планирование (что делать — разбиение инструкции на подцели) и быстрое VLA-управление (как делать — непрерывные управляющие сигналы). Два направления представления действий: дискретные токены (RT-2, OpenVLA — авторегрессия как генерация текста) и непрерывная траектория (π₀ — flow matching, плавнее для точных манипуляций). Основа — имитационное обучение на кросс-платформенных демонстрациях; RL — дополнительный слой. Разбиение действий на блоки: один вывод модели — последовательность будущих действий, исполнение с высокой частотой.

Связано: Computer Use, Sim2Real, Двухуровневая архитектура планирование-управление