VLA-модели

VLA (зрение-язык-действие) — «VLM + вывод действий»: увидеть и продумать плюс действовать руками.

Двухуровневая архитектура:

  • медленное долгосрочное планирование — что делать: разбиение инструкции на подцели;
  • быстрое VLA-управление — как делать: непрерывные управляющие сигналы.

Два направления представления действий:

  • дискретные токены (RT-2, OpenVLA) — авторегрессия как генерация текста;
  • непрерывная траектория (π₀) — flow matching, плавнее для точных манипуляций.

Основа — имитационное обучение на кросс-платформенных демонстрациях; RL — дополнительный слой. Разбиение действий на блоки: один вывод модели — последовательность будущих действий, исполнение с высокой частотой.

Связано: Computer Use, Sim2Real, Двухуровневая архитектура планирование-управление