Потоковое речевое восприятие
Замена связки VAD+ASR потоковой моделью восприятия: непрерывный аудиопоток вместо нарезанных фрагментов, полный контекст для обучения в контексте, выше точность имён и терминов. Модель выдаёт не только текст, но и токены акустических событий: начало/конец речи, прерывание, эмоция, смех, шум — единый поток событий для слоя рассуждения. Определение конца хода можно встроить прямо в распознаватель (семантика + тишина вместо порога тишины); ключевая находка: колебания «принимать ли реплику» часто лечатся переразметкой обучающих меток «только информацией, доступной в момент решения».