Голосовые парадигмы

Три парадигмы голосовой архитектуры:

  1. каскад — конвейер VAD→ASR→LLM→TTS: модульность, но накопление задержки и потеря информации на стыках;
  2. сквозная всемодальная модель (Omni) — единая модель слушает-думает-говорит: ниже задержка, сохраняется просодия, но всё ещё «по очереди» по VAD;
  3. полный дуплекс — модель слушает и говорит одновременно, десятки раз в секунду решая говорить/слушать/молчать/перебить, без предположения об очередности.

Сквозная линия всех трёх: как избавиться от угадывания границ очереди по тишине.

Связано: Каскадный голосовой конвейер, Полный дуплекс, Потоковое речевое восприятие