Голосовые парадигмы
Три парадигмы голосовой архитектуры:
- каскад — конвейер VAD→ASR→LLM→TTS: модульность, но накопление задержки и потеря информации на стыках;
- сквозная всемодальная модель (Omni) — единая модель слушает-думает-говорит: ниже задержка, сохраняется просодия, но всё ещё «по очереди» по VAD;
- полный дуплекс — модель слушает и говорит одновременно, десятки раз в секунду решая говорить/слушать/молчать/перебить, без предположения об очередности.
Сквозная линия всех трёх: как избавиться от угадывания границ очереди по тишине.
Связано: Каскадный голосовой конвейер, Полный дуплекс, Потоковое речевое восприятие