Голосовые парадигмы
Три парадигмы голосовой архитектуры: (1) каскад — конвейер VAD→ASR→LLM→TTS, модульность, но накопление задержки и потеря информации на стыках; (2) сквозная всемодальная модель (Omni) — единая модель слушает-думает-говорит, ниже задержка, сохраняется просодия, но всё ещё «по очереди» по VAD; (3) полный дуплекс — модель слушает и говорит одновременно, десятки раз в секунду решая говорить/слушать/молчать/перебить, без предположения об очередности. Сквозная линия всех трёх: как избавиться от угадывания границ очереди по тишине.
Связано: Каскадный голосовой конвейер, Полный дуплекс, Потоковое речевое восприятие