Каскадный голосовой конвейер

Конвейер:

VAD → ASR → LLM → TTS

VAD определяет конец речи (порог тишины 500–800 мс — компромисс: короче — обрезает паузы думающего, длиннее — лишняя секунда ожидания).

Каждый этап ждёт предыдущего: суммарно ~0,95–2,3 секунды даже без нагрузки; в очереди задержка растёт нелинейно (~S/(1-загрузка)). Пока VAD и ASR работают, LLM простаивает.

Потоковая обработка скрывает часть задержки: ASR транскрибирует во время речи, LLM сегментирует ответ и отдаёт первый фрагмент в TTS не дожидаясь целого ответа, TTS синтезирует инкрементально. Но определение конца реплики остаётся.

Связано: Голосовые парадигмы, Потоковое речевое восприятие