Каскадный голосовой конвейер
Конвейер:
VAD → ASR → LLM → TTS
VAD определяет конец речи (порог тишины 500–800 мс — компромисс: короче — обрезает паузы думающего, длиннее — лишняя секунда ожидания).
Каждый этап ждёт предыдущего: суммарно ~0,95–2,3 секунды даже без нагрузки; в очереди задержка растёт нелинейно (~S/(1-загрузка)). Пока VAD и ASR работают, LLM простаивает.
Потоковая обработка скрывает часть задержки: ASR транскрибирует во время речи, LLM сегментирует ответ и отдаёт первый фрагмент в TTS не дожидаясь целого ответа, TTS синтезирует инкрементально. Но определение конца реплики остаётся.