Каскадный голосовой конвейер
VAD определяет конец речи (порог тишины 500-800 мс — компромисс: короче — обрезает паузы думающего, длиннее — лишняя секунда ожидания) → ASR транскрибирует → LLM генерирует → TTS озвучивает. Каждый этап ждёт предыдущего: суммарно ~0,95-2,3 секунды даже без нагрузки; в очереди задержка растёт нелинейно (~S/(1-загрузка)). Пока VAD и ASR работают, LLM простаивает. Потоковая обработка скрывает часть задержки: ASR транскрибирует во время речи, LLM сегментирует ответ и отдаёт первый фрагмент в TTS не дожидаясь целого ответа, TTS синтезирует инкрементально. Но определение конца реплики остаётся.