Синтез речи подобный человеку

«Совершенство» традиционного TTS — и есть проблема: слишком гладкая речь выдаёт машину. Человеческие «несовершенства» (паузы, «м-м», повторы) — внешнее проявление мышления. Решение: LLM выводит управляющие метки ([THINKING] — пауза с заполнителем, [EMO:happy], [SPEED:0.8x]), TTS выступает мультимодальным генератором: обычный текст → речь, метка → соответствующий неречевой звук. Только LLM знает, где нужна пауза для обдумывания. Реализация: своя модель с нативной поддержкой меток или клонирование голоса с библиотекой эталонных записей под разные эмоции и темпы.

Связано: Голосовые парадигмы, Каскадный голосовой конвейер