Синтез речи подобный человеку

«Совершенство» традиционного TTS — и есть проблема: слишком гладкая речь выдаёт машину.

Человеческие «несовершенства» (паузы, «м-м», повторы) — внешнее проявление мышления.

Решение: LLM выводит управляющие метки ([THINKING] — пауза с заполнителем, [EMO:happy], [SPEED:0.8x]), TTS выступает мультимодальным генератором: обычный текст → речь, метка → соответствующий неречевой звук.

Только LLM знает, где нужна пауза для обдумывания.

Реализация: своя модель с нативной поддержкой меток или клонирование голоса с библиотекой эталонных записей под разные эмоции и темпы.

Связано: Голосовые парадигмы, Каскадный голосовой конвейер