Полный дуплекс
Полнодуплексная модель слушает и говорит одновременно, полностью снимая предположение об очереди: перекрывающаяся речь и произвольное прерывание — естественное поведение, не требующее детекции.
- Пионер — Moshi — параллельные аудиопотоки пользователя и модели + текстовый «внутренний монолог», ~200 мс задержки.
- Тезис — интерактивность должна быть встроена в модель, а не навешана снаружи (TML Interaction Models, микрораунды ~200 мс).
- GPT-Live — довёл до промышленного масштаба: непрерывная обработка входа и выхода, десятки решений в секунду, плюс разделение быстрого и медленного мышления через делегирование фоновой модели.
Связано: Голосовые парадигмы, Архитектура мышления быстрое и медленное