Полный дуплекс

Полнодуплексная модель слушает и говорит одновременно, полностью снимая предположение об очереди: перекрывающаяся речь и произвольное прерывание — естественное поведение, не требующее детекции.

  • Пионер — Moshi — параллельные аудиопотоки пользователя и модели + текстовый «внутренний монолог», ~200 мс задержки.
  • Тезис — интерактивность должна быть встроена в модель, а не навешана снаружи (TML Interaction Models, микрораунды ~200 мс).
  • GPT-Live — довёл до промышленного масштаба: непрерывная обработка входа и выхода, десятки решений в секунду, плюс разделение быстрого и медленного мышления через делегирование фоновой модели.

Связано: Голосовые парадигмы, Архитектура мышления быстрое и медленное