Архитектура мышления быстрое и медленное

Противоречие: миллисекундный отклик против секунд глубокого размышления.

Три варианта:

  1. разделённые ответы — быстрое отвечает отговоркой за 500 мс, медленное думает 5–10 секунд и даёт полный ответ; риски избыточного размышления и несогласованности;
  2. быстрое взаимодействует, медленное подсказывает через строку состояния — GPT-Live, Pine AI, «Think Fast»: быстрый план на переднем фоне, рассуждающая модель в фоне, передача через компактный текстовый канал;
  3. единство мышления и выражения — Step-Audio R1: «думаю, пока говорю», два мозга (формулирование мысли и артикуляция речи) работают параллельно конвейером.

Разделение 1–2 не зависит от сквозной архитектуры; вариант 3 встраивает размышление в модель.

Связано: Полный дуплекс, Строка состояния агента, Голосовые парадигмы