Архитектура мышления быстрое и медленное
Противоречие: миллисекундный отклик против секунд глубокого размышления.
Три варианта:
- разделённые ответы — быстрое отвечает отговоркой за 500 мс, медленное думает 5–10 секунд и даёт полный ответ; риски избыточного размышления и несогласованности;
- быстрое взаимодействует, медленное подсказывает через строку состояния — GPT-Live, Pine AI, «Think Fast»: быстрый план на переднем фоне, рассуждающая модель в фоне, передача через компактный текстовый канал;
- единство мышления и выражения — Step-Audio R1: «думаю, пока говорю», два мозга (формулирование мысли и артикуляция речи) работают параллельно конвейером.
Разделение 1–2 не зависит от сквозной архитектуры; вариант 3 встраивает размышление в модель.
Связано: Полный дуплекс, Строка состояния агента, Голосовые парадигмы