Архитектура мышления быстрое и медленное
Противоречие: миллисекундный отклик против секунд глубокого размышления. Три варианта: (1) быстрое мышление отвечает отговоркой за 500 мс, медленное думает 5-10 секунд и даёт полный ответ — риски избыточного размышления и несогласованности; (2) быстрое взаимодействует, медленное подсказывает через строку состояния — GPT-Live, Pine AI, «Think Fast»: быстрый план на переднем фоне, рассуждающая модель в фоне, передача через компактный текстовый канал; (3) единство мышления и выражения — Step-Audio R1: «думаю, пока говорю», два мозга (формулирование мысли и артикуляция речи) работают параллельно конвейером. Разделение 1-2 не зависит от сквозной архитектуры; вариант 3 встраивает размышление в модель.
Связано: Полный дуплекс, Строка состояния агента, Голосовые парадигмы