Chat Template

Chat Template преобразует структурированные сообщения API в линейный поток токенов со специальными метками (например, <|im_start|>, <|im_end|>).

Отсюда два следствия:

  1. нельзя подменять роли — если результат инструмента подать как сообщение user, модель «сменит тему» и сотрёт цепочку рассуждений;
  2. KV Cache чувствителен к префиксу именно на уровне токенов.

Стратегии обращения с историей reasoning различаются: от полного удаления (DeepSeek R1) до обязательного возврата (DeepSeek V4, Claude).

Связано: Пять компонентов контекста, KV Cache