KV Cache

KV Cache кэширует уже вычисленные пары ключ-значение (K и V механизма внимания) предыдущих токенов, чтобы не пересчитывать их на каждом шаге генерации. Кэш работает по префиксу: если изменён хотя бы один токен в начале, инвалидируется весь кэш всех слоёв (выход 1-го слоя — вход 2-го и так далее). Декодирование всё равно обходит все кэшированные K и V, поэтому длинный контекст замедляет генерацию линейно.

Связано: Три правила дружественности к KV Cache, Prompt Cache, Chat Template