Nvidia divise par 25 le temps de conversion du cache KV entre modèles, permettant de basculer vers Qwen3 en 0,28 seconde
Selon les dernières recherches de NVIDIA, le cache KV peut être converti entre des modèles de tailles différentes appartenant à une même famille à l’aide d’un mappage linéaire. Lors du passage de Qwen3-14B à Qwen3-32B avec un contexte de 32k tokens, le temps de conversion passe d’environ 7 secondes à 0,28 seconde, soit une accélération de 25×. Cette méthode permet aux petits modèles d’effectuer le prétraitement initial du contexte, puis de transférer le cache aux modèles plus grands afin qu’ils
NVDA2,31 %
GateNews·08-10 04:17



