英伟达将不同模型的 KV 缓存转换时间缩短至原来的 1/25,Qwen3 可在 0.28 秒内完成切换
根据英伟达的最新研究,研究团队发现,同一系列中不同规模的模型可以通过线性映射转换 KV 缓存。在 3.2 万个 token 的上下文长度下,从 Qwen3-14B 切换到 Qwen3-32B 时,转换时间从约 7 秒降至 0.28 秒,速度提升了 25 倍。这使小型模型能够处理初始上下文,随后将缓存结果转移给大型模型进行复杂推理,而无需重新计算。
NVDA2.31%
Gate News·08-10 04:17



