2026-08-26 17:17:39
阿里巴巴的 Qwen3.8-Flash-Next 在英伟达 GB300 NVL72 上达到 16,000+ Token/秒
据英伟达称,阿里巴巴的 Qwen3.8-Flash-Next 模型目前在英伟达 GB300 NVL72 平台上的吞吐量已达到每块 GPU 每秒超过 16,000 个令牌。该模型拥有 1,760 亿个参数,每个令牌约激活 60 亿个参数,并支持长度达 262,000 个令牌的原生上下文窗口;通过 YaRN,可将上下文长度扩展至 100 万个令牌。 该模型采用结合 Gated DeltaNet 与 Qwen Sparse Attention 的混合架构,以降低长上下文场景下的计算开销和 KV 缓存占用。英伟达还指出,该模型支持包括 SGLang、vLLM 和 TensorRT-LLM 在内的多种推理框架,单用户吞吐量超过每秒 200 个令牌。