2026-08-26 17:17:39
阿里巴巴的 Qwen3.8-Flash-Next 在輝達 GB300 NVL72 上達到每秒 16,000+ 個 Token
據輝達表示,Alibaba 的 Qwen3.8-Flash-Next 模型目前在輝達 GB300 NVL72 平台上,已達到每張 GPU 每秒超過 16,000 個標記的吞吐量。這個擁有 1,760 億個參數的模型,每個標記約啟用 60 億個參數,並原生支援長達 262,000 個標記的上下文長度,透過 YaRN 更可擴展至 1,000,000 個標記。 該模型採用融合 Gated DeltaNet 與 Qwen Sparse Attention 的混合架構,以降低長上下文下的計算開銷與 KV 快取用量。輝達也指出,該模型支援包括 SGLang、vLLM 與 TensorRT-LLM 在內的多個推論框架,單一使用者的吞吐量超過每秒 200 個標記。