Qwen3.8-Flash-Next của Alibaba đạt hơn 16.000 token/giây trên NVIDIA GB300 NVL72
Theo NVIDIA, mô hình Qwen3.8-Flash-Next của Alibaba hiện đạt thông lượng hơn 16.000 token mỗi giây trên mỗi GPU trên nền tảng NVIDIA GB300 NVL72. Mô hình 1Mỷ tham số kích hoạt khoảng 6Bỷ tham số trên mỗi token và hỗ trợ độ dài ngữ cảnh gốc 262.000 token, có thể mở rộng lên 1 triệu token thông qua YaRN. Mô hình sử dụng kiến trúc lai kết hợp Gated DeltaNet và Qwen Sparse Attention nhằm giảm chi phí tính toán và mức sử dụng bộ nhớ đệm KV trong các tình huống có ngữ cảnh dài. NVIDIA cũng cho biết mô
GateNews·08-26 17:17
