2026-08-26 17:17:39
アリババの「Qwen3.8-Flash-Next」、NVIDIA GB300 NVL72で毎秒16,000トークン超を達成
エヌビディアによると、アリババのQwen3.8-Flash-Nextモデルは、NVIDIA GB300 NVL72プラットフォーム上で、GPUあたり毎秒16,000トークンを超えるスループットを達成した。この1,760億パラメータモデルは、1トークンあたり約60億パラメータをアクティブ化し、ネイティブで262,000トークンのコンテキスト長をサポートするほか、YaRNによって100万トークンまで拡張できる。 このモデルは、Gated DeltaNetとQwen Sparse Attentionを組み合わせたハイブリッドアーキテクチャを採用しており、長文コンテキストのシナリオにおける計算オーバーヘッドとKVキャッシュの使用量を削減する。エヌビディアはまた、このモデルがSGLang、vLLM、TensorRT-LLMなど複数の推論フレームワークをサポートし、単一ユーザー利用時のスループットが毎秒200トークンを超えることも明らかにした。