再テストの結果、Qwen3.8 Maxの知能指数は56となり、Claude Opus 4.8と並んだ。
Artificial AnalysisのBeating監視結果によると、Alibaba Cloudの公式APIを使用して再テストしたところ、Qwen3.8 MaxのIntelligence Indexスコアは56点に引き上げられ、Claude Opus 4.8と並んだ。一方、Kimi K3には1点及ばなかった。以前のテストでは、インターフェースに断続的な不具合が発生していた。 Qwen3.8 Maxはエージェントタスクで最も大きな改善を示し、GDPval-AAで1,739点を獲得した。これは、Kimi K3の1,685点とGPT-5.6 Solの1,730点を上回る結果だった。しかし、API呼び出しの増加と出力の長文化により、タスクあたりのトークンコストは0.53ドルから1.14ドルに上昇し、Kimi K3の0.86ドルを上回った。また、モデルのハルシネーション率も、以前の23%から40%に上昇した。
GateNews·08-06 10:33
