研究《Too Sharp, Too Sure: When Calibration Follows Curvature》では、最適化器 Muon における「学習時は安定しているのに、テスト時に過度に自信を持つ」という現象が指摘されている。学習セットではマージンが大きいにもかかわらず不安定で、入力のわずかな変更によって確信度が崩壊する可能性がある。CIFAR-10/ResNet‑20 の実験では、Muon のテスト ECE が 0.065、学習時はほぼ 0 であり、CalMO によりテスト ECE が 0.019 に低下した。大規模言語モデルではまだ検証されておらず、また DeepSeek V4 の一部モジュールでは引き続き AdamW が使用されているため、Muon の汎化リスクに注意が必要だと示唆されている。