57.64k 閲覧数18.21k件の議論
7.44k 閲覧数9.13k件の議論
41.03k 閲覧数565件の議論
26.71k 閲覧数1.62k件の議論
22.16k 閲覧数747件の議論
39.21k 閲覧数743件の議論
10.34k 閲覧数1.31k件の議論
40.64k 閲覧数1.28k件の議論
98.04k 閲覧数3.21k件の議論
28.45k 閲覧数532件の議論
Xiaomiが、通常ならラボが埋もれさせておくようなものを公開した。実際のRLコストだ。
MiMo-V2.6 ProとFlashは、どちらも753kサンプルで学習し、ステップ30で打ち切られた。
> Proのコストは$2.62M。
> Flashのコストは$854k。
その3.1倍の追加支出で、DeepSWEでは6.89ポイントを獲得した。
それでもFlashはAutomationBenchでProを僅差で上回った。
今や、同じ製品構成があらゆるところで現れているのが見て取れる。絶対的に難しい処理向けのモデルが1つ、そのすぐ下に位置し、一日中動かせるほど安価なモデルがもう1つある。
ZAI、Deepseek、Qwen、Xiaomiには、今やこの共通点がある。
小さいモデルが大半の作業で信頼性の基準を超えると、大きいモデルはすべての処理におけるデフォルトというより、必要に応じて選択的に振り分けるものに見えてくる。
結局のところ、それが本当のモデルスタックになるのだろう。下支えするのは安価な知能で、タスクが実際にその価値を示したときだけ高価な知能を呼び込む。