57.68k 浏览量18.22k 人讨论中
7.44k 浏览量9.14k 人讨论中
29.01k 浏览量4.64k 人讨论中
41.04k 浏览量572 人讨论中
22.19k 浏览量747 人讨论中
39.26k 浏览量743 人讨论中
10.36k 浏览量1.31k 人讨论中
40.67k 浏览量1.28k 人讨论中
98.06k 浏览量3.21k 人讨论中
28.46k 浏览量535 人讨论中
Xiaomi 刚刚公布了一些实验室通常会深埋不谈的内容:实际的强化学习账单。
MiMo-V2.6 Pro 和 Flash 都使用 75.3 万个样本进行训练,并在第 30 步停止。
> Pro 成本为 262 万美元。
> Flash 成本为 85.4 万美元。
额外 3.1 倍的支出换来了 DeepSWE 上 6.89 分的提升。
但随后 Flash 仍在 AutomationBench 上略胜 Pro。
现在你已经能看到同样的产品形态正在各处出现:一个模型负责绝对困难的任务,另一个紧随其后,便宜到足以全天运行。
如今 ZAI、Deepseek、Qwen 和 Xiaomi 都有一个共同点。
一旦较小的模型为大多数工作跨过可靠性门槛,更大的模型就开始更像是只有在必要时才选择性调度的工具,而不是所有任务的默认选项。
最终真正的模型栈可能就是这样:底层是廉价的智能,只有当任务确实值得时,才调用昂贵的智能。