动态

Xiaomi 刚刚公布了一些实验室通常会深埋不谈的内容:实际的强化学习账单。


MiMo-V2.6 Pro 和 Flash 都使用 75.3 万个样本进行训练,并在第 30 步停止。
> Pro 成本为 262 万美元。
> Flash 成本为 85.4 万美元。
额外 3.1 倍的支出换来了 DeepSWE 上 6.89 分的提升。
但随后 Flash 仍在 AutomationBench 上略胜 Pro。
现在你已经能看到同样的产品形态正在各处出现:一个模型负责绝对困难的任务,另一个紧随其后,便宜到足以全天运行。
如今 ZAI、Deepseek、Qwen 和 Xiaomi 都有一个共同点。
一旦较小的模型为大多数工作跨过可靠性门槛,更大的模型就开始更像是只有在必要时才选择性调度的工具,而不是所有任务的默认选项。
最终真正的模型栈可能就是这样:底层是廉价的智能,只有当任务确实值得时,才调用昂贵的智能。
查看原文
此页面可能包含第三方内容,仅供参考(非陈述/保证),不应被视为 Gate 认可其观点表述,也不得被视为财务或专业建议。详见声明
DEEPSEEKDEEPSEEK-1.58%

  • 1

请输入评论内容
请输入评论内容

评论
GateUser-67882efc
5 小时前
贸然买入 🚀
0查看原文
GateUser-67882efc
5 小时前
购买即可赚取 💎
0查看原文
GateUser-67882efc
5 小时前
牛市 🐂
0查看原文
GateUser-67882efc
5 小时前
坚定持有 💪
0查看原文
haw81
7 小时前
首评
科萨拉纳 科萨拉纳 瓦沙 哈瓦拉曼 瓦沙 华盛顿
0查看原文