云厂商会让大模型降智
又看到个有意思的。
模型评测机构 Artificial Analysis 最近做了一项测试:把官方部署的模型成绩记为 100%,再测试不同云服务商提供的同款模型 API。
结果很夸张。
GLM-5.2 最差的一个 API 端点,能力只剩 52%。gpt-oss-120b 在 70% 到 101% 之间波动。DeepSeek V4 Pro 相对稳定,9 家服务商都在 97% 到 107% 之间。
原因主要是云厂商要控制成本。
开源模型运行起来很贵,为了节省显存、提高并发,一些平台会对模型做量化,把原本高精度的参数压成低精度。模型变便宜了,数学、代码和复杂推理能力也可能一起缩水。
有的平台还会限制推理长度和输出长度。
聊天模板、上下文处理和工具调用,也都由云厂商负责。任何一层没调好,都会让模型继续降智。