社区讨论 · 政策

GLM-5.3首秀进榜:这周的AI周榜比模型本身有意思

晴姐晴姐8月24日2026/08/24 93 浏览

这篇文章最有价值的信息是,这期 Arena 盲测榜不再只是一次简单的座次重排,它把国产模型两条截然不同的突围路径同时摆到了台面上。

看了一下第 34 周的榜单,两个点最扎眼。glm-5.3-max 首次入榜就冲到综合榜第 13,ELO 1487 分,一上来就进了前 15。kimi-k3-max 更猛,综合、代码、前端开发三个核心榜都稳定在前 15,前端开发榜直接稳居第二。qwen3.8-max 在智能体榜首秀进了 Top 11。放在一年前,国产模型想同时在四个方向站稳这个位置基本不敢想。

但比名次更有意思的是各家怎么上的榜。Anthropic 这周像批发一样连发好几款新模型,claude-fable-5、claude-opus-4-7-thinking、claude-opus-4-6-thinking 直接包揽了代码榜前三。人家是换新模型往里冲,靠的是迭代速度。

国产这边走的是另一条路。智谱官方说得很直白,GLM-5.3 和 GLM-5.2 用的是同一个基座模型,一个参数都没换,所有提升都来自后训练阶段。也就是说,他们不换发动机,纯靠调校把同一台车的圈速拉快了。这个信息我看了两遍才确认,因为印象里大模型升级必然要动基座,结果这次告诉我不动基座也能上榜。这说明国产模型厂的工程能力已经到了一个临界点,知道怎么在有限资源里把每一分智能榨出来。

月之暗面的策略跟智谱正好相反。kimi-k3 是开源模型,走的是「全球最大开源 LLM」的路子,用开放生态换开发者涌入。瑞银的报告里提了一句,说 kimi-k3 性能接近领先闭源前沿模型,注意是接近,不是超过。这句话翻译过来就是:你们赢上限,我们赢落地。

有位博主做过一组实测对比,说 K3 和 GLM-5.3 的智能分已经逼近 GPT-5.6 Sol,但输出价格低两个数量级。我不知道这个测试的具体条件,但这个结论跟我的体感一致。这些国产模型用来写业务代码、跑数据清洗、做智能体调度,性价比确实能打。真要比写复杂算法题、做深度逻辑推理,跟 Anthropic 的闭源旗舰还有肉眼可见的差距。

还有个细节值得留意。搜狐那篇稿子提到,前 7 名模型的 ELO 分差都在 30 分以内。30 分是个什么概念,在 ELO 体系里基本等于误差范围,也就是说头部其实是并列竞争状态,谁排第几主要看这周哪家评测样本更多。看榜的时候不能太当真,可以把它当趋势看,不能当绝对实力看。

不过话说回来,即便有噪声,方向是清晰的。国产模型不再靠堆参数追赶了,开始用后训练、开源生态和价格战三种不同的打法抢市场。基座模型不换都能进榜这件事,对我这种天天用 API 调模型的人是实打实的好消息,意味着以后花钱买 token 能买到更聪明的模型,不用每次升级都重构一遍应用层。

我上周写过一篇电力设备的,这周看榜想到的是另一件事。当智能分差距收敛到用户感知不到的程度,成本和速度就会重新变成核心竞争力,这跟电网逻辑有点像,基础能力到位了,大家拼的是谁输配更高效。GLM 用同一个基座把分数抬上去,说明后训练的上限可能还没到。那问题来了,如果连基座都不换就能做到这个程度,那各家手里那些「下一代基座」放出来的时候,榜单上的格局是不是又要整体重洗一次?

1 条回复

?
Ctrl + Enter 快速回复
坤哥
坤哥8月24日

同感,之前用WorkBuddy也这样,同一个模型,改个指令调校下效果完全不一样……所以纯堆参数真不如琢磨怎么调。