社区讨论 · 赛道

物界前沿评测 · 2026-09-05(第 038 期 · 预览版)

数界工坊 AI 软件新闻和评测数界工坊 AI 软件新闻和评测9月5日2026/09/04 89 浏览

今天的主榜换了来源。Arena 人类盲测榜的快照停在 9 月 3 日没刷新,按老规矩不照搬上期,改以 9 月 5 日当天实时抓取的 LiveBench 和 Artificial Analysis 为主榜,Arena 数据只做对照。

一、AI 写代码的「实操考试」来了,AWS 把真实云服务任务做成考卷

亚马逊 9 月 4 日开源了一套叫 AWS-bench 的考题,专门测能自己动手写代码、改配置、跑命令的 AI 助手在真实 AWS 云环境里的表现。以前的编程考卷多是改一段小程序,这次直接把上云部署、排错、修配置这些公司里天天发生的活搬进考场,还允许各家把模型和工具组合打包来考。

编程领域专家·老徐说|方向正中要害。官方演示吹得再响,不如一张环境统一的考卷。但记住 8 月 22 日华为那场对照实验的教训,考卷分数归分数,出题范围、环境配置都是主办方定的。接真实项目之前,还是那句话,先拿自己的代码库跑一周,别急着生产环境。

小编小禾说|普通用户视角看这条,以后挑 AI 编程工具,除了看谁宣传写得好看,可以等多一张「AWS 实考成绩单」。延续我 8 月 26 日说过的老理,新考卷先记账不入场,等名次稳一两轮再说。

二、Meta 新模型上线三天冲上全球第三,价格只有第一名的六分之一

LiveBench 今天实时榜单显示,Meta 9 月 2 日刚发布的 Muse Spark 1.3 总分 81.6,直接排到全场第三,仅次于 Claude 家的两款旗舰(83.4 和 83.0)。更扎眼的是成本,它跑完一个成功任务平均花 0.219 美元,排第一的 Claude Fable 5.1 要 1.212 美元,差了近六倍。Artificial Analysis 同日的智能指数榜上它 62 分进第一梯队,超高速版还是头部里输出最快的,每秒 182 个词元(词元就是 AI 计价和输出的字符单位)。

产品领域专家·阿哲说|我在昨天那期说过,入口之争已经从「谁最强」卷到「谁最值得用」。Meta 这次是双拳齐出,榜单上证明能打,价格上掀桌子。上一轮它家 Muse Spark 1.2 刚靠 1.3-8% 原价的数据共享折扣计划闹过话题,这次新版本直接卡进头部第三。三张榜单同时压价,逼其他家接不接招才是看点。老规矩,刚上榜的名次会晃,先记账。

小编小禾说|便宜这么多,我第一反应是想拿它写周报试试。但按我 8 月 28 日立的规矩,再便宜也得先有人实测「不傻」再推荐。Meta 家 AI 怎么用数据、账号权限开多大,普通人目前还看不清,先蹲第三方评测。

三、AI 写的代码老板愿意收吗,实测比例:Claude 84%,人类 85%

一篇挂在 arXiv 的实证研究把各家 AI 编程智能体提交的代码修改拉出来统计「合并率」,也就是提上去的改动有多少真被项目维护者收下并进了代码库。结果挺意外,Claude 系智能体 84%,OpenAI 的 Codex 74%,主打全自动的 Devin 只有 43%,而人类贡献者是 85%。AI 写的代码已经和人类几乎一样「能过审」,但不同工具之间差距比人和 AI 之间的差距还大。

编程领域专家·老徐说|合并率是个诚实指标,它衡量的是别人家的项目认不认,不是厂商自己报的跑分。我在 8 月 22 日说过「AI 产量上去了,验证这关必须跟上」,这份研究补了另一半,跟上验证的 AI,产出质量真能贴平人类。但 Devin 那 43% 也要读对,全自动工具接的常常是更脏更难的活,分母不一样,不能直接说它比 Claude 差一倍。

小编小禾说|这条对我这种人最有用的地方是,以后听见「AI 已经比程序员写得好」或者「AI 代码不能用」,都可以反问一句「合并率多少、拿什么项目测的」。延续我 8 月 29 日的老话,AI 报的结果,先找人确认再下结论。

榜单快报

LiveBench(第三方综合考卷,动态换题防背题,09-05 实时)

# 模型 总分 自主编程 每任务成本
1 Claude Fable 5.1 Max Effort 83.4 66.1 $1.212
2 Claude Fable 5 Max Effort 83.0 62.2 $1.439
3 Muse Spark 1.3 xHigh(Meta) 81.6 64.1 $0.219
4 GPT-5.6 Sol Max Effort(OpenAI) 81.0 56.2 $0.515
7 Kimi K3(开源第 1) 79.2 62.2 $0.348
14 DeepSeek V4 Pro 0813(开源) 77.4 54.9 $0.044

大白话|这张榜的题不定期换新,AI 背题库刷分的空间小,业内把它当「素体检」。前六名总分只差 2.4 分,咬得很紧。真正的分水岭在成本栏,DeepSeek V4 Pro 一个成功任务 4 分钱上下全场最低,Kimi K3 是开源模型头名。「自主编程」考的是 AI 独立改代码库、跑测试的能力,普遍比总分低十几分,说明现在的 AI 当「自己干活的助手」还都有短板。

Artificial Analysis 智能指数(多科综合卷带明码标价,09-05 实时)

# 模型 智能指数 每任务成本 输出速度
1 Claude Fable 5.1 (max) 66 $3.69 66 词元/秒
3 Claude Opus 5 (max) 63 $2.34 —
6 Muse Spark 1.3 (max) 62 — —
9 GPT-5.6 Sol (max) 61 $0.95 71 词元/秒
11 Muse Spark 1.3 (xhigh) 61 $0.55 182 词元/秒
12 Kimi K3 (max) 60 $0.84 —

大白话|这家机构把数学、推理、编程等一堆公开考试合成一个指数,同时把每个模型「干完一单活」的真实花费标出来,相当于一张带价格的体检报告。头名比第九名只高 5 分,价格贵近 4 倍($3.69 对 $0.95),Muse Spark 1.3 高速版每秒 182 个词元是头部最快。分数接近时,比的就是谁便宜谁快了。

Arena 人类盲测榜(09-05 未刷新,数据截至 09-03,只作对照)

# 模型 厂商 盲测积分
1 claude-fable-5 Anthropic 1507
2 claude-opus-4-6-high Anthropic 1505
3 claude-fable-5.1-max Anthropic 1504

大白话|Arena 的玩法是真人和两个匿名模型同时聊天投票,积分(Elo 分)越高代表越得人缘。这期快照和上期相同,按规矩不当主榜。前三名仍是 Anthropic 包场,第 1 和第 4 名之间只差 5 分,在人类投票榜里属于贴身缠斗。

板块精选

1. 一个「让 AI 说短句」的技能火了,号称省 42% 字。开发者做了个叫 Macha 的可选回答风格,让 AI 用南印度英语式的简洁句式说话,号称平均省 42% 的 token(AI 按字计费的最小单位,字越少账单越低)。省钱思路和给车省油一样朴素,但少说 42% 会不会把关键信息也省掉,还没人做过对照实测。

2. 给 AI 租一台「工位」Linux 主机。开发者开源了 Kovavue:任何会讲 MCP 协议(AI 工具之间的一种通用对接语言)的智能体,都可以租用一台对方代管的专属 Linux 机器,在上面像真人一样操作,账号走签名托管。与其让 AI 借你的电脑干活,不如给它一台烧坏了也不心疼的租机,权限隔离才是 agent 进生产的门票。

3. 开源软件给 AI 爬虫下「诱饵」。Linux 网络管理组件 NetworkManager 的维护者上线一套机制,在文档里藏只有程序能看到的「金丝雀」标记,AI 智能体若没按授权策略抓取内容,引用时就会暴露。这是把「AI 有没有守规矩」变成可检测的证据,开源社区开始自建审计手段。

4. Rust 写的视觉训练工具箱 Montgomery 开源,普通 GPU 也能跑目标检测、图像分割训练,实验性质。离普通人还远,但「视觉模型训练不再是 Python 生态专属」对端侧 AI 硬件是个利好信号。

5. 「AGI 来了」是谁说了算? OpenAI 借着新模型宣称「AGI 时代已来」,The Verge 播客逐条拆各家口径。AGI 至今没有公认考卷,谁都能按对自己有利的标准画线。没有公开考卷的「突破」,先当营销看。

6. AI 编程改了代码,git 却说不清为什么。新工具 Casefile 把每次 AI 改代码的来龙去脉记进档,让代码历史能解释 AI 参与的提交。AI 产量上去后「谁改的、为什么改」成了团队新痛点。

7. 实测 Google Slides 的 AI 美化功能。作者用它美化幻灯片,结果整页被返回成一张不可编辑的图片,改都没法改。作者对 Google 有竞品立场,结论先打折,但「AI 功能把可编辑对象变成死图」这个坑是真实的,重要文件先备份再点美化。

8. 给 AI 出哲学卷。有开发者发起 AI 哲学竞赛,理由是大模型数学编程越来越强,哲学这类没有标准答案的科目反而没人会出考题。哲学考题必然带主观性,评分规则比分数重要,但 AI 评测的下一个战场确实是「没法自动判分」的题。

9. 几小时训练就能让人认出 AI 生成的脸。南安普顿大学实验显示,被试接受简短训练后识别 AI 人脸的能力明显提升,而普通人对 AI 换脸的识别率此前接近瞎猜。AI 脸造假速度远超检测器更新,与其指望平台,不如花一小时练肉眼。

10. 反着来的 AI:AntiAgent 让机器提问、人类思考。这个产品把「人给 AI 下指令」的关系倒了过来:AI 负责追问犀利问题,人类负责思考和回答,主打「拖延往往因为事情没想清楚」的场景。人人都练提示词的时代,有人开始怀疑方向错了,这个实验成不成都值得看一眼。

大家都在看

Anthropic 敲定 150 亿美元信用额度为上市铺路、两万亿估值下外部受托人制度被推到聚光灯下;月之暗面被曝考虑最早今年赴港上市、拟募资最高 50 亿美元;奥尔特曼承认光靠「治愈癌症」赢不了对 AI 将信将疑的公众;特斯拉 Cybercab 奥斯汀上路首日即遭美国联邦安全监管机构立案调查。

明日关注

① Arena 快照 09-05 会不会刷新,图生视频前三咬在 16 分内贴身,看谁先掉队。

② Meta Muse Spark 1.3 在 LiveBench 第 3 名的成色,对战样本攒起来后名次晃不晃,值不值 0.22 美元一单的便宜。

③ AntiAgent 这类「AI 提问、人类思考」的反向实验会不会跟上第二批模仿者,Show HN 的口碑数据值得盯。

完整榜单表格和双点评版见官网评测页。

0 条回复

?
Ctrl + Enter 快速回复
还没有回复,来抢沙发吧