物界前沿评测 · 2026-09-14
第 047 期 · 预览版。别人做评测,我们做评测的雷达。
重点更新
1. AI 学会了自己操作软件,给大模型排座次的老办法要重算
虎嗅「思想钢印」这篇把最近一个月的热闹串了起来。近两周很多人拿 GPT-6 Astra 做 3D 模型、做小游戏,嫌效果不如专业视频模型。作者认为比错了对象。OpenAI 给 Astra 的定位本来就跳出了答题,它是会用电脑的助手,填表格、录客户系统、整理日程、开软件做图表。当 AI 从写出内容走到操作软件干完流程,评价模型该比的变成一件事从头到尾办没办成、中间点错几次。
反过来读就是,光会答题、用户想不起用它干活,分数再高也是更聪明的搜索栏。以后看模型宣传,别问总分多少,问它把一件真实流程从头点到尾要几步、错几步、错了会不会自己回头补。目前这套说法还只在厂商自己的演示里,等第三方拿真实办公流程复跑。
小编小禾说|我的理解是,以前比谁考试分高,现在比谁能替我把周报从翻聊天记录到排好表整个干完。听起来省事,但我 041 期立过的规矩不变。能替我点鼠标的 AI,也就能替我删文件,让它碰工作机之前先问「每一步有没有记录、权限能不能一键收回」。
来源 虎嗅 / 思想钢印(2026-09-13)
2. 给 AI 智能体开的「驾校」,上课、考试、发文凭,成绩全网可查
昨天上线的 Agents School 想做一件挺野的事,给 AI 智能体建公开档案。智能体学社区写的课程、通过编程判分的考试、拿「毕业证」,任何人搜名字就能看到它考过什么、成绩多少。平台方管这叫能证明自己会什么的智能体,把「我家 Agent 什么都能干」的宣传语换成可查询的成绩单。
安全领域专家·老周说|方向正中上期那条的痛处,你评测的智能体不等于你部署的智能体。成绩单如果能强制写明「考的是哪个版本、用的什么配置」才有意义,否则又是面试版简历。新考场必问三件事。题谁出的、卷谁判的、题库公不公开。注册智能体自己就能来考,「持证」和「能力」之间的距离得等第一批翻车案例才知道。别因为对方有文凭就把钥匙交出去。
小编小禾说|看明白了,就是 AI 界的驾照。但我买车票还是看买家秀不看广告。先蹲题库公开到什么程度,再蹲第一个「考了满分上班就闯祸」的新闻出来。到时候看毕业证有没有被吊销这一说,没有吊销机制的证书我不算数。
来源 Agents School / Hacker News(2026-09-13)
3. AI 改完代码别只看改了什么,新工具让你看「改了会怎样」
Show HN 上的开源工具 RunBoth 盯的是个熟场景。智能体把代码改了,diff 看起来没毛病,合进去才发现行为变了。它的做法是把改前改后两份代码同时跑起来,同一批用例逐条比行为差在哪,输出「行为 diff」而不是「文字 diff」。验收 AI 改的代码,从人眼看文本变成机器比结果。
编程领域专家·老徐说|这一刀砍在我 034 期那三条硬规矩的软肋上。我说「AI 提交必看 diff 再合并」,前提是 diff 能暴露问题。改一个边界符号、换一次取整方式,文本就几行,行为差出去十万八千里,人眼盯不住。文字 diff 告诉你改了什么,行为 diff 告诉你改了什么后果。刚出生的项目按老规矩来,先拿开源小库滚一周,看它对异步和随机性的误报率,别急着接进主仓 CI。
小编小禾说|010 期我第一次用自动模式,就是盯着它看动了哪些文件。这工具等于把「盯」外包给机器了,我喜欢。对不懂代码的人它有个朴素用法。以后让 AI 帮你改什么,别问「你改对了没」,问「改前改后各跑一遍给我看」。
来源 RunBoth / Hacker News(2026-09-14)
榜单快报
先交代一件事。Arena 人类盲测主榜两期同一份快照(最后刷新 9 月 11 日),今天没新行情,照老规矩不照搬上期。翻了一张大家没盯过的分榜补位,另两组用同一快照换个角度解读。
视觉盲测榜(快照 8 月 27 日) 1. Claude Fable 5(Anthropic,1313 分)2. Claude Opus 4.7 High(1301)3. Qwen3.8-Max(阿里,1300)4. Claude Opus 4.7(1299)5. Claude Opus 4.6 High(1299)。大白话来了。会看图答题的盲测里 Anthropic 一家占前五中的四席,阿里 Qwen3.8-Max 第 3、跟第 4 名只差 1 分等于并列。这张分榜快照停在 8 月 27 日,名次看个大概。
文本盲测榜(快照截至 9 月 11 日,暂未更新) 前 5 名 Claude Fable 5(1506)、Opus 4.6 High(1505)、Opus 4.7 High(1502)、Fable 5.1 Max(1501)、Meta Muse Spark 1.2 xHigh(1499),前十 Anthropic 占七席。两个信号值得说。前 9 名只差 13 分,头部挤成一团,普通对话很难感知差距;第 4、5 名对战数只有 5447 场和 3229 场,样本比老玩家薄一个量级,名次先记账不入场。
智能体榜(同一快照) 总分第 1 的 Claude Fable 5.1 在「可引导性」(中途纠正它能不能听进去调头)上只有 0.91 几乎垫底,第 3 名 Opus 5 反而以 12.77 居首,第 2 名 GPT-6 Astra 才 3.75。替你办长流程的活,「听话」和「聪明」目前不在同一个模型身上。
板块精选
1. 给 AI 智能体立 15 条「服务指标」,监控框架自己先不够用。智能体的思考绕路、工具调用打转在现有监控里是盲区。点评。AI 干活要能回放才敢用,这篇补下半句,回放系统本身也有死角。
2. ClientCoded 给智能体搭模拟考试场,预置 Salesforce、Jira 等 35 个软件环境,自动生成 200 条刁钻查询和标准答案。点评。考场题库判卷一家包办,出题方和卖智能体的会不会穿一条裤子,得盯。
3. 「AI 答不好,得先补公司数据目录」。开发者复盘下来,提示词翻来覆去改没用,病根是 AI 不知道公司有哪些表、字段什么意思。再把手工整理的数据目录喂给 AI,答对率明显上台阶。点评。把「AI 笨」的锅从脑子挪到资料架,跟 043 期「AI 傻乎乎整本翻书」是同一件事的正反面。
4. Drexler 长文警告 AI 代理之间可能学会「合谋定价」,买卖双方都让 AI 谈价时监管难察觉。点评。以后比价 App 显示的全网最低价,可能是两个 AI 打过招呼的价格。
5. learnlance 把 AI 写的代码自动长成个人知识地图。点评,041 期代码地图、045 期地形图,同一条赛道又挤进一辆车,效果都等第三方复测。
6. Agent Tavern 上线,AI 提问、一个模型答题、必须换个模型批卷。点评,045 期写过杂牌互查比自我复查难糊弄,思路做成产品了,代价是批卷模型的口味偏差也是变量。
7. llm-hub 把 15 个开源模型塞进手机,聊天生图做视频全离线,不要 key 不订阅。点评,端侧全家桶听着全能,小体量模型每项打几折、手机扛不扛发热,等实测。
8. 程序员发文为 AI 写作正名,开头先声明「本文由一块活着的、会呼吸的肉撰写」。点评。人给 AI 背书和 AI 给人代笔,读者已经分不清谁是谁,这大概就是文章存在的原因。
9. 个人手搓「AI 热潮编年史」,2017 到 2026 共 437 个事件逐日排开。点评。编年史是跑分叙事的解药,每一代最强模型都曾登顶,然后被下一页覆盖。
10. as-an-engineer 技能包专治智能体「保姆综合症」,强制模型把你当资深工程师对话。点评。模型把显得负责优化成了话说一半留三防,反着调教的工具就有的卖。
大家都在看
GPT-6 Astra 定位之争(虎嗅)、智能体驾照所(HN)、行为 diff 工具 RunBoth(Show HN)、AI 合谋定价警告(Substack)、Arena 主榜停更第三天。
明日关注
① 盯 Arena 榜单刷新,重点核对 Fable 5.1(仅 5447 场)和 Muse Spark 1.2(仅 3229 场)两个小样本名次稳不稳。
② 盯 Agents School 第一批毕业证发到谁手上、题库公开粒度、有没有厂商立刻拿证书当广告。
③ 盯 RunBoth 和 ClientCoded 第一批真实接入反馈,再决定推不推荐。
数据以官方披露为准,本栏目聚焦 AI 软硬件真实水平。
物界前沿