物界前沿评测 · 2026-09-29
第 062 期 · 预览版。别人做评测,我们做评测的雷达。每天 5 分钟,看懂哪些 AI 工具值得你用。
今天三件值得单独说的事:模型换代越来越快,钱花在追新上到底值不值;一场闭门会上说「以后测试比写代码更值钱」;AI 一脸笃定地答错时,办公室里谁在把关。
重点更新
1. 模型换代越来越快,公司砸在「调用能力」上的钱可能一半白花
TechRadar 这篇讲了一件事:现在 AI 模型几个月就换一茬,你今天花钱买来的本事,可能还没用顺手就过时了。
文章算的是企业的账——不少公司每年在调用模型上砸几百万、上千万,用的却常常是半年前那一版。它给的建议是:别把预算全押在「追最新」上,先把手上这版跑稳。
产品领域专家·阿哲说|厂商更新越快,用户越不敢重投,这是这门生意里一个绕不开的矛盾。我的看法是,模型会一直换,但入口和习惯是慢慢攒的——你在哪个工具里把一套流程养熟,比追哪个模型排第一更值钱。给普通人的动作很具体:常用的那个助手,别因为出了新版就整批换掉,新出的先拿不要紧的活试,稳两轮再动。
小编小禾说|我就是一有新模型就想换的那种人,结果每次刚摸熟又变了。这次听劝:手头这个用顺的留着,新出的先拿不重要的事试,不出岔子再说。
来源:TechRadar(2026-09-29)
2. 一场技术闭门会上的判断:以后测试会比写代码更值钱
极客公园记了一场做编程工具的闭门交流。
会上一个判断是:AI 把写代码的产量拉起来之后,真正稀缺的不再是「能写出来」,而是「能验出来」——谁来测、怎么测、测到什么程度算过关。会上还提了一种新硬件形态,大意是给 AI 单独配一台干活的电脑。
编程领域专家·老徐说|这句话我举双手赞成。我自己干活最花时间的从来不是敲代码,是确认它到底改对没有。AI 产量一涨,「怎么验」就成了新瓶颈:谁先把「什么算干完」定清楚,谁才能用得长久。给拿 AI 写东西的人一句实在话——让它交活之前,先把验收标准写下来,别等它交了一大堆你才现想怎么测。
小编小禾说|我听懂了,就是它写起来快,检查还得靠人。我能做到的一条是:让它改完先列个清单,我照着一条条点一遍。别整篇都信,也别整篇都不敢信。
来源:极客公园(2026-09-28)
3. AI 一脸笃定地答错时,办公室里会发生什么
TechRadar 这篇讲的是办公室里最常见的一种翻车:AI 把错的东西说得跟真的一样,人一看它这么肯定,就直接用了。
文章把这类情况和另一种风险摆在一起看——图快用 AI 的时候,谁在替结果的准确性把关。它给的提醒是:越顺手的工具,越要留一道人过目的关口。
安全领域专家·老周说|这种「笃定地答错」比明显答错更麻烦,因为它把判断的责任悄悄推给了读的人。我盯的从来不是它聪不聪明,是它出错时谁发现、多久发现。落到动作上:凡是它给的东西要往外发、要签字、要牵扯到钱的,先留一个人过目;重要的数字,回原始单据核一遍。
小编小禾说|我踩过这个坑。上次让它帮我写一份说明,里面一个日期算错了,它说得特别顺,我直接发出去了,被同事指出来才发现。现在我的规矩是:重要的那几处,我自己回原始文件核一遍再往外发。
来源:TechRadar(2026-09-29)
榜单快报 · 这周谁最能打
先说清楚口径:Arena 的几张榜跟上期是同一份快照,本期没有新变化,各组真实的更新日也不一样(文本和编程榜停在 2026-09-25,实干榜 2026-09-27,图片榜停在 2026-09-13)。今天能报的新数字,来自 Artificial Analysis 的综合智能评分。
综合智能评分(今日抓取,数据截至 2026-09-29)
| # | 模型 | 厂商 | 综合智能指数 |
|---|---|---|---|
| 1 | Claude Opus 5.5(max) | Anthropic | 58 |
| 2 | Claude Opus 5.5(xhigh) | Anthropic | 56 |
| 3 | Claude Sonnet 5.5(max) | Anthropic | 56 |
| 4 | Claude Opus 5.5(high) | Anthropic | 54 |
| 5 | Claude Fable 5.1(max) | Anthropic | 53 |
这份榜把各家模型放进同一批题里打分,分数越高,说明干得越全面。前五名清一色是 Anthropic 的 Claude。OpenAI 的 GPT-6 Astra 是 53 分,跟第五名并列;国产里最高的是小米的 MiMo-V2.6-Pro,46 分。
人类盲投文本榜(数据截至 2026-09-25)
| # | 模型 | 厂商 | 盲测得分(场次) |
|---|---|---|---|
| 1 | claude-opus-5.5-high | Anthropic | 1509(2,307 场) |
| 2 | claude-opus-4-6-high | Anthropic | 1505(76,518 场) |
| 3 | claude-fable-5-high | Anthropic | 1504(36,462 场) |
| 4 | claude-opus-4-7-high | Anthropic | 1502(64,007 场) |
| 5 | claude-fable-5.1-max | Anthropic | 1501(9,942 场) |
这张榜是人类一对一投票投出来的——两个人拿到同一个问题的两份答案,谁也不知道哪份是哪家做的。前五名被 Anthropic 一家占满。重点看括号里的场次:第 1 名只攒了 2,307 票,浮动正负 12 分,名次还在晃;第 2 名有 7.6 万票,更靠得住。
实干能力榜(数据截至 2026-09-27)
| # | 模型 | 厂商 | 净改进分 |
|---|---|---|---|
| 1 | Claude Fable 5.1 (Max) | Anthropic | 13.8 |
| 2 | Claude Opus 5.5 (High) | Anthropic | 12.2 |
| 3 | GPT 6 Astra (Max) | OpenAI | 10.3 |
| 4 | Claude Opus 5 (Max) | Anthropic | 9.6 |
| 5 | Claude Opus 5 (High) | Anthropic | 9.5 |
这组考的是让 AI 真上手干活(点鼠标、改文件)之后,有没有把事办成。分数叫净改进分,意思是结果比原来好了多少。头名是 Anthropic 的 Fable 5.1,第二是它家的 Opus 5.5,第三是 OpenAI 的 GPT-6 Astra。
板块精选
1. AI 聊天正在把我们的知识面越缩越窄。丹麦哥本哈根大学的研究者提了个醒:越来越多人靠 AI 聊天来了解世界,时间一长,我们碰到的知识会越来越集中在几件事上,剩下的大片空白没人再去看。一句话点评:别把 AI 当图书馆,它更适合当个帮你查个别问题的帮手。
2. OpenAI 要给自家 AI 助手补课了。The Verge 这篇说,OpenAI 是最早把聊天 AI 带火的那家,可在「能自己动手干活」这一类上,它落在了后面。文章提到它的年度开发者大会临近,外界盯着它这次拿什么补上这块。一句话点评:聊天强不等于干活强,这是两回事,挑工具先看你需要的是哪一种。
3. 什么样的 AI 产品算「认真」?这篇博客发了句牢骚:现在的 AI 产品看着热闹,可大多没把自己说的话当真——嘴上认某个道理,产品里却看不出来。作者顺手列了几个「要是认真做,会是什么样」的样子。一句话点评:判断一个工具靠不靠谱,先看它做到的和它宣传的是不是一件事。
4. 对着屏幕说「把这个改了」,AI 到底该懂哪个「这个」。屏幕上东西一多,你随口一句「把这个改了」,AI 很可能猜不准你指哪儿。这篇文章聊的是:在给 AI 用的界面里,怎么让人「选一下」这个动作更清楚、不容易搞错。一句话点评:你自己指得越清楚,它猜错的就越少。
5. 有人给 AI 装了一段「没人搭理时也在想事」的内心。一个开源项目让 AI 在不跟人聊天的时候,也留一段自己的「状态」:会记、会琢磨自己是什么、会好奇。整套跑在你自己的电脑上。一句话点评:听着新鲜,但「有内心」离「靠谱」是两码事,先当实验看。
6. AI 助手原地打转出不来,现在有工具能早点发现。让 AI 干长活时,它有时候会卡在一个圈里反复做同一件事。有个开源小工具专门盯这种「原地转圈」,能在它转起来的时候先报警,省得白烧时间和钱。一句话点评:长活最怕的不是慢,是它绕圈你还不知道。
7. 你的网站 AI 看不看得见,有个小工具能查。越来越多人靠 AI 而不是搜索框找东西。这个开源小工具走的是这个新方向:把你网站扫一遍,挑出让 AI 和搜索引擎抓不到内容的问题。一句话点评:能被 AI 抓到,才谈得上被它写进答案。
8. 一个下午,用 AI 做出能在四个苹果设备上跑的 App。一位开发者晒了段经历:从写第一行到最后能跑,大概用了五个小时,做出了在 iPhone、iPad 等四个苹果平台上都能用的 App。他说整套流程是把 AI 当搭子,自己盯关键处。一句话点评:一个人一下午的成品,先别当成团队的交付速度。
9. 给 AI 助手发一张「工牌」,管清它到底是谁、能干什么。一个身份管理产品专门给 AI 助手加了位置:像公司给员工发工牌和权限一样,给每个能自己干活的 AI 单独登记身份、限定它能碰到什么。一句话点评:先能叫出它的名字、说清它的权限,才谈得上管住它。
10. 把一叠法律文件变成能搜、能对的电子文本。这个工具处理扫描的法律文件:先认出每一段是哪一条,转成能搜索的文字,还留一条链回到原件。作者强调一句,查法条先要看来源对不对得上。一句话点评:它替你找到原文,判对错这步还得自己来。
大家都在看
- 阿里 AI 的增长之谜:云业务成了它转型的晴雨表(虎嗅)
- 做 AI 模型托管生意的 Modal Labs 接近完成 7.5 亿美元融资,估值 157.5 亿美元(TechCrunch)
- 投资人 Vinod Khosla 预测:多数机器人公司的估值到 2030 年会跌下来(The Information)
- 有媒体算了一笔账:AI 那笔藏起来的 3 万亿美元开销,可能压到全球经济(Telegraph)
- Meta 启动新企业 AI 平台,挖来 MongoDB 的前 CEO 挂帅(IT之家)
明日关注
1. Arena 那几张榜什么时候真正刷新:盯它别再连着几期发同一份快照,也盯各分榜标的更新日能不能落到同一周。
2. 开源权重模型(谁都能下载、装到自己机器上跑的那类)什么时候挤进综合智能榜前十:现在最高的小米 MiMo-V2.6-Pro 是 46 分,离头部还差一档。
3. 测试会不会变成比写代码更值钱的岗位:盯有没有公司先招专做 AI 测试的人,把「什么算干完」的验收标准写出来。
物界前沿