物界前沿评测 · 2026-09-25
第 058 期 · 预览版
今天挑出来的是三件事:眼镜升级值不值、AI 互相判卷靠不靠得住、出错之后它能不能接住自己。后面还有三组榜单和十条精选。
==
重点更新
一、新眼镜多花的钱,大多买在「听得清」和「拍得稳」上
9 月 25 日 Engadget 把 Meta 新款智能眼镜和上一代摆在一起,一项一项比。新款动了通话收声、摄像头画质和电池,价钱也跟着涨了。文章给的结论很直白:这是一次小步升级,而加价不小。
穿戴领域专家·阿凯说|戴一整天你就知道了:眼镜这东西参数再漂亮,压鼻梁、镜腿发热、续航撑不过半天,最后还是进抽屉。上一代我戴满两周,拍张照得瞪着目标停一秒才按。这代要是真把收声和续航改好,通勤路上接电话确实实用。想买的先做一件事:去店里戴满半小时,再决定要不要多掏这笔加价钱。
小编小禾说|我一直想要副能拍照的眼镜,最怕买回来吃灰。这篇对比帮我定下验收办法:先看电池够不够撑一天,再看拍照要不要人定住不动。
来源:Engadget(2026-09-25)
二、十个 AI 就 15 个现实难题交作业,判卷的是它们的同类
9 月 24 日上 Hacker News 的一个实验,把 15 个现实难题丢给十个 AI 助手,每个先各自出方案,再把别人写的那份拿来互相打分。题目、各家答案、谁给谁多少分,全贴在网页上。原页写的日期是 9 月 23 日。
产品领域专家·阿哲说|我老说一句话:打分权从厂商手里拿回来,考卷才值钱。这次连判卷的都不是人,是同期考试的同类,谁也没法提前打招呼。要注意的是题只有 15 道、模型十个,名次会晃,先当方法看,别当权威。
小编小禾说|以后我再看到「某家 AI 拿下第一」的说法,会先问一句:谁判的卷,题目能不能看到。看不到的,我就不当结论用。
来源:Hacker News / Fix the World(2026-09-24)
三、有人给 AI 出了道自省题:你犯过的错,能自己接住吗
9 月 24 日 GitHub 上开源的 tapoo,只考一件事:AI 干砸一次之后,能不能自己发现、自己改回来。作者的说法很直接——各家发布模型时只亮最好成绩,出错之后的表现没人写。
编程领域专家·老徐说|这个思路我认。我们干活最怕的不是它错一次,是它错了还接着往下干,交上来的东西得从头核一遍。挑工具时我会多问一句:出错它报不报,能不能退回上一步。项目刚开源、题量小,先拿丢了不心疼的小模块试一周。
小编小禾说|上周我让 AI 帮我改表格里的公式,它改错了还在那儿一本正经地往下算。现在我让它改完先停下,给我看一遍再动。
来源:GitHub / Hacker News(2026-09-24)
==
榜单快报
综合智能榜 · 数据截至 2026-09-25(Artificial Analysis,实时刷新)
1. Claude Opus 5.5(最高档)|Anthropic|58
2. Claude Opus 5.5(次高档)|Anthropic|56
3. Claude Opus 5.5(中档)|Anthropic|54
4. Claude Fable 5.1(最高档)|Anthropic|53
5. GPT-6 Astra(最高档)|OpenAI|53
这张榜把知识、做题、写代码、动手办事几项合成一个总分,分越高越全面。前五名里四席是 Anthropic,唯一挤进来的是 OpenAI 的 GPT-6 Astra。同一个模型按「它想多久」分档排,慢慢想的那档分更高。开源阵营最能打的是小米 MiMo-V2.6-Pro,46 分;往后是智谱 GLM-5.3 的 45 分、月之暗面 Kimi K3 的 44 分。这张榜实时刷新,今天看和明天看数值可能不一样。
快慢与花费榜 · 数据截至 2026-09-25(Artificial Analysis,实时刷新)
1. 出字最快:Celeris-1,每秒约 1505 个字
2. 紧跟其后:Mercury 2.5 / Mercury 2,每秒约 770 字 / 761 字
3. 干一件活最便宜:GPT-6 Luna(低档),约 0.0045 美元
4. 第二、第三便宜:Granite 4.2 3B / Ministral 3 3B,约 0.01 美元
同一天、同一家的数据,换个角度就完全不同:综合分排第一的那几款,这张榜上一个都没进。出字最快的那两款是专为「秒回」做的;最便宜的前三名全是小模型,本事有限、胜在便宜。挑工具按自己的活对号入座:偶尔用一次看单价,天天用看速度和月账单。
人类盲投文本榜 · 榜单暂未更新,数据截至 2026-09-13
1. claude-fable-5-high|Anthropic|1506(30,057 场投票)
2. claude-opus-4-6-high|Anthropic|1505(71,993 场投票)
3. claude-opus-4-7-high|Anthropic|1502(60,002 场投票)
4. muse-spark-1.2(xHigh)|Meta|1500(3,227 场投票)
5. claude-fable-5.1-max|Anthropic|1498(5,783 场投票)
这张榜的分来自普通人一对一投票:同一个问题给两个匿名模型答,谁答得好由人投,投得多分就高。前五名里四席是 Anthropic;Meta 的 muse-spark-1.2 排第四,可它只有 3,227 场投票,和第三名只差 2 分,位置还站不稳。快照仍停在 9 月 13 日,两周没动,这周上线的新模型一个都没进来。
==
板块精选
1. 一堆助手分工合作,把长片子一段段拼成完整故事
9 月 25 日谷歌研究博客放出一套办法:让多个 AI 助手分工,一段一段生成画面,再拼成一条完整的长视频,目标是前后剧情接得上、不跳戏。
点评:想用 AI 做长内容的人可以留意:眼下能生成的多是短片段,难点一直是「接起来还像一回事」。
来源:Google Research(2026-09-25)
2. AI 写的代码,交给另一个 AI 当测试员
9 月 25 日上线的 Canary 把「验收」做成了一件产品:AI 助手写完代码,它负责把程序跑起来,专挑这次改动可能踩坏的地方动手试,试出问题再交回给人。
点评:思路可以抄,边界也说清了:它只负责挑毛病,改不改、上不上线还是人说了算。
来源:Hacker News / Canary(2026-09-25)
3. 一副扑克机器人整包 1.5MB,在你自己电脑上跑
9 月 24 日 GitHub 上的 QuantPlay:一套用 AI 思路写的扑克程序,整个引擎约 1.5MB,下载一次就能在本机跑,不注册、不连服务器。
点评:想看看 AI 写的小程序能到什么水平,装一个打两局最快。别拿它的表现去推大模型的水平。
来源:GitHub / Hacker News(2026-09-24)
4. 市面上的语音记录笔卖 159 美元,有人花 25 美元自己攒了一台
9 月 25 日 Hacker News 上的 ZephClick:作者嫌这类小硬件太贵,自己搭了台 25 美元的替代品,整理和翻译在自己设备上跑,也能接自己的账号。
点评:愿意动手的人能省一笔钱;不想折腾的人也能看清这类小硬件里有多少是外壳和牌子的钱。
来源:Hacker News / ZephClick(2026-09-25)
5. 算数这件事,有人做了个只在你自己电脑上跑的计算器
9 月 24 日 Hacker News 上的 Axiom:一个本地优先的 AI 计算器,题目只在你自己的设备上算,一步一步把过程写出来,不往云端传。
点评:拿它算账、核对数字,比在聊天框里问一句稳,关键是过程能看见。它算数不等于它懂你的业务,重要数字照样自己再核一遍。
来源:Hacker News / Axiom(2026-09-24)
6. 把论文变成能上手点一下的工具
IEEE Spectrum 在 9 月 24 日介绍了 Paper2agent:把一篇研究论文里写的方法,自动打包成一个能直接调用的工具,别人不用重写一遍代码就能试。
点评:做研究的人省事。普通人也能看懂一点:论文里的本事,正在变成点一下就能试的按钮。
来源:IEEE Spectrum(2026-09-25)
7. 给水电医疗这些关键设施做体检,AI 先扫一遍露出在外的门
9 月 24 日 Wiz 和谷歌 DeepMind 一起发布的行动:用 AI 帮着扫描关键设施的对外入口,把「没锁好的门」列出来,再交给人处置。
点评:方向对,也提醒一件事:扫出来的只是线索,谁去补锁、先补哪扇门,还得人来定。
来源:Wiz 博客 / DeepMind(2026-09-24)
8. 安全团队招了个 AI 实习生,专门去撞自家代码
9 月 25 日 GitHub 安全实验室放出新工具:让 AI 自动给自家代码喂各种乱七八糟的输入,看能不能撞出问题,撞出的每一处都留记录。
点评:冲着「让 AI 先替人找漏洞」去的,适合手上有一堆代码要护的团队。上线前先拿不重要的模块试。
来源:GitHub 博客(2026-09-25)
9. 聊天框不是万能的:什么时候该换个界面让 AI 干活
9 月 25 日 GitHub 官方博客的一篇文章,讲用 AI 写代码的几个常见场景:让它改一小块代码,聊天框合适;让它一次动很多文件时,聊天框反而看不清改了什么。
点评:天天用 AI 干活的人值得读一遍,能少走「一句话下去、页面全乱」的弯路。
来源:GitHub 博客(2026-09-25)
10. 有人给「AI 自己教自己」画了张草图,署名最后一位是梁文锋
9 月 24 日钛媒体解读了 DeepSeek 和清华大学的一篇论文。文章表面讲的是给 AI 助手用的沙箱,也就是一套关起来跑的隔离环境;第五节之后讨论的是让 AI 自己造环境、再用这个环境训练自己这条路线。
点评:眼下还是研究思路,普通人不用抠细节。记住一句就够:这条路真走通,AI 进步会更快,也更需要有人盯着它别跑偏。
来源:钛媒体(2026-09-24)
==
大家都在看
- 安全公司 Darktrace 的 CEO 说,会自动办事的 AI 助手正变成公司里的「新型内鬼」(Bloomberg Tech)
- 一家公司把新员工的 AI 权限全关了,先让人自己上手再逐步放开(Hacker News / Valon)
- 麦当劳的 AI 得来速点单员 Archy 上线,能用英语和西班牙语接单(Bloomberg Tech)
- Revolut 在英国试点刷脸结账,图的是少一步付款动作(Engadget)
明日关注
① Arena 那几个盲投榜还停在 9 月 13 到 15 日的快照,等它刷新,看 Claude Opus 5.5、GPT-6 Astra 这批新模型进不进榜
② Ray-Ban Meta Gen 3 才开卖,等戴满一周的人回话:镜腿重不重、通话能撑几小时
③ tapoo 那份「出错后自愈」考卷是自己出题自己记分,等别人拿同一批题复跑,看名次对不对得上
物界前沿