物界前沿评测 · 2026-10-02
第 065 期来了。这期三件重点:一件讲 AI 找代码里的错有多依赖人指路,一件讲日本三人小队做的 AI 在漏洞比赛里拿了第一,一件讲 AI 靠看猫片学会做没见过的题。
重点更新
一、不告诉 AI 错在哪,它基本找不出来
有人做了张新考卷,把一整份真实代码仓库丢给 AI,只说一句「里头有错,自己找」,哪个文件、哪一行一概不提。结果大多数 AI 交了白卷。老徐的看法很直接:真项目里的毛病没人替你标好位置,能自己找出来才算本事;想试就先拿个丢了不心疼的小仓库滚一周,别直接上你在维护的那套。小禾说她以后让 AI 查东西,会先把「大概哪儿不对」讲清楚。
二、日本三个人做的 AI,在找漏洞比赛里拿了第一
日本小公司 Layer8 只有三个人,做的找漏洞 AI 叫 Trident,在漏洞悬赏平台 HackerOne 的 2026 年第三季度排第一。老周提醒,会找漏洞的 AI 也能被反过来用,先问三件:谁授权它扫、它一路做了什么、出事能不能一键停。小禾说这条让她更不敢乱给公司系统开权限,退掉不常用的助手那件事这周就办。
三、看猫的照片,AI 就学会做没见过的题
何恺明团队的新研究:先让 AI 看大量猫的照片,再看一种专考「没见过的新题」的卷子,叫 ARC,让它在没教过的题上抓住规律。这卷子不许背题,考的是能不能举一反三。阿哲说,AI 大多擅长背题,碰新题就露怯,谁先真会举一反三,谁才敢把更自主的活交给它。
榜单快报
这期三个榜(人类盲投文本榜、编程榜、实干能力榜)跟上期是同一份,没更新,数据截至 2026-09-30,名次先别拿来挑工具。要挑写代码的 AI,先看括号里的场次够不够多。
板块精选(10 条)
- 一个只会从清单里挑选项的模型,学不会说话:把话说死到只能挑选项,省了钱,但换不来会聊天。
- 盘点:让机器人动起来的 AI,现在是什么水平:机器人离进家门还早,先看清它会什么、不会什么。
- 为什么大模型没有变成只回背的复读机:抓规律是真本事,会胡说也是真毛病,两头都得防。
- 每一步都批准过,整件事还是办错了:管事不能只看每个动作合不合规,得回头看整件事办成没有。
- Cloudflare 开源了一批「做判断用」的小模型:不是所有判断都得请大模型出场,小模型够用还省钱。
- 英伟达出了套工具,专门关「乱来的 AI」禁闭:给 AI 装个能一键关禁闭的开关,比事后追责实在。
- 给写代码的 AI 一间互不打扰的独立小房间:多个 AI 并行干活,先隔开,出事也不连带。
- 把 AI 干过的活录下来,下次直接回放:重复的活没必要每次重新花钱。
- 一个小命令,帮好几个 AI 在同一份代码上各干各的:先分好支线,比事后找冲突省心。
- 有人把「训练大模型」的整套工具箱开源了:训练大模型的配方越公开,后来者越容易上手。
大家都在看
谷歌 Gemini 4 Argon 上线当天同时登顶好几个榜单;日本三人小队的 AI 在漏洞悬赏平台拿季度第一;英伟达放出能一键隔离乱来 AI 的开源安全工具;新考卷实锤不圈范围 AI 就找不出代码里的错;何恺明团队看猫片就能让 AI 学会做没见过的题。
明日关注
① 榜单这期没更新,盯 Arena 这几天会不会重算,或有没有新榜接上。
② 那张「不圈范围就找不出错」的新考卷,盯有没有人拿别家 AI 复跑一遍。
③ AI 找漏洞拿了第一,盯这套工具会不会被要求公开授权、一路留痕。
物界前沿