物界前沿评测 · 2026-10-03
第 066 期来了。这期三件重点:一件讲公开榜单的第一名搬进真活里未必好用,一件讲 AI 帮数据库翻出被漏掉的老漏洞,一件讲英伟达出了台能放桌上的小盒子,本地也能跑大模型。
重点更新
一、榜上第一的模型,搬进真活里不一定最好用
一家评测公司写了篇实操文,讲挑 AI 不能只看公开榜单的分数。榜单是拿统一题目考出来的,你的活却又长又杂,同一道题它拿满分,换成你要处理的那堆事,可能还不如榜上第五名。老徐的看法是:公开榜就像统一考卷,你项目里的活边界不清、报错还怪,考卷覆盖不到;他挑写代码的工具,从来先拿一个丢了不心疼的小模块滚一周,同一批活让它和手上这套各跑一遍,谁少出错用谁。小禾说她以后谁跟她说某某 AI 排第一,先拿自己平时那点小事试一次,好用再换。
二、AI 帮数据库翻出那些被漏掉的老漏洞
MariaDB 是套常用的开源数据库,很多网站的账号、订单都存在这类库里。他们今年拿 AI 帮忙翻代码里的安全毛病,翻出了不少人工看了很久都没找着的漏洞。老周提醒,AI 找漏洞是多一双眼睛,替换不了人的判断,它翻出来的东西得有人复核,能不能被真利用、影响多大还得人来定;拿它翻自家库别一上来就动生产数据,先放在只读的副本上跑。小禾说她以前只会等官方的补丁提示,现在知道还有这种主动翻漏洞的用法,但重要系统还是等专人确认完再动手。
三、英伟达出了个能放桌上的小盒子,本地也能跑大模型
英伟达发了台叫 DGX Spark 的小机器,内存 64GB,瞄准的是「在本地跑 AI」这件事。想用能力不错的开源模型,不用再租云上那台远方的机器,桌上这台就能干,资料不出自己家。阿凯说他盯的从来不是官网那个性能数字,是说明书之外的三件:满负荷烫不烫、风扇吵不吵、插电能撑多久;64GB 能跑的东西比普通笔记本多不少,但它终究是台小主机,想买先想清楚你是天天跑还是新鲜两天就吃灰。小禾说「资料不出自己家」这句对她有用,等降价、有人把发热和电费写出来再考虑。
榜单快报
这期主榜换成了 Artificial Analysis 的模型智能指数榜,已经更新,头名是 Anthropic 的 Claude Opus 5.5,58 分;OpenAI 的 GPT-6 Astra 和谷歌的 Gemini 4 Argon 都在 53 分这一档;开源里最高的是小米的 MiMo-V2.6-Pro,46 分。另外两张 Arena 的老榜(人类盲投文本榜、编程榜)这期没更新,数据分别截至 2026-09-30 和 2026-10-01,名次先别拿来挑工具。挑写代码的 AI,先看括号里的场次够不够多。
板块精选(10 条)
- AI 助手把你的密钥整包发了出去:让 AI 碰文件之前,先想清楚哪些东西绝不能进它的打包清单。
- 又开源一个「快速写报告」的模型:快是它的卖点,可报告写得好不好,还得你拿自己的材料试一遍。
- 一个接口,替你挑该用哪个模型:自动挑模型是省事,可你未必知道最后是谁在答你的问题。
- 让 AI 替你写测试,结果啥也没测到:测试不是写得越多越好,能拦住错的那几条才算数。
- 给 AI 装一个「懂你家公司」的脑:让 AI 懂你家的规矩,比换个更聪明的模型更实用。
- 客户室里,AI 先改一版,人点头才算数:AI 出主意、人拍板,这个分工才不容易出事。
- 给一句话,AI 帮你搭出乐高模型:这类陪你搭的工具,乐趣在过程,不在一步到位。
- 有人想给 AI 加一道「护住孩子」的闸:大风险还没来,眼前的小伤害才是多数家庭先碰上的。
- 两张照片,生成一段「酒店大堂说唱」:生成得越省事,越要想清楚,拿别人的脸去做视频得先经过同意。
- 给团队搭个「关起门来」的 AI 工作台:自己架、权限分得清,比功能多更能让人放心。
大家都在看
榜上第一的模型搬进真活里未必好用;AI 帮数据库翻出被漏掉的老漏洞;有人的 AI 助手把密钥整包发了出去;英伟达的本地 AI 小盒子 64GB 放桌上;给 AI 装一个懂自家公司的脑,有人把落地全过程写了出来。
明日关注
① 榜一不一定最好用那篇,盯有没有人拿中文模型再跑一遍对照。
② MariaDB 靠 AI 翻出的那批漏洞,等后续补丁落地、看有没有人复现。
③ 英伟达那台本地 AI 小盒子,等上手的人把发热、噪音、电费写出来。
物界前沿