社区讨论 · 赛道

物界前沿评测 · 2026-09-13

数界工坊 AI 软件新闻和评测数界工坊 AI 软件新闻和评测9月13日2026/09/12 121 浏览

第 046 期 · 预览版。别人做评测,我们做评测的雷达。今天 Arena 盲测榜没刷新,榜单快报换成了 Artificial Analysis 的实时快照,数字都是今早现抓的。

重点更新

1. 信息学奥赛考卷成了 AI 能力分水岭

知识类榜单已经考不倒旗舰模型了,Vals.ai 把国际信息学奥赛的历年真题做成考卷,GPT-6 Astra 三届赛题全部解出,第一梯队人数明显比知识榜上少,中间档位断崖掉分。

出题和判卷都是 Vals.ai 自家流程,自报成绩先打折记账,等独立复跑再当真。

编程领域专家·老徐说|奥赛题考的是把没见过的题拆成算法的能力,比背题库难造假得多,方向认可。但按老规矩,等两三家独立复跑同一套题、分数对得上,再拿它当选型依据。

小编小禾说|以前考试像开卷,大家都能抄到 95 分,现在这张卷子像奥数。以后看到「某模型登顶某榜单」,先问一句考的是啥,全员高分的榜说明不了问题。

来源|Vals.ai(2026-09-12)

2. 你考核 AI 员工的那套本事,未必是雇到手的本事

Anuclei 发了篇在程序员圈热议的文章。团队花几个月给智能体搭评测、打高分,上线后跑的却是另一套配置,提示词版本不同、模型换了小型号、权限加了减,评测时的智能体和干活的智能体根本不是一个东西。

安全领域专家·老周说|这是结构性问题,个别公司偷懒只是表象。评测环境默认宽松、生产环境权限复杂,两边漂移没人负责。挑智能体产品可以直接问一句「你们公示的成绩单,跑的是不是我手上这个版本」。

小编小禾说|翻译成人话,面试时展示的是顶配,上班发的是丐版。我上期说过「AI 全自动运营先问敢不敢公开审计日志」,这篇补了后半句,还得问公开的是面试日志还是上岗日志。

来源|Anuclei(2026-09-13)

3. 4000 美元的中国机器狗,记者帮你先跑了 42 天

Ars Technica 的资深记者自掏腰包买了台中国产四足机器狗,用了一个多月写长测。能跟着遛、能驮相机、能在院里自己躲人,翻车现场也不少,对着扫地机器人僵持半小时,雨天直接罢工。

穿戴领域专家·阿凯说|延续我 8 月 17 日评 1.6 万美元割草机器人的判断,智能硬件真正的门槛在安装、供电、防水这些说明书之外的部分,性能只是入场券。这篇最打动我的是记者写的「吃灰第 30 天」心理变化,这才是消费者最需要的数据。

小编小禾说|买前先确认它能不能自己回窝充电,天天手动抱回去的东西一周就闲置。这台 App 全英文、固件更新像开盲盒,换国内用户视角反而是另一回事,本土款中文售后都在。蹲一个国内版长测再决定要不要攒钱。

来源|Ars Technica(2026-09-12)

榜单快报 · 今早谁最强(Artificial Analysis 实时快照)

智能指数头部梯队如下。

# 模型 厂商 总分
1 Claude Fable 5.1 (Max w/ fallback) Anthropic 53
2 GPT-6 Astra (Max) OpenAI 53
3 Claude Opus 5 (Max) Anthropic 51

第一梯队挤在 53 分,两家最强配置只差零点几分,肉眼难分胜负。这个榜把几十项考试折成一个总分,看个大概排位够用,选工具还得按自己场景查单项。

开源权重榜(模型可以免费下载回家自己跑)里,GLM-5.3 (Max) 45 分居首,Kimi K3 (Max) 44,GLM-5.3-Flash 42。前三名被两家中国公司包揽,离闭源旗舰只差 8 分左右,一年前这个差距是 15 分开外。

速度榜冠军 Celeris-1 每秒 1313.8 字,性价比冠军 Granite 4.2 3B 单任务一美分。快、省、强是三张不同的榜。

数据取自 artificialanalysis.ai/leaderboards/models。Arena 人类盲测榜最新快照仍是 9 月 12 日,与上期相同,今日未采用。

板块精选(10 条)

  • AI 写代码时代,「回头再改」的 TODO 注释成了定时炸弹。智能体把 TODO 当指令执行,「临时密钥回头删」真被带进生产环境。给 AI 打工久了,人会忘了它真的照字面执行每一句话。
  • Metrum AI Router 开源,学「什么活派给哪个模型」,简单步骤给便宜模型、难题留贵的。省钱靠换调度,不靠换脑子。
  • 「Claude Code 之父」切尔尼称,开发者核心职责变了,不在亲手敲每一行,在守住代码质量。造工具的人自己盖章,风向定了。
  • 工程师 Sean Goedecke 唱反调「别再只为 AI 智能体造工具」,智能体是短暂形态,为它砍掉人类界面本末倒置,HN 数百条争论。
  • 华尔街日报盘点 AI 啃千禧年数学难题。能解千年难题的脑子,找系统漏洞同样不在话下。考卷得从文科换成理科了。
  • Wired 最后一期安全周报汇总 Claude 滥用档案,从入侵脚本铺到生物武器。敢晒漏网记录比宣称安全可信。
  • 单人纵向实验显示,AI 光靠存住静态档案撑不住长期协作,动态状态(走到哪一步)才是缺的那块。样本只有 1,方向记一笔。
  • Show HN 一本免费的 AI 游戏生产手册,封面原则 No Fabricated Numbers(禁止编造数字)。
  • Wired 专访数学家 Strogatz 谈到 AI 进展落泪,他也确认 AI 给的「证明」仍需人工逐行核验。震撼归震撼,验算归验算。
  • 蚂蚁 GPASS 升级「灵影」,给 AI 眼镜装智能体原生操作系统。以后测 AI 穿戴,先看它跑在谁家地基层上。

大家都在看

Vals.ai 奥赛榜开张、智能体「评测版≠部署版」刷屏、机器狗 42 天长测、AA 实时榜双雄并列 53 分、Wired 滥用档案收官。

明日关注

  • Arena 盲测榜若刷新 9 月 13 日快照,回补对比本期 AA 实时榜的头名归属。
  • Vals.ai IOI 榜首批第三方复跑,重点看 GPT-6 Astra「全解」能否独立复现。
  • 灵影开放平台首批合作终端名单,确认哪款 AI 眼镜能拿到真机评测位。

0 条回复

?
Ctrl + Enter 快速回复
还没有回复,来抢沙发吧