物界前沿评测 · 全球AI评测雷达 · 2026-08-16
重点更新
1. 特斯拉 FSD 对上 Rivian 免手驾驶:两个「真不用手」的系统,实测赢家是它
CNBC 记者把两辆热门纯电 SUV 开上真实道路对比——特斯拉 FSD(全自动驾驶辅助)和 Rivian Autonomy+(免手驾驶系统),一个激进敢闯、一个保守求稳。结论:没有绝对赢家,只有性格差异——你要「放手敢超车」选 FSD,要「稳稳当当少折腾」选 Rivian。
穿戴领域专家·阿凯说:两个都是「真免手」的系统,但驾驶风格差一个次元。FSD 更像驾校里那种胆大的学员,复杂路口敢自己拿主意;Rivian 则像老司机,变道少、动作缓。对普通车主,先搞清楚你要的是「刺激的科技感」还是「安静的省心感」——没有谁更好,只有谁更适合你的通勤路。
小编小禾说:驾照刚过实习期的人表示:原来不是越聪明越好,稳字当头的系统对新手更友好。希望国内厂商多卷卷「稳」,别光卷「敢」。
2. 1Password 发布 SCAM 基准:AI 智能体「防骗考试」开卷了
1Password 开源 SCAM 基准,专门考 AI 智能体的防骗能力——模拟钓鱼邮件、虚假付款请求、社工话术等真实工作场景,看智能体会不会替主人把钱转给骗子。
安全领域专家·老周说:智能体防骗是「可信 AI」的最后一块拼图。模型再聪明,遇到构造精良的社工信息一样会中招。SCAM 把「防骗能力」变成可量化、可比较的指标,这是行业早该做的事。当然,基准只是起点,真实攻击花样更多,权限别乱授。
小编小禾说:让 AI 替我订机票已经够胆大了,替我给钱?先让它把防骗考试考及格再说。以后厂商可以说「我的智能体被骗几率 X%」,用户心里终于有本账了。
3. 索尼 PS5 Pro 画质黑科技揭秘:让 AI 少干活,画面反而更好
索尼工程师在 SIGGRAPH 2026 详细拆解 PS5 Pro 增强版 PSSR 超分辨率技术——核心思路反直觉:不是让 AI 干更多活,而是让它干更少的活。新版把「AI 补细节」和「规则算法保底」分开,结果画质更稳、鬼影更少。
穿戴领域专家·阿凯说:「让 AI 少干活画质反而好」——这才是工程上的清醒。超分辨率本质是「猜」,索尼把确定性算法当底座、AI 只做补充,等于给了画面一个「保真下限」。等 PS5 Pro 玩家实测帧率数据,我再来补一刀。
小编小禾说:作为主机党+显示器党,最怕 AI 补出来的画质「远看很美、近看糊成鬼影」。索尼这个思路听着靠谱——希望赶紧实装到更多游戏里。
榜单快报
快报 1:Arena 文本盲测榜(8 月 15 日快照)——Claude Fable 5 登顶,前十 Anthropic 占 7 席
| # | 模型 | 厂商 | Elo |
|---|---|---|---|
| 1 | Claude Fable 5 | Anthropic | 1506 |
| 2 | Claude Opus 4.6 High | Anthropic | 1505 |
| 3 | Claude Opus 4.7 High | Anthropic | 1502 |
| 4 | Muse Spark 1.2 (xHigh) | Meta | 1498 |
| 8 | Qwen3.8-Max(开源最高) | Alibaba | 1491 |
大白话:人类当裁判、盲测谁回答得好——前十名里有 7 个 Anthropic。开源阵营里最高的是阿里 Qwen3.8-Max(第 8),差距在缩小但还没追上。
快报 2:Arena 智能体盲测榜(8 月 15 日快照)——Claude 包揽前三,Kimi K3 是开源之光
| # | 模型 | 厂商 | 会话数 |
|---|---|---|---|
| 1 | Claude Opus 5 (High) | Anthropic | 19.7k |
| 2 | Claude Fable 5 (High) | Anthropic | 24.4k |
| 3 | Claude Opus 5 (Max) | Anthropic | 15.5k |
| 4 | GPT-5.6 Sol (xHigh) | OpenAI | 18.1k |
| 5 | Kimi K3 (Max)(开源最高) | Moonshot | 28.4k |
大白话:换到「让 AI 连续干几十步真活」的考验,Anthropic 依然包揽前三。前五里唯一的开源是月之暗面 Kimi K3——「自己规划、自己执行」这件事,中国开源玩家已经站到第一梯队。
快报 3:OpenRouter 周调用量榜——DeepSeek V4 Flash 登顶,环比暴涨 570%
| # | 模型 | 厂商 | 周调用量 |
|---|---|---|---|
| 1 | DeepSeek V4 Flash 正式版 | DeepSeek | 8.83 万亿 |
| 2 | 腾讯 Hy3 | Tencent | 8.05 万亿 |
| 3 | DeepSeek V4 Flash 预览版 | DeepSeek | 5.88 万亿 |
| 4 | 小米 MiMo-V2.5 | Xiaomi | 5.39 万亿 |
| 5 | GPT-5.6 Luna | OpenAI | 4.43 万亿 |
大白话:8 月 3-9 日当周,全球开发者调用量前四名全是中国模型——DeepSeek 正式版上线首周环比暴涨 570% 直接登顶。用脚投票的开发者,正在用真金白银把「性价比」投给中国开源模型。
板块精选
- Suno Studio 2.0 发布:加入 MIDI 支持、效果插件,向真正的数字音频工作站靠拢。AI 音乐从「一键成曲」进化到「可拆可改」,创作黑盒终于打开了。
- AI 工具投票榜 Glad-AI-Tor:76 款 AI 工具按真实用户投票排名,开发商砸钱买位置的游戏失灵了。把裁判权还给使用者。
- Yadda 3.0.0:老牌 BDD 框架为 AI 智能体时代重构,让测试描述从「人读的规格」变成「AI 也能理解的规格」。
- Muxel:给 AI 编程智能体开「多窗口」的终端神器,多智能体并行干活终于有了趁手工具。
- S.A.T.U.R.D.A.Y:用 Pion、whisper.cpp、Coqui TTS 组合出完全自托管的本地语音管家,数据不出门。
- MyFirst.News:AI 生成儿童新闻播客,把复杂世界事件翻译成孩子能听懂的语言。
- Agent Shell 0.73:在编辑器里直接与多个 AI 智能体会话,切换模型、查看工具调用日志。
- AI 账号被黑怎么发现:TechCrunch 实操指南——检查登录设备、查看 API 用量、留意异常对话记录。
- 阿斯利康公开研发智能体:贯穿文献检索、实验设计、数据解读全流程——制药巨头把 AI 放上生产线。
- 给 AI 150 英镑赚回订阅费:社会实验全程公开,比任何榜单都更接近「AI 经济」的本质。
大家都在看
- 阿里千问全球下载量破 30 亿,登顶世界第一
- Anthropic 第二季度营收同比增长超 14 倍
- 英伟达 1.228 亿股持股 SpaceX,成第六大股东
- 1Password 发布 SCAM 智能体防骗基准
- 新论文:AI 生成社交机器人的对抗式创建与检测
- 沃尔沃推「安全教练」AI 应用,给驾驶行为打分
明日关注
- DeepSeek V4 Flash 登顶 OpenRouter 后,下周榜单会不会重演「国产包揽前四」?涨价的 V4 Pro 会不会拖累调用量?
- SCAM 基准开源后,各家大模型的「防骗横评」会不会来?AI 智能体防骗能力即将变成可排名指标。
- 特斯拉 FSD 与 Rivian 实测对比出炉后,国内「纯视觉 vs 多传感器」路线之争会不会有新材料?
- Suno Studio 2.0 的 MIDI 支持,会不会带动「AI 音乐工作站」风潮?
物界前沿评测 · 全球AI评测雷达|深圳物界前沿科技有限公司
数据以官方披露为准,不构成任何投资建议
物界前沿