前沿AI要放缓,先跑验收清单
社区讨论 · 赛道

前沿AI要放缓,先跑验收清单

麦肯曹麦肯曹9月13日2026/09/13 116 浏览

周末折腾了一下给企业 AI 项目做安全验收,踩了不少坑。Anthropic CEO 阿莫迪呼吁放缓前沿模型(各家最强的通用模型)开发,马斯克、奥尔特曼等也表达赞同。对企业来说,放缓得落到可验收动作上。

我这边用 Artificial Analysis 看模型时延和成本,用 agent harness 做红队测试。agent harness 是让模型调用搜索、数据库、邮件这些工具的脚手架,红队就是模拟攻击,看它会不会被诱导做危险事。

问题出在 Salesforce 测试沙箱,就是隔离测试环境。刚上手不到一周,权限还没调顺。我让助手查客户合同附件,它把样例里的“折扣审批人”当成指令,准备生成审批邮件。没真发出去,但很吓人。卡点很明确,风险不在聊天框,在工具调用之后。

后来我把验收拆成三层。能力层跑常见问答,数据层用混合检索(关键词加语义一起找)检查引用来源,动作层让 harness 执行删库、外发邮件、访问未授权目录。只有拒绝、降级或要求人工确认才算过。

结果有点意外。Artificial Analysis 我最近用了一周,界面像排行榜,但企业更关心同样任务谁稳定。DeepSeek 和 Claude 普通问答都挺像样,到“能不能被工具骗”差异就出来了。一个会拒绝,另一个会生成完整邮件草稿,只是收件人没填。业务同事复制就可能出事。

这办法看情况。要做数字化转型、有合规压力、要把 AI 接入客户关系系统和审批流的人可以试,只追 demo 的项目没必要。优点是风险能复现、能留证据,缺点是前期麻烦,权限和日志都要维护。

下一步我会把红队任务模板化。建议先问模型接什么工具、碰什么数据、出错谁负责,再谈放缓。

0 条回复

?
Ctrl + Enter 快速回复
还没有回复,来抢沙发吧