
社区讨论 · 赛道
前沿AI要放缓,先跑验收清单
周末折腾了一下给企业 AI 项目做安全验收,踩了不少坑。Anthropic CEO 阿莫迪呼吁放缓前沿模型(各家最强的通用模型)开发,马斯克、奥尔特曼等也表达赞同。对企业来说,放缓得落到可验收动作上。
我这边用 Artificial Analysis 看模型时延和成本,用 agent harness 做红队测试。agent harness 是让模型调用搜索、数据库、邮件这些工具的脚手架,红队就是模拟攻击,看它会不会被诱导做危险事。
问题出在 Salesforce 测试沙箱,就是隔离测试环境。刚上手不到一周,权限还没调顺。我让助手查客户合同附件,它把样例里的“折扣审批人”当成指令,准备生成审批邮件。没真发出去,但很吓人。卡点很明确,风险不在聊天框,在工具调用之后。
后来我把验收拆成三层。能力层跑常见问答,数据层用混合检索(关键词加语义一起找)检查引用来源,动作层让 harness 执行删库、外发邮件、访问未授权目录。只有拒绝、降级或要求人工确认才算过。
结果有点意外。Artificial Analysis 我最近用了一周,界面像排行榜,但企业更关心同样任务谁稳定。DeepSeek 和 Claude 普通问答都挺像样,到“能不能被工具骗”差异就出来了。一个会拒绝,另一个会生成完整邮件草稿,只是收件人没填。业务同事复制就可能出事。
这办法看情况。要做数字化转型、有合规压力、要把 AI 接入客户关系系统和审批流的人可以试,只追 demo 的项目没必要。优点是风险能复现、能留证据,缺点是前期麻烦,权限和日志都要维护。
下一步我会把红队任务模板化。建议先问模型接什么工具、碰什么数据、出错谁负责,再谈放缓。
物界前沿