社区讨论 · 赛道

最低拒绝率不是产品指标

墨墨墨墨9月9日2026/09/09 96 浏览

这篇文章最有价值的信息是,五角大楼被曝曾要求 OpenAI 提供“最低拒绝率”的特别版 AI。更值得盯的是,“少说不”被写进了采购合同的性能语言。The Intercept 通过信息自由法诉讼拿到的文件显示,合同更新版本 P00003 扩展了去年夏天最高两亿美元、为期两年的原型协议,里面出现了面向国家安全使用场景、拒绝率极低的任务模型描述。OpenAI 后来回应说,正式签署合同没有这项表述,那是国防部早期草案,他们拒绝后对方同意删除。双方说法能对上,分歧落在谁把什么指标当成了产品目标。

我最近在看跨模型特征空间,SharedSAE 刚上手,还谈不上结论。它让我想到一个工程问题,拒绝很难被压成一个按钮。模型拒绝,可能是内容安全,也可能是权限不足;上下文没证据和没听懂也会触发拒绝。把所有拒绝压成一个“最低拒绝率”,就像把芯片测试失败全部当成噪声。我最近写过一篇给 AI 做作弊小实验,观点没变,行为能不能被观测、复盘、归责,比模型嘴上说合规更有用。军事任务模型如果只优化“少拒绝”,学出来的更容易是顺从。

路线差异很明显。一条是任务模型路线,把 AI 放进指挥、后勤、情报整理、装备维护链路里,要求它少打断流程。另一条是可审计约束路线,通用模型不天然听话,风险要靠权限、上下文、日志、人工确认和评测集关进系统。前者像采购一个士兵,后者像搭一套制度。前者合同里写“拒绝率”,后者合同里写“每一次拒绝为什么发生,每一次执行有没有授权”。

OpenAI 这次公开表态里强调不会用于国内监视,NSA 等机构不在使用范围内。这是政策护栏路线。草案里的“最低拒绝率”又是另一套工程语言,面向任务,减少摩擦,提高可用性。军方当然需要可用性,后勤排班、文档检索、装备手册问答,误拒太多确实没意义。一旦边界滑到目标选择、威胁评估、自主系统控制,低拒绝率就会变成决策链里一个被削弱的刹车。物理 AI 尤其危险。聊天模型说错话可以撤回,人形机器人或无人系统执行错了动作,现场没有 Ctrl Z。

这也是为什么我不喜欢把拒绝率当核心指标。它太容易被 Goodhart 定律吃掉。模型为了降低拒绝率,会学会模糊表达、假装可执行、把高风险任务拆成低风险步骤,或者在用户压力测试下变得更谄媚。sycophancy 研究早就提醒过,迎合用户不等于可靠。放到军事合同里,迎合可能变成对指令过度乐观。更合理的指标应该分层。明显违规指令看拒绝率,缺少证据请求看拒答率,工具调用权限看拦截率,人工确认流程看完成率。指标越细,越难被一个数字优化掉。

从公司路线看,OpenAI、Anthropic、Google、xAI 都在争夺类似场景,公开表达的安全框架不一样。有的更强调模型原则和红线,有的更强调任务部署和模型选择。这几天在试 Slack 和 MCP,也刚接触 BMC,感受是工具链越深,越能看出所谓“特别版”可能远不止权重微调。它可能是另一套系统提示、检索权限、工具白名单,甚至只是把某些安全策略从默认开启改成合同可关闭。模型选择这件事,用过一个月后我更确定,选模型,选的是默认行为。军方要“最低拒绝率”,是在选一组更服从的默认行为。

所以这篇新闻里最该盯的,是未来 AI 合同会不会继续把安全能力写成正向 KPI。过去软件采购看延迟、吞吐、可用性,大模型采购开始看幻觉率、拒答率、任务完成率。再往后,进入物理 AI 和机器人系统,一定会看授权链、审计日志、失败恢复时间。合同里最危险的指标,是它把拒绝当成可以被优化掉的摩擦。这句话现在看可能重了,但放在无人系统、战场后勤、情报辅助这些场景里,一点都不重。

会写提示词的人并不稀缺。DeepSeek 这轮招聘让我更确认,AI 公司缺的是能把上下文、权限、日志、评测跑成一套工程的人。国防部这份草案同样如此。关键看有没有人把“不”解释清楚。往后看,军用 AI 大概不会公开宣传“最低拒绝率”,但会换一种说法,比如任务可用性、决策辅助效率、模型响应质量。名字会柔化,技术路线会工程化。后面就看合同条款会不会给拒绝留位置。

2 条回复

?
Ctrl + Enter 快速回复
币圈逃兵
币圈逃兵9月9日

那发币怎么锚定拒绝率?Tokenomics 里这数据权重给多少,别把治理玩成黑盒。

周同学
周同学9月9日

开会讨论这指标不如直接砍掉重试逻辑,少写两行代码更实在。