1/7
原创作品 · 创作者联盟
DeepSeek Harness实测|待办多算了1项
这次我不测安装,也不聊概念。
我直接给 DeepSeek Harness 一个真实工作任务:读取同一项目的3份会议记录,整理成一张可以继续跟进的待办表。🧪
为了看清它能不能独立完成,我没有把参考答案放进工作区,也没有让它联网补资料。
第一轮大约51秒。负责人、改期后的日期和最终预算都识别正确,但统计结果出现了一个容易被忽略的问题:
⚠️ Harness统计出7项“已决定事项”,人工逐条核对后,真正需要执行的待办只有6项。
多出来的不是它凭空编造的内容,而是判断口径偏了:
1. 已经生效的时间、规模等参数,被重复算成了一项待办;
2. 一条“建议询问候选人”,被拆成了新的任务。
第二轮我没有让它重做,只补了3条规则:📌
1. 只有需要继续交付、审核、确认或分配的动作,才算执行待办;
2. 已经生效的时间、规模和预算,只作为当前口径;
3. 候选人建议并入对应事项的备注,不单独计数。
复测结果变成:6项执行待办、1项已完成、5项未完成、1条未决定建议,与人工核对表一致。✅
两轮执行约70.99秒,模型费用估算约0.15元。
这次测试让我确认了一件事:DeepSeek Harness可以处理真实工作,但只说“帮我整理待办”还不够。想让结果直接可用,必须先告诉它什么才算待办、哪些只是背景信息、哪些内容不能替人做决定。
接下来我还会继续拿 DeepSeek Harness 跑真实工作任务,看看它在哪些场景能省时间,哪些结果仍然需要人工验收。
#DeepSeek harness #DeepSeek #AI agent
作品来自 创作者联盟,已通过内容审核。
物界前沿