
没有反馈基础设施,Agent 只是一个有权限的猜测者
TL;DR
Harness 编排 Agent 的行动,反馈基础设施提供判断依据;企业缺失的能力不会因为接入 AI 自动出现。
没有金刚钻,别让 Agent 揽瓷器活
“没有金刚钻,别揽瓷器活。”
这句话放到今天的 AI Agent 身上,再合适不过。
很多企业把 AI 当成突然得到的那枚“金刚钻”。模型越来越强,再接上知识库、内部系统,配上一套 Harness,过去积压的问题似乎就可以直接交给它:写代码、查故障、处理工单,甚至独立完成一段业务流程。
但当 Agent 真正开始行动,问题很快就会从“它能不能做”变成另外四个问题:
- 它是否知道自己刚才做了什么?
- 它如何判断结果是否符合目标?
- 它看到的变化,究竟是不是由自己的行动引起?
- 当证据不足时,它知道下一步应该做什么实验吗?
如果这些问题没有答案,Agent 即使能够调用再多工具,也只是在执行自己的猜测。区别无非是,以前它只能在对话框里猜,现在它可以带着权限进入真实系统,把猜测变成代码、配置和业务操作。
真正的“金刚钻”不是模型,而是企业过去积累的工程能力、数据治理、业务判断和问题排查方法。企业原本没有的能力,不会因为接入 AI 就突然出现。AI 反而会把那些过去由人勉强补上的缺口集中暴露出来。
这里讨论的不是回答问题或生成内容的一次性应用,而是那些已经获得工具和执行权限、开始对真实结果负责的 Agent。对于它们,能够行动只是起点。
Harness 让 Agent 能干活,却不能保证它干对了
上回那篇《Harness Engineering 又来颠覆了——你们开发不写文档、没有研发流程?》,我把 Harness Engineering 拆成了三条原则:可见性、状态持久化和质量门禁。





