Harness Engineering
一个 Agent 正在处理批量退款任务,Harness 负责注入权限、保存检查点、记录每一步,并在超时或评估失败时暂停。
AI 与智能体约 10 分钟 · 从真实需求理解
1Harness Engineering 是给 Agent 加上的运行护栏
HARNESS ENGINEERING · RUN CONTROL让 Agent 的每一步可控、可观测、可恢复
TASK → CONFIG → RUN → CHECK → GUARDHarness 不是 Agent 本身,而是围绕它配置工具、保存状态并执行运行护栏。
TASK INPUT批量退款资格检查
用户交给 Agent 的目标TOOLSREFUND READ · DRAFT ONLY
STATECHECKPOINT ON
POLICYRETRY 1× · TIMEOUT 8s
Harness 控制外围规则,Agent 只看到被允许的运行环境。
Agent 执行当前一步
状态已持久化 · trace #7f2a
EVALUATION GUARDRAIL等待评估
检查质量、权限和停止条件
Agent 负责围绕目标行动,Harness Engineering 负责把它放进一个可控的运行环境:工具接口、状态持久化、观测日志、重试和超时策略,以及评估护栏都由外围系统安排。
- 任务先经过 Harness 配置,Agent 才能看到被允许的工具、资源和执行限制。
- 每一步都要留下日志和检查点,失败或中断后可以恢复、重试或交给人处理。
- 评估护栏不让 Agent 因为“还可以继续”就无限行动,超时、质量不达标和权限异常都应触发暂停。
2Harness 不是 Agent,也不是一串日志
Agent 负责理解目标、选择下一步和提出工具请求;Harness 负责把这些动作放进可配置、可记录、可恢复的运行框架。它不是另一个会思考的 Agent,也不只是把输出打印到日志里。
- 工具接口和权限决定 Agent 能做什么,状态和 checkpoint 决定中断后能否接着做。
- 日志是观察证据,评估护栏才是继续、重试、暂停或转人工的判断边界。
没有这些外围能力,Agent 可能看似完成任务,却无法解释哪一步出错、重复执行是否安全,或者怎样从超时中恢复。
3Harness 的四个运行边界
一个可用的 Harness 至少要把配置、执行、检查点与观测、评估护栏分开,让每个运行结果都能找到责任边界。
- CONFIG 定义工具接口、权限、重试和超时,不把限制留给模型自己猜。
- RUN 让 Agent 执行当前步骤,但不拥有超出 Harness 的控制权。
- CHECKPOINT + LOG 保存状态和证据,支持恢复、排查和重复运行。
- GUARDRAIL 根据质量、权限、超时和人工确认决定继续、重试或暂停。
4怎样把 Harness 需求交给 Agent?
请为一个批量退款资格检查 Agent 设计 Harness:只开放退款查询和退款草稿工具,禁止直接付款;每次执行保存 checkpoint 和 trace 日志,状态可从中断处恢复。单步超时 8 秒时最多重试 1 次,评估结果不达标、权限异常或需要人工确认时暂停,不要继续调用工具。页面要显示任务、Harness 配置、当前 Agent 步骤、检查点、日志和最终护栏状态。
5不用背,看看你能不能判断
1 / 3
Harness Engineering 和 Agent 的职责有什么不同?
请选择一个最符合题意的答案
社区延伸
看别人真实遇到过什么
社区帖子还没有关联到这个词条。