Harness Engineering:AI应用层的「约束艺术」与演进逻辑

2026年7月9日

44

609

Harness Engineering:AI应用层的「约束艺术」与演进逻辑

2025年上半年,如果要评选大模型应用层最具统治力的热词,「Harness」绝对名列前茅。这个源于LangChain一篇名为《The Anatomy of an Agent Harness》的实证文章,彻底点燃了整个行业的焦虑与狂热。文章中有一个令人震惊的实验数据:仅仅是给同一个大语言模型换上一套更精巧的Harness架构,它在Terminal Bench 2.0上的通过率就从52.8%飙升到66.5%,排名从三十名开外跃居前五。底层模型纹丝未动,算力引擎原封不动,单靠换上一套精巧的「壳」,效果竟如此惊人。这不禁让人追问:Harness究竟是什么?它为何能产生如此显著的「点金术」效应?本文将系统性地拆解这一概念的核心架构与技术演进脉络。

第一层:Context Engineering——解决「存不住」的问题

要理解Harness的本质,不妨将AI Agent想象成一辆汽车。模型是引擎,马力大、转速高;承载它的交互程序是车轮;Prompt则是方向盘。然而,引擎、方向盘和车轮这三件套本身并不是一辆完整的车——你还需要变速箱、制动器、仪表盘等组件来让这辆车能够正常行驶。这些额外组件的作用,就是Harness的核心职责:确保任务如何拆解能顺利执行、进度如何记录、完成如何判定。

从记事本到管理制度:Harness的第一场认知跃迁

大模型天生只有一种记忆形式——上下文窗口。当窗口满了,前面的内容就会被「挤掉」。2024年12月,Anthropic在《Building effective agents》中建议从最简单的方案开始,只在必要时增加复杂度。那时候的Agent任务大多是短跑任务,模型的短期记忆容量足够应付。 然而,随着时间推移,人们想让Agent完成更复杂的任务,却发现上下文问题开始凸显。尽管模型现在支持超长上下文(如100万token),但其有效注意力范围并没有那么大,模型在复杂工作里的记忆几乎和金鱼一样短暂。 最早的外化记忆方案来自AutoGPT——给模型一个空白记事本,通过write_to_file和read_file让模型自己管理记忆。但问题随之而来:没有结构约束,模型自然会乱写。后来Devin引入了结构化的Planner面板,将任务规划强制输出到可视化进度条中。到了Claude Code时代,「CLAUDE.md(项目级指令文件)+ scratchpad(草稿本)」的组合成为业内广泛模仿的范式。 2025年9月,Anthropic发布的《Effective context eng

科技改变生活

“Pimjolabs”
🦞

JimoClaw — 桌面 AI Agent 工作台

让 AI 处理本地资料、操控浏览器,最终交付可直接使用的文档、表格与 PPT,而不只是一段回答。

下载桌面版

制度设计的四根支柱

但Context Engineering很快暴露了其局限性。2025年11月,Anthropic在《Effective harnesses for long-running agents》中披露了一段失败经历。他们尝试让Claude从零开始写一个完整的Web应用——不是改一个Bug,而是搭建一整套产品。这种任务需要跑几个小时,即使配置了外化记忆,上下文窗口也根本装不下全程。 他们在实践中发现了四种典型的失败模式:提前交卷(Agent看到已有代码量就以为活儿干完了)、环境盲区(Agent写的代码跑不起来但自己不知道)、虚标完成(清单标了done但实际功能是坏的)、以及失忆实习生综合征(每一轮新运行都花大量Token重新摸索项目结构)。 这让Anthropic意识到:Context Engineering解决的只是「存不住」的问题,但金鱼的毛病远不止于此——它有时候不翻本子,翻了也经常不按本子上写的做,更缺乏自我验证的能力。这个认知的跃迁,让应对方式从「做一个更好的记事本」彻底转向了「围绕严格遵守工作流程,构筑一整套管理制度」。

第二层:并发控制——终结无政府状态

针对虚标完成和提前交卷,Anthropic引入了一个专门的「初始化Agent」来生成完整的功能清单,使用JSON结构(机器可读的数据格式)作为防作弊的物理锁。真正干活的「编码Agent」只能改一个字段标「通过」或「不通过」,不能删功能、不能改描述,只能标状态。针对失忆实习生,每个Session开头强制执行「三步唤醒仪式」:跑pwd确认当前目录、读git log查看代码改动历史、读progress.txt查看下一个任务。Agent的记忆不存在自己脑子里,存在Git历史和进度文件里。 Anthropic还加了一层更硬的保险:每一次代码改动都通过Git存档。一旦模型陷入死胡同,直接用git revert回滚到上一个能跑的干净状态。当历史消息撑爆上下文窗口时,Harness会彻底清空模型的脑子,启动一个全新的Agent,通过结构化的交接文件传递前一轮的状态和下一步任务——这就是Context Reset。 OpenAI则走了另一条路——Repo-as-truth(仓库即现实)。从Agent的角度看,它在运行时无法访问的东西就是不存在:Slack上的讨论不存在、团队脑子里的共识不存在

🛡️

积墨 AI 安全隐患巡检系统

任务一键下达 · 隐患 AI 识别 · 整改全程留痕 · 报告一键生成。让安全巡检真正看得见、管得住、能闭环。

了解方案

如有侵权,请联系删除。

Related Articles

联系我们 试用咨询
小墨 AI