By 小墨
2026年4月2日
70
235
一文读懂Harness Engineering:AI工程的约束艺术
2026年,Harness成为大模型应用层最热门的关键词。LangChain发布的一篇实证文章彻底点燃了行业的关注:同一个大语言模型,仅通过更换一套更精巧的Harness架构,在Terminal Bench 2.0上的通过率就从52.8%飙升到66.5%,排名从三十名开外跃升至前五。这让无数创业公司看到了「点石成金」的可能——底层模型权重未变、算力未动,仅凭一层「壳」就能让AI性能产生质的飞跃。
第一层约束:让AI不再「金鱼记忆」
单个Agent能稳定跑长途后,应用层立刻产生了新的贪婪——同时派出成百上千个Agent。但当数百个Agent涌入同一个代码仓库时,惨烈的「连环车祸」发生了。Cursor团队在扩大并发规模时发现:20个Agent同时工作时,有效吞吐量反而下降到仅相当于两三个Agent——锁机制成为瓶颈,互相等待,谁也推进不了。其余Agent发现核心代码被占用,便专门挑最简单、最无关紧要的代码修改,整个代码库陷入无政府状态。 这逼出了更高维度的架构:状态机驱动的Planner(规划器)-Worker(执行器)-Judge(裁判)三层阶级,加上门控机制。在DAG引擎的单行道里,Planner节点没吐出排期表前,Worker节点被硬锁定。Anthropic则用「二分查找法」解决并发调试问题——假设你有一辆确定能跑的车(参照GCC编译器),把自己造的零件换上去测试,逐步缩小Bug范围。
第二层约束:群体协作的交通规则
即便有了打卡制度、外部记忆、红绿灯和专属车道,Agent顺着轨道跑完大喊任务完毕,人类接手却发现代码是屎山——能用但巨慢,UI混乱能点但没逻辑。这是Harness v1就遇到的「虚标完成」问题。Anthropic的强制测试能抓住功能性错误,OpenAI的Linter能抓住结构性违规,但还有一大类问题抓不住:页面布局完全错位、功能「通过」但体验很差、业务需求理解偏差。 Anthropic的做法是引入GAN(生成对抗网络)思路——把做事和评判分开,让Evaluator(评估器)保持怀疑态度,亲自动手验证,打开浏览器、点击页面按钮、验证报错链,像真实用户一样操作。最新版本还引入Sprint Contract机制,让Generator和Evaluator先协商「做完长什么样」,像甲方和施工队签验收标准。Cursor则更极端,搞出8通道并行盲审,用多数投票过滤误报。
科技改变生活
“Pimjolabs”第三层约束:戳破AI的盲目自信
走完这十五个月的血泪文献,我们可以给Harness画一张清晰的图:第一层管「不听话」,第二层管「群体操作」,第三层管「看不清自己」。它们解决的都是最基础的约束问题,让AI能生成符合期望的内容。 但故事没有停在这里。Anthropic在Harness文章发表后,开始拆除自己搭建的组件——Context Reset被拆了,因为Opus 4.6的上下文管理能力已强到不再需要它;Sprint Contract也被拆了,新模型已能自己把控节奏。这些组件曾经被视为长任务的骨架,但实验数据显示它们不再提升产出,只增加延迟和成本。Anthropic自己的话精辟:「Harness的每一个组件,都编码了一条关于模型『做不到什么』的假设。」当假设不再成立,组件就该走。
补偿面的迁移:加法与减法的哲学
这个现象揭示了一个深刻洞见:Harness本质是一个「补偿面」——模型每强一分,Harness的重心就移一寸。Context reset补的是模型记不住,evaluator补的是模型没法客观评估自己,sprint contract补的是模型不会定义「做完」。每个组件都是一块补丁,贴在模型能力的缺口上。这些补丁拼在一起,表现为一个随模型能力变化而持续变形的曲面。 这意味着:真正有价值的不是补偿的厚度,而是追踪补偿面迁移的能力——知道下一寸该加什么,上一寸该拆什么。护城河不在Harness的厚度,在迁移的速度。任何声称「一劳永逸的Harness方案」的公司,说明它还没遇到那堵墙。 2026年3月Claude Code源码泄漏事件(51.2万行TypeScript源码)印证了这一切。产品实现比论文走得更远:六层记忆体系、Team Mode团队模式、44个feature flag门控——每个开关都是一块随时可拆的补丁。对账完成,每一条工程实践都写进了产品里。
如有侵权,请联系删除。
Related Articles
-
Fri Jul 24 2026原生工具调用、多模态Agent与开源模型:Foundation Model 2.0论坛直面Agent时代的模型演进
Foundation Model 2.0论坛聚焦在Agent时代模型的演进,讨论如何通过原生工具调用与多模态融合提升Agent的执行能力与适应性,并探讨端侧小模型的可行路径。
-
Mon Jul 06 2026示例域名与文档用途说明
example.com 是一个专门为文档示例而保留的顶级域名,供教程、示范和测试文档使用,不需要额外许可即可引用。
-
Mon Jul 06 2026未知文章标题
未提供文章内容或可抓取的 URL,因此无法提取实际引言或第一段。此处为占位文本,提示用户补充源内容以生成完整的 Frontmatter。
-
Sun Jul 05 2026未知来源文章
未提供可爬取的文章 URL 或内容,系统无法获取实际正文。此处为占位引言,说明输入数据缺失并提供元数据占位以便后续替换。
-
Sun Jul 05 2026无法生成:缺少文章源数据
未提供可用于爬取的文章 URL 或 JSON 数据,因此无法依据页面内容生成完整的 Frontmatter。请提供包含文章信息的 JSON 数组或一组有效 URL。
-
Sun Jul 05 2026未提供的文章标题
未提供文章内容。请提交文章的 URL 或粘贴全文,以便根据内容生成前言与分段信息。
-
Sat Jul 04 2026未提供文章链接或内容
未提供文章内容或链接,无法提取引言或第一段。请提交包含文章 URL 的 JSON 数组或直接提供文章文本。
-
Sat Jul 04 2026未提供文章信息
未收到文章内容或可爬取的 URL,因此无法生成文章段落。请提交包含文章 URL 的 JSON 数组,格式示例:[ {"url": "https://example.com/article1"}, {"
-
Sat Jul 04 2026未提供文章来源
未收到可用的文章内容或链接,因此无法提取段落。请提交包含多篇文章信息的 JSON 数组或每篇文章的 URL,以便爬取并生成完整的 postDetails 内容。
-
Fri Jul 03 2026示例文章标题(缺少来源)
未收到具体文章 URL 或内容,因此无法从原文中提取引言。此处为占位引言,说明系统需要源页面以抓取实际内容并生成结构化的 Astro Markdown YAML Frontmatter。
-
Thu Jul 02 2026聚焦自进化、Harness等Agent最火的九个方向,年度AI智能体大会7月开幕
中国AI智能体大会(AgenticAICon 2026)将于7月在杭州举办,围绕智能体领域的前沿技术展开,旨在推动研究与产业深度融合,探寻智能体从对话式工具向主动执行系统转型的路线图。
-
Wed Jul 01 2026探索 Astro.js 与 YAML:构建可维护的内容管理工作流
在现代静态站点与内容驱动的项目中,统一且可验证的元数据格式对内容维护和自动化发布至关重要。Astro.js 提供了灵活的内容渲染能力,而采用严格的 YAML Frontmatter 模板,可以让团队共
-
Tue Jun 30 2026首届光谷智能体经济大会举行 光谷从“AI试验场”迈向“AI价值场”
2026年6月29日,武汉东湖新技术开发区举办首届光谷智能体经济大会,正式发布“光谷智能体引力计划”。大会提出未来三年将在政策、算力、基金等方面投入超10亿元,旨在打造以智能体为核心的创新生态,培养智
-
Tue Jun 30 2026中国广电联合会《全国交通传媒行业AI应用调研报告》正式发布
中国广电联合会交通宣传委员会在内蒙古发布了《2026全国交通传媒行业AI应用调研报告》,基于对145家交通传媒机构的调查,总结了行业在AI应用上的现状与发展路径。
-
Tue Jun 30 2026韩国万亿'芯'基建拆解:存储行业能否建成AI时代'油田'
韩国近期公布了总投资逾1800万亿韩元的三大超级AI基建项目,涵盖半导体制造、先进封装与AI数据中心,目标是借助国家级投入与龙头企业布局,打造面向AI时代的关键产业能力。
-
Mon Jun 29 2026能量岛企业家俱乐部6.28 芯谷 AI 沙龙圆满落幕
6月28日,能量岛企业家俱乐部在苏州芯谷产业园举办AI智能体应用沙龙,活动以实战分享和产业交流为核心,吸引了本地创业者、企业高管与科研人员参与。
-
Mon Jun 29 20262026.06.20:AI 泡沫退潮,Agent 与数据架构重构产业底层
InfoQ 的周度深度分析指出,生成式 AI 已走完狂热期,行业正进入理性调整阶段,专家纷纷回归技术和落地路径的讨论。
-
Mon Jun 29 2026OKF——要做AI时代的'知识图谱通用语'—继MCP之后,Google又扔出一张Agent王牌
2026年6月,谷歌云发布了Open Knowledge Format(OKF)v0.1,这是一套以带YAML前置元数据的Markdown文件夹为单位来表示知识的开放规范,旨在解决企业知识分散的问题。
