同一个模型成绩差36%,YC揭示AI竞争胜负手转向Harness
YC(Y Combinator)近期举办了一场主题为《Why the Harness Matters More Than the Model》的分享,揭示了一个正在重塑AI竞争格局的核心判断:模型能力正在成为“给定条件”,真正的差距正在模型外部产生。这一论断的实证来自ARC-AGI-3最新测试——同一个模型GPT-6 Astra,在标准Harness下得分62.7%,而在Provider Adapter Harness下达到98.6%,分差接近36个百分点。更反直觉的是,得分更高的那组,成本还降低了约34%。大脑没换,仅仅是换了工作方式,Agent就变成了另一个水平。这组数据背后,藏着理解下一代AI竞争的关键。
Harness:大模型外部的运行框架
Harness的本义是“马具”——套在马身上、把马的力量传导到车上的那套装置。放在AI语境里,它指的就是大模型在完成真实任务时,外面那一整套运行框架:系统提示词怎么写、上下文怎么组织、能调用哪些工具、记忆存在哪、子Agent怎么分工、会话怎么管理。一个形象的区分是:模型决定“大脑有多聪明”,Harness决定“这个大脑干活时手里有什么”。Agent执行任务时,能看到哪些资料、能用什么工具、前面做到哪一步还能不能接着干,这些都不由模型决定,而由Harness决定。YC合伙人François Chaubard亲历过这种变化——他在试用Karpathy的自动研究项目时,最初只是想加个界面看清Agent在做什么,结果做着做着,资料检索、实验、评审、写作、进度管理陆续被接进来,无意中搭出了一套完整Harness,三四月份产出的论文还比较粗糙,到后来一次丢进去多个研究想法让系统自己跑,收回来的结果质量已经相当不错。
Harness正在从辅助工具成为优化对象
过去几年,Harness的重心一直是增加能力;现在,Harness本身开始成为优化对象。最先被优化的是提示词——以前提示词不好用靠人一次次试,现在DSPy这类系统可以自己尝试不同写法,用测试结果挑出效果最好的版本,把“调提示词”从手艺活变成搜索问题。第二步,优化Harness本身。Darwin Gödel Machine走得更远:它不只调提示词,还可以直接修改运行Agent的Harness代码,一套任务流程不好用就换一种写法,再用测试结果判断新版本是不是更好,在论文实验中把SWE-bench成绩从20%提高到50%。第三步,让历史经验进入下一版。Continual Harness补上了另一块:Agent可以回看过去的任务记录和结果,再决定要不要修改提示词、增加技能、更新记忆,或者调整子Agent配置——过去一次次跑任务留下的经验,开始沉淀进下一版Harness。这意味着,Harness和模型之间的边界,正在被打通。
AI落地的成败,不在模型参数的堆叠里、不在评测榜单的名次里,而在Harness的每一个设计决策里
“行业观察”积墨 AI 智能体开发平台
快速搭建具备商业价值的 AI 智能体,支持复杂工作流编排、50+ 主流模型接入与私有化部署。
分层设计让Harness价值在长周期任务中显现
企业场景中,当Agent真正进入公司,问题就不只是“能不能干活”了。YC内部探索从2025年初就开始,最早只是系统提示词、工具和任务循环,后来陆续接入Slack、定时任务和虚拟机,让Agent可以修改代码、运行测试,甚至拥有类似“自己电脑”的工作环境。但当YC把这套能力扩到全公司,问题马上出现了——团队一度在虚拟机里部署了50多个Hermes Agent,每个人都要单独配置;某个Agent出了故障,工程师还得逐个登录对应实例去排查和修复,维护成本随Agent数量线性增长。YC内部开发的QM Harness核心改动是:不再让Agent“住”在某一台机器里,对话、上下文和长期状态被集中保存,虚拟机和隔离环境则变成需要时再调用的资源,Agent可以根据任务选择不同机器,甚至切换模型服务商。但规模化之后,真实办公环境暴露了三个很难绕开的问题:Agent会把局部问题当成全局问题(“主角综合征”)、容易提前放弃任务、需要精细的权限边界控制。
企业Agent落地的运维与权限挑战
企业场景中,当Agent真正进入公司,问题就不只是“能不能干活”了。YC内部对Agent的探索从2025年初就开始,最早只是系统提示词、工具和任务循环,后来陆续接入Slack、定时任务和虚拟机,让Agent可以修改代码、运行测试,甚至拥有类似“自己电脑”的工作环境。但当YC把这套能力扩到全公司,问题马上出现了——团队一度在虚拟机里部署了50多个Hermes Agent,每个人都要单独配置;某个Agent出了故障,工程师还得逐个登录对应实例去排查和修复,Agent数量一多,维护成本立刻就上来了。YC内部开发的QM Harness核心改动是:不再让Agent“住”在某一台机器里,对话、上下文和长期状态被集中保存,虚拟机和隔离环境则变成需要时再调用的资源,Agent可以根据任务选择不同机器,甚至切换模型服务商。到了这一步,Harness的角色已经不只是“给单个Agent接工具”了,而是开始负责一群Agent的状态、资源和运行方式。但规模化之后,真实办公环境暴露了三个很难绕开的问题:Agent会把局部问题当成全局问题(“主角综合征”)、太容易提前放弃、以及权限边界的控制。YC目前的做法是大部分数据库权限保持只读,需要写入时先由Agent提出方案再由人确认,但人工审核本身也可能随着员工对Agent信任度提升而退化。
回到YC的核心判断:模型决定你能走多快,Harness决定你能不能一直走下去、走多远。当底层模型能力趋于同质化,真正拉开差距的将是外部运行框架的成熟度与适配性。对于企业AI落地而言,与其追逐模型参数的军备竞赛,不如先把Harness这层能力打扎实——这才是AI应用从“能跑”到“跑得好”的关键跃迁。
