DeepSeek Harness被谷歌盯上:Agent下一战场,开始从模型转向系统
当大模型的能力边界不断扩展,开发者们逐渐意识到一个关键问题:模型本身的智能水平并不能直接等同于Agent系统的实际表现。DeepSeek Harness的开源为这一命题提供了新的注解——它将Model、Tools、Skills、Sessions、Sandboxes、Storage、Loops、Scheduling和UI全部纳入插件体系,用「Everything is a plugin」和「Every run is traceable」两句话概括了全新的架构思路。这一设计迅速引起了技术社区的广泛关注,甚至被Google Cloud的高级AI产品经理拆解分析。
代码编排与治理的边界
在传统Agent系统中,日志往往是运行结束后的「录像」,而上下文则是模型实际接收到的信息。两者在任务执行过程中容易逐渐偏离,导致开发者只能回答「Agent做了什么」,却难以还原「它为什么会这样判断」。DeepSeek Harness通过将Session本身定义为append-only事件日志,改变了这一局面。模型看到的Message History通过deriveMessages()从事件流中派生,System Prompt、推理过程、工具调用、子Agent调度等所有信息都进入同一条事件流。
长期任务与Workspace设计
「原地打转」是Agent常见的失效模式——重复执行相同搜索、反复调用同一命令、工具没有带来新信息却持续调用。不同于简单粗暴的「重复三次禁止」规则,DeepSeek Harness提供了repeat-tool-reminder插件,它不会直接干预模型的决策,而是向模型注入逐级增强的提醒,告诉它「你已经用完全相同的方法尝试了很多次」。这种设计承认了重复行为在某些场景下的合理性(网络重试、异步轮询),同时将判断权交还给模型,系统只负责提供元认知信息。
模型负责产生智能,而Harness开始负责维护模型所在的「世界」。
“技术观察”积墨 AI 智能体开发平台
快速搭建具备商业价值的 AI 智能体,支持复杂工作流编排、50+ 主流模型接入与私有化部署。
Agent卡住时的自适应机制
第三个模式发生在Code Mode。当Agent需要执行复杂的多步骤任务时,传统Tool Calling需要模型与工具之间多次往返。DeepSeek Harness的Code Mode允许模型生成TypeScript代码,在程序中组合多个工具调用,将多轮交互压缩为一次代码执行。然而这里存在一个关键问题:如果模型能在一段程序里完成搜索、读文件、修改文件和执行Shell,是否会绕过原有的权限系统?答案是不能。Code Mode内部的子工具调用仍会重新进入Tool Registry的执行路径,形成独立的sub-dispatch并留下记录。底层的授权、Sandbox、Policy、Logging和Audit不会因被包进run_code就失去治理边界。
信息边界的明确表达
最后一个设计模式指向长期任务编排。一个名为Ralph的独立Workflow Plugin将长期Objective拆成多个Round,每轮启动新的Child Agent。新Agent不继承父会话或上一轮的完整对话历史,只获得不变的Objective、当前Round、共享Workspace以及上一轮的结构化Handoff。Handoff包含status、summary、evidence、next steps和blocker,有明确长度限制。这套设计的核心在于重新定义Agent应该持久化什么:代码已经写进文件,下一轮Agent不需要携带写代码之前的所有讨论;测试结果已经产生,重要的是测试输出和当前代码状态,而非生成这些结果的推理过程。
如有侵权,请联系删除。
