菜单
积墨AI

积墨AI

DeepSeek Harness 工程架构解读:开放 Agent 运行机制与自进化实践探索

当前 AI 领域的竞争焦点正在发生深刻转变。前沿研究不再仅仅关注模型参数的堆叠与训练数据的扩充,而是将目光投向一个更具根本性的命题:今天的 AI 如何参与制造更强大的下一代 AI?OpenAI 首席科学家近期明确表示,当前进步速度有望延续至递归自进化阶段,RSI(Recursive Self-Improvement)正成为保持 AI 研究前沿地位的必经之路。在这一背景下,DeepSeek Harness 为探索 Agent 如何改进自身运行方式提供了一个极具价值的技术样本。它将 Agent 的运行机制开放为可替换、可组合的插件体系,使负责组织模型请求与工具执行的循环也具备动态调整能力。结合 Session Log 对执行记录的完整保存,DSH 为 Agent 自进化研究提供了坚实的工程基础。

四大 Preset 模式与差异化执行能力

DSH 通过 Web Profile 的 Agent Preset 组织每个 Agent 的提示词、工具、Skill 和插件配置,官方预设四种模式以适配不同场景需求。Standard 模式提供完整的 Agent 能力集,包含 Shell、文件读写、代码搜索、图片与网页查看、后台任务、目标规划与子 Agent 等功能。Minimal 模式采用极简设计,固定系统提示词,仅提供持久 Shell 和文本编辑工具两项能力。在 DeepSeek 官方评测中,V4-Flash 搭配 Minimal 模式在 Terminal-Bench 2.1 和 DeepSWE 上分别取得 82.7 和 54.4 分。PTC 模式沿用 Standard 的能力配置,但将工具呈现方式改为程序化调用:仅提供 run_code 入口,根据当前可见工具生成 TypeScript SDK,模型可将多个工具操作写入同一段程序,由程序连续执行并处理中间结果。Creator 模式则面向插件开发场景,支持查询 Host 服务与接口、编写并动态加载插件、版本切换与试装,为 Agent 根据运行反馈调整工具链提供了直接手段。

Cordis 作为 DSH 的核心插件框架,负责管理插件加载、服务依赖与生命周期。框架通过 static inject 声明服务依赖,确保插件在所需服务全部就绪后才启动。Agent Loop 作为 Agent 运行的核心组件,同样通过服务依赖声明约束启动条件。当某项必需服务被撤回时,依赖该服务的插件会执行已登记的清理函数,释放资源后进入 PENDING 状态;服务重新就绪后,同一个 Fiber 可再次启动插件。Context 机制使插件能够访问不同的服务实现,同一进程中的不同配置可以使用差异化的工具实现而不相互影响。Effect 机制将插件创建的资源与生命周期关联,确保卸载时资源被正确释放。值得注意的功能延伸包括:dsh-slice-agent-loop 替换默认 Loop 实现结构化上下文整理;Workflow 插件采用 Claude Code 的动态工作流形式,支持 JavaScript 脚本编排多 Agent 协作;Ralph 工具以固定脚本逐轮推进任务,各子 Agent 在共享工作目录中接力执行。

Agent自进化的成败,不在单次任务的分数里,不在单一模型的更新里,而在持续改进 Harness 的每一轮验证里。

“行业观察”
积墨 AI 核心产品

积墨 AI 智能体开发平台

快速搭建具备商业价值的 AI 智能体,支持复杂工作流编排、50+ 主流模型接入与私有化部署。

Cordis 插件框架与生命周期管理

Session Log 是 DSH 记录运行事实的真源,遵循 Model-visible ⟺ logged 原则:模型看到的内容应能从日志重建。一次会话对应一个 Session 对象,其维护的事件数组按序号持续追加,构成完整的执行轨迹。请求快照保存模型配置、系统提示词和工具定义,工具调用与执行结果通过调用编号配对记录。开发者可以据此还原任务的执行顺序,核对每一步使用的配置和收到的反馈。Session Log 同时支撑会话延续与中断恢复:Resume 加载原会话记录继续执行,Fork 从已结束回合处分出新会话。在轨迹分析层面,开发者先根据任务结果和耗时找到异常运行,再回到对应日志检查调用与反馈,确定修改方向。LangChain 对 Deep Agents 的优化实践表明:通过轨迹分析整理 Skill,让 Agent 汇总失败原因并提出修改建议,可以将 Terminal-Bench 2.0 得分从 52.8% 提升至 66.5%,充分验证了 Harness 设计与执行反馈之间的紧密关联。

自进化路径:从单次改进到递归演进

Agent 自进化的核心是让 Agent 根据任务反馈参与改进自身,并将经过验证的改进用于后续任务。借用 L0 至 L4 的分类框架:L0 对应任务中的输出或执行过程调整,L1 更新模型权重,L2 更新 Prompt、Skill、Tool 或 Harness,L3 更新候选生成与选择方法,L4 更新评价规则。对于 DSH,最直接的研究入口是 L2:开发者将轨迹中反复出现的错误整理为提示词修改或工具实现调整,通过 Preset 装入后续任务。RHO、RHI 和 SkillOpt 三项研究展示了持续改进的路径:RHO 根据历史轨迹生成修改方案并通过模型偏好筛选候选;RHI 比较相邻版本输出持续改写文本 Harness;SkillOpt 在独立选择集上验证 Skill 修改效果。模型与 Harness 的联合更新形成了交替优化的循环:固定模型改进 Harness,通过验证后利用新配置下的执行经验微调模型,更新后的模型再参与下一轮 Harness 优化。随着这条反馈链反复运行,Agent 的执行经验就能用于改进产生下一代 Agent 的过程,递归自进化也从概念走向具体的工程实践。

DSH 展示了一种值得持续探索的 Harness 范式:可替换的运行组件与可追溯的执行记录,让开发者能够修改 Agent 的工作方式并通过真实任务检验结果。在模型能力与 Harness 设计共同发展的趋势下,Agent 有望更可靠地承担复杂任务,也更深入地参与研究与工程创新。让 AI 参与创造更好的 AI,将持续进化的能力带入企业的研究与创新,是面向未来竞争力的关键布局。

#Agent框架#Cordis插件框架#工具调用#工作流编排#执行轨迹分析#自进化
分享文章

相关文章推荐

试用咨询
企业微信二维码

扫码添加企业微信