DeepSeek Harness重磅更新:14项改进全面强化多模态与子代理能力
开源Agent开发框架DeepSeek Harness于本月正式开启公测后仅一周,便迅速推出了首个重要更新版本v0.1.0-rc.8。此次更新共带来14项调整,堪称公测后的一次阶段性成果汇报。多模态能力成为这次升级的重头戏,标志着这款开源工具在视觉理解领域迈出了关键一步。
概述
rc.8版本最显著的变化在于多模态输入能力的正式补全。DeepSeek模型适配器现在支持通过配置启用原生图片请求,具备视觉能力的模型可以直接处理图片输入。更为实用的是,/goal、/plan等核心指令现已支持图文混合输入,用户可以直接将截图、流程图等视觉信息纳入任务上下文。此外,输入框新增的@菜单支持文件和会话引用功能,方便用户将本地文件或历史会话内容快速接入当前任务。
多模态能力全面补齐
子代理协作能力同样是这次更新的重点方向。新版支持将Claude Code和Codex作为Profile Bundle按需安装,其中Codex新增非交互权限模式和多个命名实例支持,便于在同一任务中配置不同的Codex子代理。这种灵活的子代理架构延续了"一切皆插件"的设计理念,让开发者能够根据具体需求自由组合和替换各种能力模块。
一切皆插件,让模型能力可以被拆开重组。
“技术观察”积墨 AI 智能体开发平台
快速搭建具备商业价值的 AI 智能体,支持复杂工作流编排、50+ 主流模型接入与私有化部署。
子代理体系持续扩容
针对Windows用户的实际使用场景,DeepSeek Harness的PTY终端新增了持久PowerShell会话功能,并在极简模式预设中默认开启,显著减少了命令执行过程中频繁重建终端环境的问题。同时,一批公测期间暴露的问题也得到了集中修复,包括大尺寸图片处理失败、流式生成取消后回复前缀丢失、自定义OpenAI兼容网关调用异常等问题。
终端体验与问题修复
值得一提的是,社区开发者还发现了DeepSeek Harness处理图片的另一套实现路径:当所调用的模型本身不具备视觉能力时,系统会退化为OCR文字识别、颜色统计、像素扫描等工具链,将图片拆解为结构化信息后再交给文本模型处理。这种"工具层视觉"的设计思路颇具启发性——视觉能力并不完全依赖底座模型,工具层同样可以承担一部分感知工作。在官方原生多模态支持之前,社区已经围绕视觉能力开发了dsh-vision、dsh-vision-toolkit、modlens等多款插件,形成了多元化的解决方案生态。
如有侵权,请联系删除。
