腾讯开源SkillHone:让AI Agent技能进化告别「失忆症」
在AI Agent开发实践中,技能(Skill)已成为扩展大语言模型能力的重要单元。无论是Claude Code、OpenAI Codex还是各类Agent框架,Skill都将任务说明、可执行脚本、参考文档和输出约定打包成可热插拔的操作手册。然而,一个长期被忽视的问题正困扰着开发者:当Skill在多轮优化中不断迭代时,决策过程中的关键上下文——为什么这样改、哪些方案被拒绝、评估发现了什么——往往随着最终产物的交付而彻底丢失。
SkillHone的核心设计:双仓库与角色隔离
这带来的后果远比想象中严重。以一个真实场景为例:两周前开发者调试好的搜索脚本因第三方接口变更而失效,优化后的新方案绕过了重试逻辑以提升整体效率。然而当下一轮优化启动时,后续Agent只拿到最新的SKILL.md快照,不知道"重试逻辑曾被测试并因拖慢流程而被拒绝"这一关键信息,恰好将已被证伪的方案又加了回去。这不是模型不够聪明,而是决策上下文在轮次之间断层了。
决策历史:比Git Diff更珍贵的知识资产
针对这一痛点,SkillHone框架提出了系统化解决方案。其核心设计包含两个关联仓库和三类执行角色:Skill仓库存储当前技能包的所有文件(SKILL.md、脚本、参考文档等),Skill-Eval仓库则存放评估资产(练习探针、验证器、执行轨迹、脱敏报告)。框架引入三类角色协同工作:优化Agent团队负责诊断问题、提出修订方案;评估Agent团队负责在探针上运行候选Skill并输出脱敏报告;调度器则作为消息路由器,负责在两侧之间转发信息并记录决策结果。
SkillHone证明'会记笔记的Skill优化器'在公开基准和内部工作流上都比'只交最终稿的优化器'更耐用。
“技术观察”积墨 AI 智能体开发平台
快速搭建具备商业价值的 AI 智能体,支持复杂工作流编排、50+ 主流模型接入与私有化部署。
实验验证:裸网设定下的显著优势
SkillHone的核心创新在于将每轮优化记录为包含四个要素的决策记录:诊断信息(D)——当前失败模式是什么;候选修订(C)——打算如何修改Skill;脱敏证据(E)——探针运行后的反馈摘要;决策结果(A)——接受、拒绝或暂缓。这种结构化记录与Git diff的本质区别在于:diff只描述"变了什么",而决策记录将变化绑回到"针对什么问题、依据什么证据、为什么接受或拒绝"。当环境再次变化时,后续Agent可以检索历史记录,判断这是新故障还是旧问题复发,避免将已经证伪的补丁重新引入。
论文选用Deep Research场景进行评测,该场景天然需要可复用的Skill来处理搜索、导航、抽取、验证和失败恢复等任务。在裸网开放网页设定下(无预集成搜索栈),SkillHone在GAIA基准上达到64.6%,比使用商业检索服务的Deep Research Agent(48.8%)高出15.8个百分点;在WebWalkerQA-EN上达到66.4%,同样领先3.2个百分点。值得注意的是,SkillHone的增益主要集中在L2中等难度任务(多步推理和跨源验证),相比Hermes-SE方法提升25.8个百分点,证明了流程组织而非组件堆叠是性能提升的关键。此外,将同一Skill包迁移到Claude Sonnet 4.6上执行,SkillHone仍保持10.2个百分点的领先,证明提升来自Skill流程本身而非过拟合特定模型。
如有侵权,请联系删除。
