微软开源 Resource2Skill:把教程、代码和文档“炼”成 Agent Skill
当企业积累了大量教程视频、代码仓库和操作文档后,一个关键问题浮现出来:这些资源中的隐性经验如何真正转化为Agent的生产力?传统做法依赖人工编写Skill文档,但这种方式难以规模化。微软最近开源的Resource2Skill系统尝试回答这个问题——它能够从现有的教程、代码和文档中自动提炼出Agent可执行的技能,为构建可持续运营的Agent能力体系提供了新的技术路径。
五步流水线:从资源到可执行技能
Resource2Skill的核心定位是一座“技能工厂”,而非简单的摘要生成工具。它不是又一个新模型,也不是能把互联网全部啃一遍的超级爬虫。系统会调用Gemini等模型来理解演示画面并提取操作过程,但这只是流水线中的一个处理环节。整个系统更关注的是:如何发现资源、如何提炼经验、如何组织知识库、如何在运行时选择合适的技能、以及如何补齐能力缺口。
Skill表征:超越文字的复合结构
整条流水线可以拆解为五个关键步骤。第一步是资源发现,围绕特定领域或能力搜索相关视频、代码、文章和参考产物。第二步是经验蒸馏,系统会识别任务步骤、工具调用、关键参数、失败条件和验收方式。第三步是组织成Wiki,按照能力层级将大量Skill组织成结构化的知识库,而非平铺在文件夹中。第四步是选择和组合,Agent接到任务后先浏览层级结构,再挑选少量相关的Skill。第五步是执行与补缺,当现有Skill不足以完成任务时,系统会触发在线获取来补齐新的能力缺口。
Skill的真正价值不是让模型知道更多,而是让它在执行任务时减少遗漏、越界和返工。
“技术观察”积墨企业专属知识库
混合检索 + 重排序技术,支持多源文档一键向量化导入,为企业打造专属高精度知识大脑。
为什么Skill的价值远不止“视频摘要”?
需要特别区分的是,Resource2Skill的输出不是一篇视频摘要。摘要只能告诉Agent视频讲了什么,而Skill则需要明确下一步做什么、用什么工具、做到什么程度、失败了怎么办。系统在Skill表征中融合了文字描述、视觉关键帧和代码片段,因为大量GUI操作、时序动作和微妙参数调整本来就只存在于演示过程中,单靠文字很难准确描述。这也是为什么在实验中移除视频来源后,性能从68.9%下降到59.4%——视频不是为了让Skill看起来“多模态”,而是因为某些操作步骤天然依赖视觉信息。
三层核心价值与局限性
这套系统真正解决的不只是自动生成SKILL.md的问题。真正的难点在于:资料一多,哪些值得学?学完以后放在哪里?执行任务时应该选用哪几个?新旧Skill冲突怎么办?怎样验证使用后确实有提升?Resource2Skill同时处理了资源采集、经验蒸馏、层级组织、运行时选择、在线补缺和任务评测等多个层面的问题,试图交付的不是单个文件,而是一条可以持续生产和运营Agent能力的供应链。
如有侵权,请联系删除。
