微软开源 Resource2Skill:把教程、代码和文档“炼”成 Agent Skill

2026年7月22日

48

567

微软开源 Resource2Skill:把教程、代码和文档“炼”成 Agent Skill

当企业积累了大量教程视频、代码仓库和操作文档后,一个关键问题浮现出来:这些资源中的隐性经验如何真正转化为Agent的生产力?传统做法依赖人工编写Skill文档,但这种方式难以规模化。微软最近开源的Resource2Skill系统尝试回答这个问题——它能够从现有的教程、代码和文档中自动提炼出Agent可执行的技能,为构建可持续运营的Agent能力体系提供了新的技术路径。

五步流水线:从资源到可执行技能

Resource2Skill的核心定位是一座“技能工厂”,而非简单的摘要生成工具。它不是又一个新模型,也不是能把互联网全部啃一遍的超级爬虫。系统会调用Gemini等模型来理解演示画面并提取操作过程,但这只是流水线中的一个处理环节。整个系统更关注的是:如何发现资源、如何提炼经验、如何组织知识库、如何在运行时选择合适的技能、以及如何补齐能力缺口。

Skill表征:超越文字的复合结构

整条流水线可以拆解为五个关键步骤。第一步是资源发现,围绕特定领域或能力搜索相关视频、代码、文章和参考产物。第二步是经验蒸馏,系统会识别任务步骤、工具调用、关键参数、失败条件和验收方式。第三步是组织成Wiki,按照能力层级将大量Skill组织成结构化的知识库,而非平铺在文件夹中。第四步是选择和组合,Agent接到任务后先浏览层级结构,再挑选少量相关的Skill。第五步是执行与补缺,当现有Skill不足以完成任务时,系统会触发在线获取来补齐新的能力缺口。

Skill的真正价值不是让模型知道更多,而是让它在执行任务时减少遗漏、越界和返工。

“技术观察”
🦞

JimoClaw — 桌面 AI Agent 工作台

让 AI 处理本地资料、操控浏览器,最终交付可直接使用的文档、表格与 PPT,而不只是一段回答。

下载桌面版

为什么Skill的价值远不止“视频摘要”?

需要特别区分的是,Resource2Skill的输出不是一篇视频摘要。摘要只能告诉Agent视频讲了什么,而Skill则需要明确下一步做什么、用什么工具、做到什么程度、失败了怎么办。系统在Skill表征中融合了文字描述、视觉关键帧和代码片段,因为大量GUI操作、时序动作和微妙参数调整本来就只存在于演示过程中,单靠文字很难准确描述。这也是为什么在实验中移除视频来源后,性能从68.9%下降到59.4%——视频不是为了让Skill看起来“多模态”,而是因为某些操作步骤天然依赖视觉信息。

三层核心价值与局限性

这套系统真正解决的不只是自动生成SKILL.md的问题。真正的难点在于:资料一多,哪些值得学?学完以后放在哪里?执行任务时应该选用哪几个?新旧Skill冲突怎么办?怎样验证使用后确实有提升?Resource2Skill同时处理了资源采集、经验蒸馏、层级组织、运行时选择、在线补缺和任务评测等多个层面的问题,试图交付的不是单个文件,而是一条可以持续生产和运营Agent能力的供应链。

🛡️

积墨 AI 安全隐患巡检系统

任务一键下达 · 隐患 AI 识别 · 整改全程留痕 · 报告一键生成。让安全巡检真正看得见、管得住、能闭环。

了解方案

如有侵权,请联系删除。

Related Articles

联系我们 试用咨询
小墨 AI