当AI学会自我成长:大模型时代自进化Agent技术全景解析
在传统机器学习范式下,模型的“聪明程度”取决于训练数据的质量和数量。一旦训练完成,模型对世界的认知便就此冻结——今天教会它的事,明天可能还会再犯;上下文窗口再长也有边界;每一次能力提升都需要重新训练,成本高昂。然而,随着大语言模型(LLM)本身具备的总结归纳能力,以及Agent形态产品的普及,一个新的研究方向正在崛起:让AI Agent学会“自我进化”——在交互中积累经验、提炼技能、并持续复用与提升。
技术路线一:经验存储型——给Agent配一本“工作笔记”
自进化Agent的核心诉求可以凝练为三个关键词:能存、能用、能进化。“能存”意味着将交互过程中沉淀的有价值信息——成功模式、失败教训、可迁移技能——完整保留下来;“能用”指在新任务中能够检索、调用这些经验,并内化进决策过程;“能进化”则要求经验本身是动态的,能够更新、合并甚至淘汰,避免积累变成混乱。
技术路线二:RL训练型——把经验真正“长进”模型里
第一类技术路线的核心特征是“不更新模型权重”,模型本身保持冻结,所有的“成长”都发生在外部存储中。这就像给Agent配备了一本工作笔记——需要时翻阅,用完继续记录。 这一路线代表工作包括AutoSkill、EvoSkill、MemSkill、CoEvoSkills和SE-Agent等。AutoSkill采用经典的双环结构,左环负责在线服务时的Skill检索与注入,右环负责从交互信号中抽取新技能并管理Skill库。EvoSkill则更进一步,通过三Agent分工协作——执行者记录失败案例、反思者分析根因、落地者将自然语言提案转化为结构化Skill——配合Pareto精英池筛选机制,确保Skill库始终保持“精而不滥”。在基于美国财政部89K页财务文档的复杂推理任务中,EvoSkill实现了7.3个百分点的显著提升。 值得特别关注的是CoEvoSkills和SE-Agent。CoEvoSkills将软件工程的“测试驱动开发”理念引入Skill进化——为每条新Skill配备专属“考官”,生成的Skill必须先通过单元测试才能入库,通不过则带反馈打回重写。更重要的是,论文通过对照实
Skill跟模型本身的'风格'是耦合的——强模型生成的Skill在强模型自己上效果最好;强迁到弱模型上,弱模型未必能完整地'读懂并执行'那些精巧的步骤。
“技术洞察”积墨 AI 智能体开发平台
快速搭建具备商业价值的 AI 智能体,支持复杂工作流编排、50+ 主流模型接入与私有化部署。
技术路线三:零数据自学型——Agent之间的“自我博弈”
如果说第一类是“工作笔记”,第二类则是直接把笔记上的经验通过强化学习“写进”模型的权重里,让Agent真正“长本事”。这是当前学术界与工业界最主流的研究方向。 SkillRL是该路线的基础性工作,由强模型(如GPT-o3)蒸馏Skill,再通过RL训练弱模型(如Qwen2.5-7B)学会使用这些Skill,并递归进化技能库。在ALFWorld、WebShop等基准上,SkillRL分别实现了12.3%和6.6%的提升,技能库从55条增长到100条。SKILL0则更激进——追求将Skill从推理时的“外挂上下文”完全内化到模型参数,实现零样本执行。其三阶段渐进课程设计精妙:先学会调用(6条Skill),再减少依赖(3条),最后完全内化(0条)——从“使用技能”到“内化技能”的范式转变消除了推理时的检索成本和Token开销。 SkillOS是笔者认为最具启发性的工作之一。它训练了一个专门的Curator(策展人)来学会如何管理SkillRepo——增、删、改——而不是直接学习如何使用Skill。实验结果令人深思:RL训练后的Qwen3-8B作为Curator,效果竟然超过了直接
范式演进脉络与关键洞察
第三类路线的精神更为激进:连数据集都不要,Agent自己出题、自己考自己。这让人联想到AlphaGo的自我博弈——通过完全自主的学习循环实现超越人类水平的能力。 Agent0采用双Agent架构——一个负责生成数学任务(Curriculum Agent),一个负责解题(Executor Agent)。出题Agent训练时,解题Agent冻住作为reward model;出题Agent冻住后,再训练解题Agent。Tool-R0将这一思路扩展到通用工具使用场景,通过格式reward、合法性reward和难度reward来激励高质量任务生成。Absolute Zero则最为彻底——单个模型同时扮演出题人和解题人,用代码执行器作为唯一的验证来源。题目以[输入, 代码, 输出]三元组形式存在,随机删除一个让答题Agent猜测,完全不依赖任何外部数据。 然而,这一路线也面临核心挑战:准确率判断大多依赖出题Agent自己给出的答案(sliver answer),其可靠性存疑。Absolute Zero通过代码执行器提供客观验证是一个聪明的设计,但这一机制仅适用于代码领域。对于更通用的任
如有侵权,请联系删除。
