从调优模型到治理探索:谷歌Dream-RSI如何让AI自我改进降本增效
在人工智能领域,如何让AI系统实现持续自我改进始终是核心课题。当模型在长程任务中频繁失败时,大多数开发者的本能反应是更换更强的底座模型或反复调优Prompt。然而谷歌DeepMind联合弗吉尼亚大学与马里兰大学发布的一项最新研究提出了截然不同的思路:不动底座模型,转而治理探索行为本身。这项名为Dream-RSI的研究通过将历史探索数据转化为可零成本回放的物理模拟器,将搜索算力开销降低一到两个数量级,为AI系统的自我改进开辟了一条全新的工程化路径。
现有递归自我改进方法的两大缺陷
当前递归自我改进(RSI)的探索方案主要分为两类,但都存在明显瓶颈。第一类以AlphaEvolve、CodeEvolve、SimpleTES为代表,采用全程人工预设的静态探索策略。系统固定启动10个独立工作区并行探索,每个工作区固定走11步连续精炼,分支之间互不相通。这种预设策略在浅层任务上尚可运行,但在需要数千次提议和评估的长程任务中,策略缺乏自适应能力。当某条分支的改进在第3步就已走平时,系统依然会把预设的11步全部跑满;同时由于无法吸收全局经验,后一轮的新分支往往会把上一轮已经证明无效的方向从头再踩一遍,导致算力大量空转。第二类思路试图让模型在任务执行过程中在线学习并动态调整搜索规则,如EvoX系统实时决定何时发散探索、何时收敛深挖、各分支分配多少算力。这套机制在实际落地中面临双重成本限制:评估一次生成的代码只需跑测试几秒即可得到反馈,而评估一套搜索规则是否有效,必须让模型在真实环境中跑完整条长任务调用链才能看到最终收益,反馈延迟且昂贵;同时每次调整规则都在消耗真实的线上算力与调用配额,一旦新策略尝试失败,整场任务的投入直接沉没。
Dream-RSI的核心破局设计思路
排除了上述两条失效路径后,DeepMind找到了关键破局点:历史探索数据不该当参考文本看,它本身就是一座可以零成本重放的物理模拟器。Dream-RSI的整体系统由三个紧密咬合的阶段循环驱动。第一阶段是在线探索,系统部署当前版本的探索策略,指挥底层的Coding Agent与评测沙箱真实交互,把所有探索尝试沉淀为一棵结构化的发现树。第二阶段是世界演化,系统把最新探索出的节点、代码快照、报错信息、运行时长和客观得分无损并入历史模拟器资产池,环境世界随之演化扩张。第三阶段是离线做梦,在完全脱离真实API和沙箱环境的前提下,系统让成千上万个候选探索策略在历史模拟器里高速重跑,综合评估策略的解质量与计算效率,筛选出最优策略代码部署到下一轮真实探索中。整个闭环有一条硬约束:底层大模型、评价函数、测试环境完全锁死不变,只更新探索策略代码本身,这是确保性能提升可归因的技术底线。
AI自我改进的成败,不在底座模型的强弱里、不在Prompt的精妙里,而在探索策略的每一次闭环回放里
“行业观察”积墨 AI 智能体开发平台
快速搭建具备商业价值的 AI 智能体,支持复杂工作流编排、50+ 主流模型接入与私有化部署。
从多年产业实践经验来看的落地分析
在工程实践中,如果不加控制,模型在自主探索时会出现几类典型的判断变形。首先是别把实现级报错误判为算法方向失败:Agent在某条分支上遇到维度不匹配、显存超限或编译参数遗漏等Bug时,往往会得出整条思路不行的结论并立刻放弃方向。论文明确要求对报错做严格分类,只有不可恢复的算法错误才能放弃分支,维度错、参数错、显存溢出都属于可修复失误,单次出现不允许关停分支。其次要引入分支的赦免与重开机制:早期的几次失败会让模型产生偏见,导致有潜力的分支被雪藏。规则要求分支判定不能只看最新一次输出,必须看整条分支的历史轨迹,只要后续尝试出现进展,系统必须能撤销关闭标记重新激活分支。第三要避免在收益走平的局部反复打转:Agent容易在局部的细枝末节上反复修补,提升曲线已经走平还是死守原有思路,解决办法是在调度批次里加入结构性异构候选,把探索多样性作为和单步收益同等重要的指标,打断死循环。第四要警惕把历史经验直接塞进Prompt做先验引导:实验显示在同等发现算力预算下,加入Prompt显式方向引导的Agent最终性能表现都落后于没有任何引导的对照组,因为长程自主探索依赖多线程并发的多样性,在Prompt里强加高维的方向性先验会过早框死模型的解空间,经验应当沉淀为环境历史供策略回放而不是变成提示词里的思维定势。
三大任务场景的性能验证与价值
在算法工程领域,以Lasso正则化路径求解任务为例,SimpleTES基线方案消耗了51200次生成;同样使用Gemini-3.1 Pro,固定探索策略耗费550次Agent调用,下游运行耗时3587.1毫秒;而Dream-RSI仅用317次调用,下游耗时压低到2930.0毫秒,算力开销比SimpleTES低了约两个数量级,产出的求解器自发结合了Cauchy-Schwarz KKT剪枝、强规则筛选与惰性Gram矩阵构造,性能超过了标准的sklearn和glmnet。在数学优化任务上,Dream-RSI使用Gemini-3.1 Pro运行10轮,在Sum-Difference任务上取得1.145427评分刷新了包括SimpleTES在内的纪录,Circle Packing追平了学界公认的最强解2.635983,Autocorrelation在不到1000代之内追平了此前消耗51200代的SOTA模型,预算开销压缩了50倍以上。在GPU算子工程任务上,KernelBench测试中达到同等性能目标,VGG16上减少了2.43倍的代数开销,LayerNorm上减少了1.79倍,在恒定算力上限下ConvDiv和ConvMax的算子性能分别提升了2.09倍与1.44倍。这些数据充分验证了通过治理探索行为而非单纯调优模型所带来的实质性效率跃迁。
Dream-RSI的成功揭示了一个重要趋势:面对AI系统的长程任务失败,与其寄望于更强大的底座模型,不如从工程层面规范探索行为本身。这套方案的核心价值在于将模糊的探索逻辑转化为确定性的代码接口,把跑过的试错历史盘活成可零成本回放的模拟器,用清晰的工程规则卡住假性失败。对于正在搭建代码生成、科学计算或长流程Agent系统的开发者来说,怎么管好探索本身,往往比换一个模型更管用。
