开源Search Agent新标杆:小红书Iris如何突破同量级最强性能
Search Agent的评测与普通语言模型截然不同:任务、上下文和算力预算不会在开始前固定好,它必须自己决定搜什么、怎么读检索回来的内容、何时继续找、何时收敛作答。这种自主决策能力让它比传统模型强大得多,却也让它成为大模型领域最难训练的方向之一。近日,小红书AllSpark团队发布开源Search Agent Iris,权重与评测代码已开放,并计划陆续公布完整数据与训练配方。这一发布为Search Agent的技术演进提供了一个值得深入剖析的样本。
数据构造:从超链接结构中反向造题
训练Search Agent首先面临数据难题:真正好的训练题必须满足「闭卷答不出、给了资料才能答对」的条件,而且不能靠关键词匹配蒙对。自然产生的网页问题很少同时满足这两点,人工出题又贵又难扩展。Iris团队另辟蹊径,从网页超链接结构中反向构造数据:先以种子页面作为答案,顺着出链聚成实体图谱,再编写必须跨多个页面、多步推理才能得到唯一答案的问题,最后把所有实体改写为描述性指代。这一步「抹掉线索」的改写,让题目无法靠字符串匹配走捷径,逼着模型真正理解、逐步锁定目标。造完题后还需双重筛选:验证闭卷答不出(够难)、给证据后能答对且答案唯一(可解),只有同时满足的题才会被保留。
SFT-RL Climbing:交替微调的训练方法
有了高质量数据,Iris采用监督微调与强化学习交替进行的方式训练,团队将这个过程称为SFT-RL Climbing。SFT阶段先让教师模型在真实搜索工具上完成题目、得到完整轨迹,再经过两层过滤:轨迹层检查结果对不对、有无陷入重复或乱码;再由判官在单轮粒度上剔除瞎搜的步骤。RL阶段让模型在真实网络上边搜边学,两个关键工程决定是:判分和摘要都收进训练集群内部,用自建模型同时充当奖励判官和检索摘要器,全程不依赖外部API;超长轨迹采用断点续跑机制,不整段丢弃而在请求级别中断续跑。每一轮RL后,团队把最难被做对和最高效解出的轨迹回灌给下一轮SFT,形成自适应课程,模型每一轮都在「先自己探索、再把成功经验固化下来」。
Search Agent的成败,不在预训练里、不在评测框架里,而在数据构造与训练配方的每一个细节里
“行业观察”积墨 AI 智能体开发平台
快速搭建具备商业价值的 AI 智能体,支持复杂工作流编排、50+ 主流模型接入与私有化部署。
四大基准同量级最强:小模型逼近大模型边界
团队在BrowseComp、BrowseComp-ZH、DeepSearchQA、HLE四个Search相关的Benchmarks上评测Iris。这四个基准各有侧重:前两个考察中英文复杂网页检索,DeepSearchQA看答案对证据的覆盖完整性,HLE则是需要专家级推理的高难题。所有系统均在相同Tool、Context、Judge Model下比较,只用单个ReAct智能体,不叠加多智能体也不做测试时自我验证。结果显示:Iris-mini(35B)在BrowseComp、BrowseComp-ZH、HLE三项上登顶同量级开源,82.2分已逼近Kimi-K2.6等万亿参数级模型;Iris-pro(397B)在BrowseComp、DeepSearchQA、HLE上均为同量级最强开源。上下文管理方面,即便完全不开CM,Iris也已领先同量级其他系统;开启后成绩进一步提升,且小模型的获益明显大于大模型,因为小模型解同样的题需要更多步骤,可回收的上下文空间更大。
搜索能力的泛化:不止于Search
团队在实验中发现了超出预期的现象:为Search合成的数据与专门训练的专家模型,在没有专门训练过的任务上同样有效,包括General Tool Use(BFCL、τ-bench)和Cowork(OfficeQA、APEX)等场景。背后的解释是:一方面,如今很多任务多少都会用到在线搜索或本地检索工具;另一方面,Search数据教会模型的,是在信息不完整时如何行动——这种能力并不只属于网页浏览,任何需要「边做边找、边找边判断」的Agent任务都用得上。这也解释了为什么一个Search模型会在从未专门训练过的其他任务上有如此好的泛化性。如果这个规律成立,那么Search或许更应该被看作一种可复用的原子能力,而不是一个孤立的垂直方向。Search数据与模型的价值,也就不该只用「浏览网页做得多好」来衡量——过去被当作垂类投入的训练,很可能是一项能被反复使用的通用底座。
Iris提供了一套端到端、可复现的Search Agent配方,涵盖数据构造、训练、评测各环节。与其说Iris的意义在于某个基准上的分数,不如说它验证了两点可能性:一是相对小巧的模型在垂直任务上也能逼近超大模型的性能;二是Search能力可以外溢到更广的Agent任务。这意味着为Search投入的数据与模型训练,有机会复用到更多智能体产品中,不必为每个方向从零开始。这条路能否走通,值得持续关注。
