一句话总结
9 月 7 日,AllSpark Research 在 arXiv 发布技术报告《Iris: Climbing to the Search Frontier》(2609.04304),把「开源搜索 Agent」的天花板抬高了:Iris-mini(35B-A3B)与 Iris-pro(397B-A17B)在 BrowseComp 上分别拿到 82.2 和 88.6——两个参数档位都是开源最强(Iris-pro 比同档最强 XYZ-Aquila-pro 高 3.8 分),Iris-pro 甚至在部分配置下把成绩推到 90.3,逼近 GPT-5.6 Sol(90.4)与 Kimi-K3(91.2)等闭源顶配。更难得的是,团队承诺开放权重 + 开放数据管线,把整套「如何造出强搜索 Agent」的配方摊开给你看。
数据来源
- arXiv 2609.04304《Iris: Climbing to the Search Frontier》(AllSpark Research,2026-09-07)
- Hugging Face Papers 收录页(AllSpark-Research 团队主页)
- BrowseComp 社区排行榜(leaderboard.steel.dev,用于闭源对照行)
- 本文基准数字均引自论文 Table 1 / Table 2
为什么「搜索 Agent」值得单独研究?
搜索 Agent 和普通 LLM 评测的根本区别在于:任务不是固定的。一个搜索 Agent 不仅要会推理,还得自己决定——
- 该搜什么?
- 怎么解读检索回来的证据?
- 什么时候该继续探索,什么时候证据已经足够、可以作答?
这就把问题从「模型知识够不够」变成了「模型在开放环境里会不会决策」。而 Search 与 Deep Research 类产品(Perplexity、Exa 等)正是这条路线最直接的商业化形态——谁把搜索 Agent 做得强,谁就握住了下一代信息入口。AllSpark 的报告,就是这个赛道上开源阵营的一次正面冲锋。
成绩单:两个档位,开源最强
先看核心结果。论文在四个公认的硬基准上评测:BrowseComp(多跳线索拼图式搜索)、BrowseComp-ZH(中文版)、DeepSearchQA(答案全面性 F1)与 HLE(专家级学科推理,仅文本子集)。下表为「discard-all 上下文管理」默认配置:
| 模型 | 参数 | BrowseComp | BrowseComp-ZH | DeepSearchQA (F1) | HLE |
|---|---|---|---|---|---|
| Iris-mini | 35B MoE | 82.2 | 84.8 | 86.9 | 52.3 |
| XYZ-Aquila-mini | 35B | 78.8 | 82.9 | 89.5 | 51.1 |
| Agents-A1 | 35B | 75.5 | – | – | 47.6 |
| Iris-pro | 397B MoE | 88.6 | 85.1 | 92.9 | 56.4 |
| XYZ-Aquila-pro | 397B | 84.8 | 85.1 | 92.5 | 53.3 |
| Nex-N2-Pro | 397B | 83.7 | 79.6 | 92.3 | 50.0 |
几个值得注意的点:
- 30-35B 档:Iris-mini 在 BrowseComp / BrowseComp-ZH / HLE 三项登顶,BrowseComp 比同档最强 XYZ-Aquila-mini 高 3.4 分;
- 约 400B 档:Iris-pro 四项全部领先或打平,BrowseComp 领先 XYZ-Aquila-pro 达 3.8 分;
- 逼近 1T 级模型:Iris-mini 的 BrowseComp 82.2,已经接近 Kimi-K2.6(83.2)与 DeepSeek-V4-Pro(83.4)这类 1T+ 巨兽——用更小的参数做到接近的成绩,正是训练配方价值的证明;
- 即便与闭源重算力配置(Apodex-1.0-H 90.3、GPT-5.6 Sol 90.4、Kimi-K3 91.2)相比,Iris-pro 的 88.6 也只在 3 分以内。

最难的部分:数据从哪来?
训练搜索 Agent 最大的坑是数据:网上自然出现的问题大多太简单,模型凭记忆就能答;而人工手写难题又贵又难规模化。Iris 团队的做法是「反着造题」——从网页超链接结构里自动构造出难而可验证的多跳问题。

整条数据管线分三步:
- 网页图构建:把语料建模为有向图——节点是页面、边是超链接。从「答案锚定」的种子页出发,沿出链展开局部子图,保留页面全文;
- 任务合成:把页面蒸馏成紧凑的实体关系图,在其上生成依赖至少 N 条耦合关系的多跳题目;最关键的一步是锚点抽象——把所有非答案实体改写成「描述性指代」,让 Agent 无法靠直接搜题面字符串作弊,必须先推理出实体身份;
- 双准则验证:只保留「难且可解」的题目——参考模型闭卷答错(难)+ 给了实体图就能答对(可解、答案唯一)。
这套验证逻辑保证了训练数据的质量下限:没有一道题是记忆题,也没有一道题是无解题。
训练配方:SFT 与 RL 交替「攀登」
数据就位后,训练本身同样讲究。Iris 采用迭代式 SFT-RL 循环——他们称之为「climb(攀登)」:

- SFT 阶段:用强教师模型(ReAct 范式,工具集 = 搜索 + 抓取)为每道题生成完整轨迹。随后做两层过滤:
- 轨迹级粗过滤:答案正确 + 无退化循环(用 zlib 压缩率检测重复文本,O(n) 高效)+ 至少 K 次工具调用(排除浅层直查)+ 去重;
- 回合级细过滤:LLM 裁判逐轮打标,最多掩蔽 10% 的劣质回合——被掩蔽的回合仍留在上下文里,但不计入训练损失;
- RL 阶段:对着实时搜索做强化学习(群组相对策略梯度)。为避免长轨迹拖垮同步训练,采用 request 级部分 rollout + 前缀复用(约 2 倍过采样作为余量);奖励裁判与观测摘要器都是集群内的 Qwen3.5-397B FP8 引擎,不依赖外部 API;
- 攀登循环:每轮 RL 后,只挑「通过率 0 到 1/2 之间」的题(能解但还不稳),从中选出最短的成功轨迹喂回 SFT,再开下一轮 RL。难度带随策略提升自动上移,形成自步进课程,候选耗尽即自然停止。
工程细节也很硬核:SFT 用 256K 上下文训练、全局 batch 64;防泄漏方面,训练与评测全程把 Hugging Face 的 datasets/spaces 域名三重拦截(搜索结果过滤 + 抓取拒绝 + 工具管理器后置守卫),防止模型背答案。
一个被论文点名的「透明度红利」:上下文管理
搜索 Agent 有一个常被忽略的变量——上下文管理(Context Management,CM)。长程搜索很容易在找到答案前就把上下文窗口耗尽,所以很多团队用「清空历史重搜(discard-all)」「失败摘要重试(retry)」等技巧给 Agent 续命。但这些技巧会掩盖模型本体的真实水平。

Iris 论文的坦诚之处在于:它同时报告了「无 CM」与「有 CM」两档成绩——
- Iris-mini 无 CM 时 BrowseComp 为 64.7,开 discard-all 后跳到 82.2(+17.5),说明小模型确实会耗尽上下文;
- 但即便不带任何 CM,Iris-mini/Iris-pro 也已经大幅超过 FORT-Searcher(55.9)、OpenSeeker-v2(46.0)等旧方法——增益不是只来自推理期包装,模型本身学到的搜索行为才是地基;
- CM 收益高度依赖任务类型:BrowseComp 这类长程检索收益最大,HLE 这类知识推理题收益有限——这反过来验证了「报告裸成绩」的必要性。
作者甚至专门用一节讨论了一个 benchmark 标注错误案例(BrowseComp-ZH 里《权力的游戏》珊莎婚姻归属问题,官方答案与剧集事实不符),并以此呼吁建立质量更高的搜索基准。这种较真,在「刷分内卷」的当下显得格外珍贵。
意义:搜索或许是一项「原子能力」
论文最远视的一句话在结论部分:搜索数据与搜索专用模型正向迁移到了完全没针对训练过的场景——通用工具调用(BFCL、tau-bench)与 CoWork(OfficeQA、APEX)。作者的解读是:
搜索可能更适合被看作一项原子能力而非垂直技能——它诱导出的行为(在不完整信息下行动、判断何时收手)在任何 Agent 场景都可复用。
如果这个判断成立,那么搜索数据的价值将远不止于搜索产品本身——它可能是训练通用 Agent 的核心素材。AllSpark 计划发布模型权重与数据/训练/评测管线的关键组件,这意味着开源社区很快就能亲手复现并继续往上爬。
总结
- 成绩:Iris-mini(35B)与 Iris-pro(397B)拿下 BrowseComp 82.2 / 88.6,双双刷新各自参数档的开源纪录,Iris-pro 距闭源顶配仅 2-3 分;
- 数据:从网页超链接图自动反造「难而可验证」的多跳题,锚点抽象 + 双准则验证保证质量;
- 训练:轨迹级 + 回合级过滤的 SFT,与实时搜索 RL 交替攀登,自步进课程自动加难;
- 透明:主动区分「裸模型成绩」与「上下文管理加持」,甚至公开批评基准标注错误;
- 开源:权重与全管线组件即将放出——这是「开源搜索 Agent 追赶闭源」最值得跟踪的一份报告。
对普通用户来说,Iris 的意义也很直接:开源社区每追近一分,Perplexity 这类产品的「护城河」就薄一分——下一次你用的搜索 Agent,底层可能就藏着 AllSpark 的配方。