展开目录
#AllSpark#开源#AI搜索#Agent#BrowseComp#强化学习#arXiv

AllSpark 开源搜索 Agent Iris:BrowseComp 88.6 分刷新开源纪录——SFT-RL「攀登」配方全解

9 月 7 日挂上 arXiv 的 AllSpark Research 技术报告,把开源搜索 Agent 带到了新高度:35B 的 Iris-mini 与 397B 的 Iris-pro 在 BrowseComp 上分别拿下 82.2 与 88.6,均为各自参数档开源最强。论文最有价值的是整套可复制的配方:从网页图自动构造多跳难题、轨迹级+回合级双重过滤、SFT 与 RL 交替攀登——还计划把权重和数据管线全部开源。

预计阅读 9 分钟

一句话总结

9 月 7 日,AllSpark Research 在 arXiv 发布技术报告《Iris: Climbing to the Search Frontier》(2609.04304),把「开源搜索 Agent」的天花板抬高了:Iris-mini(35B-A3B)与 Iris-pro(397B-A17B)在 BrowseComp 上分别拿到 82.288.6——两个参数档位都是开源最强(Iris-pro 比同档最强 XYZ-Aquila-pro 高 3.8 分),Iris-pro 甚至在部分配置下把成绩推到 90.3,逼近 GPT-5.6 Sol(90.4)与 Kimi-K3(91.2)等闭源顶配。更难得的是,团队承诺开放权重 + 开放数据管线,把整套「如何造出强搜索 Agent」的配方摊开给你看。

数据来源

  • arXiv 2609.04304《Iris: Climbing to the Search Frontier》(AllSpark Research,2026-09-07)
  • Hugging Face Papers 收录页(AllSpark-Research 团队主页)
  • BrowseComp 社区排行榜(leaderboard.steel.dev,用于闭源对照行)
  • 本文基准数字均引自论文 Table 1 / Table 2

为什么「搜索 Agent」值得单独研究?

搜索 Agent 和普通 LLM 评测的根本区别在于:任务不是固定的。一个搜索 Agent 不仅要会推理,还得自己决定——

  • 该搜什么?
  • 怎么解读检索回来的证据?
  • 什么时候该继续探索,什么时候证据已经足够、可以作答?

这就把问题从「模型知识够不够」变成了「模型在开放环境里会不会决策」。而 Search 与 Deep Research 类产品(Perplexity、Exa 等)正是这条路线最直接的商业化形态——谁把搜索 Agent 做得强,谁就握住了下一代信息入口。AllSpark 的报告,就是这个赛道上开源阵营的一次正面冲锋。

成绩单:两个档位,开源最强

先看核心结果。论文在四个公认的硬基准上评测:BrowseComp(多跳线索拼图式搜索)、BrowseComp-ZH(中文版)、DeepSearchQA(答案全面性 F1)与 HLE(专家级学科推理,仅文本子集)。下表为「discard-all 上下文管理」默认配置:

模型参数BrowseCompBrowseComp-ZHDeepSearchQA (F1)HLE
Iris-mini35B MoE82.284.886.952.3
XYZ-Aquila-mini35B78.882.989.551.1
Agents-A135B75.547.6
Iris-pro397B MoE88.685.192.956.4
XYZ-Aquila-pro397B84.885.192.553.3
Nex-N2-Pro397B83.779.692.350.0

几个值得注意的点:

  • 30-35B 档:Iris-mini 在 BrowseComp / BrowseComp-ZH / HLE 三项登顶,BrowseComp 比同档最强 XYZ-Aquila-mini 高 3.4 分;
  • 约 400B 档:Iris-pro 四项全部领先或打平,BrowseComp 领先 XYZ-Aquila-pro 达 3.8 分;
  • 逼近 1T 级模型:Iris-mini 的 BrowseComp 82.2,已经接近 Kimi-K2.6(83.2)与 DeepSeek-V4-Pro(83.4)这类 1T+ 巨兽——用更小的参数做到接近的成绩,正是训练配方价值的证明;
  • 即便与闭源重算力配置(Apodex-1.0-H 90.3、GPT-5.6 Sol 90.4、Kimi-K3 91.2)相比,Iris-pro 的 88.6 也只在 3 分以内。

BrowseComp 成绩:开源新王与闭源巨头的距离

最难的部分:数据从哪来?

训练搜索 Agent 最大的坑是数据:网上自然出现的问题大多太简单,模型凭记忆就能答;而人工手写难题又贵又难规模化。Iris 团队的做法是「反着造题」——从网页超链接结构里自动构造出难而可验证的多跳问题。

数据从哪来:反向构造「难而可验证」的多跳问题

整条数据管线分三步:

  1. 网页图构建:把语料建模为有向图——节点是页面、边是超链接。从「答案锚定」的种子页出发,沿出链展开局部子图,保留页面全文;
  2. 任务合成:把页面蒸馏成紧凑的实体关系图,在其上生成依赖至少 N 条耦合关系的多跳题目;最关键的一步是锚点抽象——把所有非答案实体改写成「描述性指代」,让 Agent 无法靠直接搜题面字符串作弊,必须先推理出实体身份;
  3. 双准则验证:只保留「难且可解」的题目——参考模型闭卷答错(难)+ 给了实体图就能答对(可解、答案唯一)。

这套验证逻辑保证了训练数据的质量下限:没有一道题是记忆题,也没有一道题是无解题

训练配方:SFT 与 RL 交替「攀登」

数据就位后,训练本身同样讲究。Iris 采用迭代式 SFT-RL 循环——他们称之为「climb(攀登)」:

训练配方:SFT 与 RL 交替「攀登」

  • SFT 阶段:用强教师模型(ReAct 范式,工具集 = 搜索 + 抓取)为每道题生成完整轨迹。随后做两层过滤
    • 轨迹级粗过滤:答案正确 + 无退化循环(用 zlib 压缩率检测重复文本,O(n) 高效)+ 至少 K 次工具调用(排除浅层直查)+ 去重;
    • 回合级细过滤:LLM 裁判逐轮打标,最多掩蔽 10% 的劣质回合——被掩蔽的回合仍留在上下文里,但不计入训练损失;
  • RL 阶段:对着实时搜索做强化学习(群组相对策略梯度)。为避免长轨迹拖垮同步训练,采用 request 级部分 rollout + 前缀复用(约 2 倍过采样作为余量);奖励裁判与观测摘要器都是集群内的 Qwen3.5-397B FP8 引擎,不依赖外部 API;
  • 攀登循环:每轮 RL 后,只挑「通过率 0 到 1/2 之间」的题(能解但还不稳),从中选出最短的成功轨迹喂回 SFT,再开下一轮 RL。难度带随策略提升自动上移,形成自步进课程,候选耗尽即自然停止。

工程细节也很硬核:SFT 用 256K 上下文训练、全局 batch 64;防泄漏方面,训练与评测全程把 Hugging Face 的 datasets/spaces 域名三重拦截(搜索结果过滤 + 抓取拒绝 + 工具管理器后置守卫),防止模型背答案。

一个被论文点名的「透明度红利」:上下文管理

搜索 Agent 有一个常被忽略的变量——上下文管理(Context Management,CM)。长程搜索很容易在找到答案前就把上下文窗口耗尽,所以很多团队用「清空历史重搜(discard-all)」「失败摘要重试(retry)」等技巧给 Agent 续命。但这些技巧会掩盖模型本体的真实水平

上下文管理(CM):能多「买」到多少分?

Iris 论文的坦诚之处在于:它同时报告了「无 CM」与「有 CM」两档成绩——

  • Iris-mini 无 CM 时 BrowseComp 为 64.7,开 discard-all 后跳到 82.2(+17.5),说明小模型确实会耗尽上下文;
  • 但即便不带任何 CM,Iris-mini/Iris-pro 也已经大幅超过 FORT-Searcher(55.9)、OpenSeeker-v2(46.0)等旧方法——增益不是只来自推理期包装,模型本身学到的搜索行为才是地基
  • CM 收益高度依赖任务类型:BrowseComp 这类长程检索收益最大,HLE 这类知识推理题收益有限——这反过来验证了「报告裸成绩」的必要性。

作者甚至专门用一节讨论了一个 benchmark 标注错误案例(BrowseComp-ZH 里《权力的游戏》珊莎婚姻归属问题,官方答案与剧集事实不符),并以此呼吁建立质量更高的搜索基准。这种较真,在「刷分内卷」的当下显得格外珍贵。

意义:搜索或许是一项「原子能力」

论文最远视的一句话在结论部分:搜索数据与搜索专用模型正向迁移到了完全没针对训练过的场景——通用工具调用(BFCL、tau-bench)与 CoWork(OfficeQA、APEX)。作者的解读是:

搜索可能更适合被看作一项原子能力而非垂直技能——它诱导出的行为(在不完整信息下行动、判断何时收手)在任何 Agent 场景都可复用。

如果这个判断成立,那么搜索数据的价值将远不止于搜索产品本身——它可能是训练通用 Agent 的核心素材。AllSpark 计划发布模型权重与数据/训练/评测管线的关键组件,这意味着开源社区很快就能亲手复现并继续往上爬。

总结

  • 成绩:Iris-mini(35B)与 Iris-pro(397B)拿下 BrowseComp 82.2 / 88.6,双双刷新各自参数档的开源纪录,Iris-pro 距闭源顶配仅 2-3 分;
  • 数据:从网页超链接图自动反造「难而可验证」的多跳题,锚点抽象 + 双准则验证保证质量;
  • 训练:轨迹级 + 回合级过滤的 SFT,与实时搜索 RL 交替攀登,自步进课程自动加难;
  • 透明:主动区分「裸模型成绩」与「上下文管理加持」,甚至公开批评基准标注错误;
  • 开源:权重与全管线组件即将放出——这是「开源搜索 Agent 追赶闭源」最值得跟踪的一份报告。

对普通用户来说,Iris 的意义也很直接:开源社区每追近一分,Perplexity 这类产品的「护城河」就薄一分——下一次你用的搜索 Agent,底层可能就藏着 AllSpark 的配方。

Related

相关文章

延伸阅读

查看全部 →
AI安全

阿莫代伊发文《We Must Pace the Frontier》:Anthropic 单方面承诺「嵌入式评估员」,Altman 说同意,Musk 说 Dario 是对的

2026 年 9 月,Anthropic CEO 达里奥·阿莫代伊发表长文《We Must Pace the Frontier》,首次把「放慢前沿能力进步」提为具体方案:三步走——嵌入式第三方评估员、民主国家内部协调、全球协调,Anthropic 单方面承诺第一步。两件事让他改主意:递归自我改进加速,以及 OpenAI-Hugging Face 的 Agent 蜂群越界事件。Sam Altman 表示同意,Elon Musk 说「Dario 是对的」,也有记者批评这是「监管俘获」。

OpenAI

GPT-6 Astra 需求爆表:OpenAI 暂停 200 美元 Pro 新订阅,Altman 说 2026 年不上市

9 月 3 日发布的 GPT-6 Astra 需求「前所未有」,OpenAI 在 9 月 10 日暂停了 200 美元 ChatGPT Pro 的新订阅——Go、Plus 与 API 不受影响。三天后,Sam Altman 又说「考虑到安全方面正在发生的一切,现在上市是不明智的时机」,被追问是否指 2026 年时回答「不是 2026,对」。一个模型,同时顶住了 OpenAI 的产能与 IPO 时间表。

DeepSeek

DeepSeek-V4.1-Flash 发布:552B 参数只激活 8B,KV 缓存砍到 1/4,Agent 账单降了七成

9 月 10 日,DeepSeek 上线 DeepSeek-V4.1-Flash:552B 参数的 MoE 新架构,输入侧只激活 8B、输出侧 16B,KV 缓存压到上一代的 1/4(HBM)与 1/8(SSD),缓存命中低至 0.003 美元/百万 token。峰值输入价格从 V4-Pro 的 1.32 美元降到 0.30 美元,并发从 500 提到 2,500,官方称已全面超越 V4-Pro。