Iris-mini 和 Iris-pro 是同类中最强的开放权重搜索 Agent

中国团队 AllSpark 开源了两个搜索 Agent——350 亿参数的 Iris-mini 和 3970 亿参数的 Iris-pro,并公开了完整训练配方。它们在各自同尺寸开放权重搜索 Agent 中排名第一,且训练数据还带来了未被专门训练过的通用工具调用和办公任务能力提升。

一句话看懂:中国团队 AllSpark 开源了两个搜索 Agent——350 亿参数的 Iris-mini 和 3970 亿参数的 Iris-pro,并公开了完整训练配方。它们在各自同尺寸开放权重搜索 Agent 中排名第一,且训练数据还带来了未被专门训练过的通用工具调用和办公任务能力提升。

事件核心:发生了什么

根据 The Decoder 报道,AllSpark 于 2026 年 9 月发布 Iris-mini 与 Iris-pro 两个搜索 Agent。Iris-mini 为 350 亿参数,基于 Qwen3.6-35B-A3B;Iris-pro 为 3970 亿参数,基于 Qwen3.5-397B-A17B,均支持 25.6 万 token 上下文窗口。两者不仅开放权重,还附带了完整训练方案。

训练方法有一个关键设计:从网页链接结构反向生成多步问题。团队从一个种子页面和其外链出发,构建术语关系图,再生成需要跨多个步骤推理才能回答的问题。除最终答案外,所有关键词都被替换为改写版本,使得简单文本搜索无法解出答案。只有“参考模型不用工具解不出、但拿到正确来源后能解出”的问题才被保留。之后由更强的教师模型生成解题路径,经过两轮筛选,再通过强化学习在实时网页搜索中迭代优化。

测试覆盖 BrowseComp、BrowseComp-ZH、DeepSearchQA 和 Humanity’s Last Exam 四个基准。开启上下文管理后,Iris-mini 得分分别为 82.2、84.8、86.9、52.3;Iris-pro 为 88.6、85.1、92.9、56.4。在小尺寸组,Iris-mini 在四项中三项领先;大尺寸组中 Iris-pro 领先或持平。

为什么重要

搜索 Agent 的核心争议在于:模型究竟是真正在“研究”网页,还是在用搜索确认训练中已经记住的知识。AllSpark 的训练设计试图把这两者拆开——问题要求推理链,而非记忆匹配,这为评估搜索 Agent 的真实能力提供了更干净的实验条件。

另一个值得注意的发现是上下文管理的影响。团队指出,在常见基准上,运行时上下文管理带来的分数差异往往大于模型之间的差距。Iris-mini 在开启上下文管理后,BrowseComp 分数最多提升 21.2 分,原因不是 token 预算更小,而是消耗更快、需要更多步骤、更容易触达上下文上限。这意味着部分榜单上的高分可能来自外部脚手架,而非模型本身能力。

此外,训练数据还带来了未经专门训练的通用工具调用和办公任务提升,目前公开信息显示这是一种正向迁移信号。

对用户/开发者/创作者的影响

对开发者而言,开放权重加完整训练配方的组合,意味着可以基于 Iris 系列做二次微调或蒸馏,构建自己的搜索 Agent,而不必从零搭建数据管线。对工具使用者来说,小尺寸的 Iris-mini 在消费级或边缘算力上更可行,而 Iris-pro 更接近需要大规模算力的闭源系统水平,为算力有限的团队提供了另一个选择。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对内容创作者和知识工作者,这类搜索 Agent 的成熟意味着“自动调研”类应用的门槛可能降低,但需要注意:涉及网页信息检索的产品仍需考虑来源验证和结果可靠性,目前公开信息尚未披露具体落地产品或 API 定价。

值得关注的后续

一是 AllSpark 是否会将 Iris 系列接入实际产品、开放 API 或托管服务,以及定价策略如何。二是 25.6 万 token 上下文加实时搜索在实际长任务中的表现,尤其是上下文管理策略是否会被其他团队跟进。三是竞品是否会在同尺寸开放权重搜索 Agent 上作出回应,以及 Iris 的训练配方能否被社区复现。

来源:The Decoder AI News

celebrityanime
celebrityanime
文章: 23224

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注