ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

小红书开源搜索智能体 Iris:35B 摸到万亿参数,但最值钱的不是模型

小红书开源搜索智能体 Iris:35B 摸到万亿参数,但最值钱的不是模型 小红书开源搜索智能体 Iris35B 摸到万亿参数但最值钱的不是模型TL;DR 速览发布小红书 AllSpark 9-14 开源 Search AgentIrisApache 2.0 可商用成绩Iris-mini 35B激活 3B在 BrowseComp 拿82.2逼近万亿参数级模型最值钱的三样反向造题法、训练不依赖外部 API、上下文管理涨 21.2 分账单真相搜索智能体吃输入不吃输出输入:输出约25:1成本差可达20.7 倍9 月 14 日 18:00小红书 AllSpark 团队发布并开源了搜索智能体Iris权重挂在 Hugging Face 上Apache 2.0 协议、可直接下载、允许商用。配套技术报告《Iris: Climbing the Search Frontier》9 月 3 日就挂上了 arXiv2609.04304。两个版本版本参数量激活参数基座Iris-mini35B3BQwen3.6-35B-A3BIris-pro397B17BQwen3.5-397B-A17B两个版本都支持256K 上下文。如果只看参数和榜单这篇没什么可写的——又一个大厂开源。有价值的是它把搜索智能体怎么训这件事从谜题变成了配方。我把它拆成三样能直接拿走的东西。一、成绩与必须打的折扣四个搜索类基准BrowseComp / BrowseComp-ZH / DeepSearchQA / HLE。模型BrowseCompBrowseComp-ZHDeepSearchQAHLEIris-mini35B/激活 3B82.284.886.952.3Iris-pro397B/激活 17B88.685.192.956.4最扎眼的是 mini在 BrowseComp 上拿到 82.2逼近 Kimi K2.6 这类万亿参数级模型——而它的体量只有对方的约三百分之一。但有两处折扣必须打第一成绩是团队自报第三方复测暂缺。论文口径也只是在各自参数档位里最好团队自己在报告里承认面对最顶尖的前沿系统仍有差距。这个自我评价比榜单数字可信。第二mini 和 pro 在中文基准上几乎打平84.8 vs 85.1。这个细节有意思说明中文检索这个能力对参数量的依赖比英文场景低——也可能是训练数据里中文语料的构成起了更大作用。二、第一样能拿走的搜索数据怎么反向造出来这是我认为整篇报告里最实用的一段。搜索智能体的训练数据难造难在两点题要够难不然模型不搜也能答、答案要唯一可验证不然没法自动打分。常见的做法是人工出题或用现成 QA 数据集都受限于规模和领域。Iris 的做法是从网页超链接结构反向造从网页链接结构里选一个种子页面把它的某个实体当作答案顺着出链把相关页面聚成一张小型实体图谱在这张图上编一道题——必须跨多个页面、多步推理才能得出唯一答案最关键的一步把题面里除答案之外的每一个实体都改写成描述性指代用参考模型双重筛选闭卷答不出说明够难 给了证据能答对且唯一说明可解。第 4 步是整套方法的核心。把实体名改写成描述性指代等于抹掉线索——模型没法把名字直接丢进搜索框了必须真正理解题目、逐步锁定目标。这一步直接把搜索题和关键词检索题区分开来。这套造题法可以迁移到任何垂类法律条文、药品说明书、电商内搜、内部知识库——只要你的领域里存在可爬取的链接结构就能用同样的方式造出训练数据。不需要人工出题不需要标注团队成本结构完全不同。三、第二样训练工程的两个狠招(a) 判分与摘要全部收进训练集群内部。做法是自建一个模型同时充当两个角色奖励判官给模型的搜索轨迹打分和检索摘要器压缩检索回来的长文档。为什么要自建两个理由第一把网络依赖挡在训练循环之外。训练要跑几十万步每一步都调外部 API 判分意味着任何一次网络波动都会污染训练循环。自建判官把变量消掉了。第二消除摘要器的错位。训练时用的摘要模型和线上推理用的摘要模型不是同一个这是一个长期被忽视的坑——训练时模型学会的是如何配合 A 摘要器上线换成 B 摘要器行为就漂了。统一成一个问题消失。(b) 超长轨迹断点续跑。长程搜索智能体训练会产出很长的轨迹少数拖后腿的超长会话会拉长整个 batch 的时间传统做法是整段丢弃——但那些最长、最难的轨迹往往信息量最大。Iris 的做法是请求级中断下一步从已提交的前缀继续。这样即使在同步调度下GPU 也能保持忙碌长轨迹不再被浪费。这两招都不依赖特殊硬件是纯工程选择可复制性很强。四、第三样上下文管理比堆参数更值钱这篇的落点团队测了三种推理时的上下文策略策略做法什么都不做历史一直往后堆discard-all超过阈值就把历史全清、从原问题重来retry把已排除的线索先摘要再继续结果是两个模型都涨分而且小模型涨得比大模型多——BrowseComp 上最高涨21.2 分。为什么小模型涨得更多论文的解释很实在小模型解同样的题需要更多步骤更容易触到上下文上限因此可回收的空间更大。这个结论翻译成钱就更值得关注了。搜索智能体有一个非常特殊的成本结构吃输入不吃输出。实测账单比例大约输入:输出 25:1——因为一次搜索任务要反复把检索回来的文档喂进上下文而最终答案只有几百字。按官方刊例价做一个典型场景的估算月跑 3000 个任务、900M 输入 36M 输出服务月成本Kimi K3 max¥21,600DeepSeek V4.1 Flash闲时¥1,044差距20.7 倍这个算账是公开刊例价算出来的典型场景不是我实测的调用账单但比例关系是清楚的搜索智能体的账单由输入单价决定而输入 token 的数量正是上下文管理要管的东西。所以那 21.2 分不只是效果提升它同时是一个成本杠杆。做 Agent 的人如果只优化模型选型、不优化上下文策略省下来的钱远少于在上下文上做对一次策略。五、一个超出预期的发现搜索可能是原子能力不是垂类报告里我个人觉得最有分量的一条是它自己都没重点讲的发现为搜索合成的数据、专门训练的搜索模型在没专门训练过的任务上也涨分了。具体包括通用工具调用BFCL、τ-bench和协同办公OfficeQA、APEX。解释很朴素搜索数据教会模型的是信息不完整时该如何行动——先判断缺什么、再去获取、再验证、再继续。而这是所有 Agent 任务都需要的能力。这个结论如果成立含义挺大搜索不该被当作一个垂直能力而是一种可复用的基础能力。做 Agent 的团队如果只能训一件事训搜索可能是性价比最高的选择——它会在你没想到的任务上还你利息。六、部署门槛与开源边界部署mini 的示例配置是 4 路张量并行pro 需要 8 路张量并行 8 路专家并行多节点或大容量单节点。35B 激活 3B 的 mini 才是大多数人能真正跑起来的那一档这也是它对个人开发者和中小团队最有价值的地方。配套团队还开源了Iris-Harness 评测框架可以连接任何提供 OpenAI 兼容接口的模型服务——不限定跑 Iris。这等于给了行业一把公用尺子也让不同模型的搜索结果可以直接对比。边界注意训练管线代码目前标注为 coming soon。想完整复现这套配方还要等。权重和数据管线的开放程度是两件事看开源项目时得分清。我的判断这次开源最值得记住的一点Iris-mini 只有 35B、激活 3B却在搜索基准上追到了万亿参数模型附近。我的读法是——这个成绩来自方法而不是规模反向造题法负责解决数据从哪来内部判官负责解决训练稳定性上下文管理负责解决长程推理的效率。三件事都是工程决策都不是靠堆卡堆出来的。这给做 Agent 的人一个很明确的信号在搜索、工具调用这类需要多步获取信息的任务上数据构造方法和推理时策略的杠杆目前大于模型规模。再看账单那个数字——输入:输出 25:1选型差异 20 倍。这意味着大多数 Agent 项目的成本问题不出在用哪个模型上出在往上下文里塞了多少东西上。上下文管理这东西做得好不好不容易在 demo 里看出来但会完整地体现在月账单里。有一条我要保持谨慎团队自报成绩、第三方复测缺失这决定了现在的判断只能是方向可信而不是结论确凿。等有独立评测复现那几个基准分数这篇报告的重量会再上一个台阶。特别是它那个搜索数据能迁移到通用 Agent 任务的发现——如果被复现这是比榜单分数重要得多的结论。对个人开发者最实际的动作是把 Iris-Harness 跑起来用你自己的任务集测一下你现在用的模型。公用尺子出现了不拿来量一下自己的方案有点可惜。
返回列表