ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

智能体记忆不是越多越好:ALTK-Evolve 八模型评测,记忆要按模型能力“配药“

智能体记忆不是越多越好:ALTK-Evolve 八模型评测,记忆要按模型能力“配药“ 热点来源Hugging Face Blog - 《智能体记忆并非越多越好八款模型评测显示剂量需按能力校准》https://huggingface.co/blog/ibm-research/altk-evolve-hmm研究原文IBM Research - ALTK-Evolve 技术报告https://arxiv.org/abs/2603.10600Agent 跑久了直觉告诉我们多喂点历史经验表现会更好。IBM Research 在 Hugging Face 发布的评测却给出了反直觉的结论智能体记忆不是一个开关而是一剂药——给多给少取决于模型自身的能力。8 款模型、585 个多步任务三种截然不同的表现模式直接改写了记忆越多越好的默认假设。一、先厘清智能体记忆到底指什么很多实现把记忆做成把历史对话塞回上下文。论文里明确澄清记忆不是重放过去的对话记录而是一套guideline set指南集——从智能体自己过去的成功与失败轨迹中提炼出来的行为准则哪些策略有效、哪些错误要避免、哪些边界情况要小心。维度重放式记忆指南集记忆内容原始对话、原始轨迹蒸馏压缩后的行为准则作用方式让模型想起当时发生了什么让模型学会下次该怎么做存储成本随轨迹线性膨胀压缩后规模基本固定区别在于重放是回到过去指南集是带着经验往前走。这决定了它不会拖垮上下文窗口也决定了它可以被检索、被缓存。二、机制四步学习循环发生在模型之外这套方法叫ALTK-Evolve它的学习循环发生在模型之外——改变的是给智能体的指导内容而不是模型权重。这也是它部署成本低、能跨 8 款模型直接移植的根本原因。四步循环执行智能体尝试完成任务产生轨迹提取从成功和失败的运行中抽取行为指南整合把零散指南整理成可复用的指南集注入推理时把完整指南集或按任务检索的子集放回上下文。整个过程不需要人工标注指南只从基准AppWorld的训练集挖掘一次测试集完全不参与构建从机制上杜绝数据泄漏。注入有两种配置都基于同一套指南集full guideline set每一步 ReAct 都注入全部挖掘出的指南curated retrieval固定高置信度核心指南 按当前任务检索出的少量相关指南固定部分 可变部分。三、八款模型三种模式评测基准 AppWorld 有 585 个多步任务168 个普通 417 个挑战覆盖 9 个模拟应用。两个指标TGC任务目标完成率和 SGC场景目标完成率要求场景内全部子任务都对才算过更严格。模型表现模式基线 TGC/SGC最佳配置 TGC/SGC最佳配置TGC 增益SGC 增益gpt-oss-120b117B MoE弱模型39.9/21.456.0/37.5精选检索16.116.1DeepSeek-V3.2671B MoE强、有余量79.8/64.389.3/80.4完整指南集9.516.1Claude Opus 4.6强、有余量90.5/87.594.6/94.6完整指南集4.17.1GPT-5.5强、近天花板92.3/82.195.2/89.3完整指南集2.97.2GLM-5745B MoE已饱和87.5/80.487.5/80.4完整指南集0.00.0三种模式对应三种给药策略有余量的强模型有能力吸收并应用全部指南包括罕见的边界案例给完整指南集收益最大弱模型/小模型指南集太大反而淹没模型精选检索效果最好已饱和模型加记忆无可观察增益别浪费额外上下文。注意一个反直觉点决定模型属于哪种模式不是单纯看参数量而是基准余量、上下文窗口大小、架构、指南质量和任务分布共同作用的结果。论文也承认隔离这些因素还在进行中。四、token 开销最好的策略恰好是最便宜的记忆不是免费的先看三组数字模型配置基线 token/任务加记忆后额外开销DeepSeek-V3.2完整指南集148K263K78%gpt-oss-120b完整指南集110K166K51%gpt-oss-120b精选检索110K116K5%对比 gpt-oss-120b 的两行最有意思同样拿到 16.1 个百分点的 TGC 增益完整注入多花 51% token精选检索只多花 5%。对弱模型来说最省钱的方案恰好是效果最好的方案。五、给 Agent 开发者的四条实践建议按模型能力校准记忆剂量不要一刀切弱模型给紧凑核心 少量任务相关指南有余量的强模型保留完整指南集已饱和模型先不加。重视 prompt caching指南集的静态部分在每一步之间是相同的可以被缓存保持共享指南集前缀稳定是值得投入的工程优化。用 SGC 而不是 TGC 评估记忆效果更严格的指标往往显示更大的增益DeepSeek 的 SGC 16.1 对 TGC 9.5因为好指南特别能帮智能体通过场景的每一个变体。记忆不会拖慢推理循环带记忆与不带记忆的 ReAct 步数相近约 18-19 步额外成本来自输入 token 膨胀而不是更长的轨迹。六、一个最小实现示意下面是一个示意实现非官方库 API结构参考论文的注入配置演示 curated retrieval 怎么组装CORE_GUIDELINESload_core_guidelines()# 固定高置信度核心指南defbuild_prompt(task:str,trajectory:list[dict])-str:# 1. 从历史轨迹中按相似度检索与当前任务相关的指南relatedretrieve_by_similarity(task,trajectory)# 余弦相似度排序# 2. 组装记忆块固定核心取前 5 条 检索出的前 3 条memory_blockrender(CORE_GUIDELINES[:5]related[:3])# 3. 注入系统提示再拼接当前任务返回完整 promptreturnf{memory_block}\n\n当前任务:{task}解释load_core_guidelines() 返回固定核心保证每次请求的记忆前缀一致、可被缓存retrieve_by_similarity(task, trajectory) 返回按相似度排序的候选只取前 3 条控制体积render() 把规则列表拼成一段文本返回值是注入后的完整 prompt。实际生产里核心部分应该抽成公共前缀以最大化缓存命中。七、局限与未来方向当前检索用余弦相似度排序并不完美预测哪条指南真正有用训练一个基于结果信号的选择器是论文点名的下一步对能力低于最低基线的模型自蒸馏缺乏信号需要探索教师蒸馏实验目前只在 AppWorld 上验证过上下文窗口与原始能力的影响也还没有隔离实验。小结智能体记忆的正确用法不是积累而是校准。这次评测最大的价值是把该给智能体喂多少经验从玄学变成了有数据支撑的决策先判断模型处在哪种模式再决定给完整指南集、精选检索还是干脆不加。动手加记忆之前先想清楚你的模型属于哪一类。
返回列表