ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

【Agent】Towards Long‑Horizon Agents: A Survey

【Agent】Towards Long‑Horizon Agents: A Survey noteVideoSeek BenchmarkTool-augmented active perception in long video多模态理解侧重于如何在较长的时间跨度内定位有用信息包括决定检查哪些片段以及调用哪些感知工具。Understanding​ → 主要吃 C1H1和 C2H2的亏靠 Context/Memory 外化解决多模态生成侧重于如何理解用户意图并进行多轮规划、生成与优化这一过程依赖于外部证据、验证机制和持久记忆。Generation​ → 叠加不可逆副作用靠 Plan-Execute Verification 解决全模态智能体侧重于不同模态之间的协调使它们能够共同完成端到端任务Omnimodal​ → 推到 H3/C3必须 World Model Self-evolution Embodiment 一起上。文章目录note一、Towards Long‑Horizon Agents二、必须记住的三个关键概念1. 长时程的本质不是时间长而是步骤间强耦合 持续反馈2. 三层任务难度 三种对应能力H1⊂H2⊂H3C1⊂C2⊂C33. 与相邻概念的边界避免混淆三、演化脉络控制面Control Surface的三次拓宽四、两大支柱 支柱 IHarness —— 把能力外置到运行时第 4 章⚙️ 支柱 IIOptimization —— 把能力内化进策略第 5 章五、应用场景五类 Agent按交互接口划分六、前沿挑战Frontier四条主线七、重点提炼TL;DR八、相关benchmarkReference一、Towards Long‑Horizon Agents论文标题Towards Long-Horizon Agents: A Survey论文链接https://openreview.net/forum?idHyhfhlbWGh项目主页https://long-horizon-agents.github.io/项目仓库https://github.com/RUC-NLPIR/Awesome-Long-Horizon-Agents论文Towards Long-Horizon Agents: A Survey —— Foundation, Evolution, Harness, Optimization, Application, and Frontier来源中国人民大学等联合撰写RUC-NLPIR 组149 页2026 年最新综述一句话主旨长时程智能体Long-Horizon Agent的能力 外部化的 Harness 工程 内部化的模型优化二者共同演化。过去几年大模型从单轮对话走向能持续行动的智能体但整个领域存在一个根本缺口没有统一的定义和分类法。long-context / long-running / autonomous / self-evolving这些词被混用导致一项改进到底来自模型、Harness、数据还是评测协议根本无法归因。本文的核心论点贯穿全文的 thesis长时程能力不是模型单方面的属性而是「外部化 Harness 工程」与「内部化模型优化」共同演化的系统级能力。Agent π θ ⊕ H \text{Agent} \pi_\theta \;\oplus\; \mathcal{H}Agentπθ​⊕H其中π θ \pi_\thetaπθ​是基础模型的策略H \mathcal{H}H是环绕它的运行时结构循环、工作流、工具、记忆、编排、钩子、验证。⊕ \oplus⊕是运行时耦合不是简单相加。一个极具洞察力的动态判断能力在 Harness 与模型之间持续迁移——Harness 的机制逐步被内化进模型权重如把 ReAct 循环训成模型本能更强的策略又反过来解锁更高级的 Harness。该综述的整体逻辑Foundation定义 H1/H2/H3 三层 ↓ 控制面三次拓宽 EvolutionPrompt → Context → Runtime ↓ 一分为二、共同演化 ┌──────────────────────────────────────────────┐ │ Pillar I: Harness外部化 Pillar II: Optimization内部化 │ │ 循环/工作流 Context/记忆 架构 → 数据/环境 → 预训练 → 微调 │ │ 工具/MCP 编排 钩子 验证 → Agent RL → OPD → 自演化 │ └──────────────────────────────────────────────┘ ↓ 能力迁移Harness ⇄ 模型权重 Application5 类场景 基准 ↓ Frontier演化/有效性/效率/可信赖性二、必须记住的三个关键概念1. 长时程的本质不是时间长而是步骤间强耦合 持续反馈论文明确驳斥了跑得久 长时程的误解。真正的定义性特征是大量紧密耦合的决策组成一条轨迹误差会沿依赖图累积且需要与真实环境持续交互、修订。一个可分解的长时间批处理并不算长时程。三大典型失败模式全文技术讨论的骨架Goal drift 错误累积成千上万步后偏离原目标局部错误把轨迹推向错误推理路径。Context rot 上下文压力工作上下文填满后性能骤降或模型因感知到上下文上限而提前终止、把部分进展谎报为成功。稀疏延迟奖励 不可逆性只在终点给 reward中间信号极稀疏且动作越久越可能触发高风险不可逆操作——可恢复性recoverability成为刚需。2. 三层任务难度 三种对应能力H1⊂H2⊂H3C1⊂C2⊂C3任务层级范围所需能力核心挑战H1上下文内单个窗口内约分钟级C1上下文内交互推理多步组合、验证与恢复H2跨上下文跨窗口 / 跨会话C2跨上下文状态与记忆状态压缩、外部化、checkpoint 与续跑H3跨任务流开放、持续的任务流C3跨任务经验积累技能复用、持续学习、目标漂移三个递进论断极其精辟H1 证明单步准确 ≠ 成功需持续交互H2 证明更大的上下文窗口 ≠ 成功需压缩/外部化状态H3 证明单次任务成功 ≠ 成功需把部署经验沉淀为持久能力。每一层的能力都可由外部 Harness 提供或内部训练内化两条路径达成——这正是全文两大支柱的由来。3. 与相邻概念的边界避免混淆vs Long-running长运行强调执行时长长时程强调决策依赖图的耦合深度。vs Autonomous自主性是关于谁做主长时程是关于能否跨越依赖链完成任务两者正交。vs Self-evolving自演化强调随时间改进自身长时程强调单次任务的跨度自演化是长时程在 H3 层面的一种手段二者有重叠但不等价。三、演化脉络控制面Control Surface的三次拓宽阶段时期控制对象代表技术Stage IPrompt Engineering2020–2023单轮提示CoT、Plan-and-Solve、Least-to-Most、Self-RefineStage IIContext Engineering2023–2025上下文窗口RAG、GraphRAG、RAPTOR、Self-RAG、ReSumStage IIIRuntime Harnesses2025–至今运行时系统ReAct、Toolformer、AutoGPT、OpenHands、NLAH趋势控制单位从一句话提示 → “一窗口上下文” → “一整套运行时闭环”能力边界由模型内部逐步外溢到 Harness。关键数据METR前沿 agent 的任务时长中位数约每 7 个月翻倍近期加速到约每 4 个月GLM-5.1 报告单任务可持续独立执行8 小时规划→实现→测试→迭代→交付。前沿已接近16 小时天花板。四、两大支柱 支柱 IHarness —— 把能力外置到运行时第 4 章六类运行时结构是让长时程执行可规定、可引导、可验证、可恢复的关键Loops Workflows线性 / Plan-Execute / 分支工作流ReAct、ToT、LATS、Reflexion。Context Memory工作上下文 持久记忆MemGPT、MemoryBank、MemoryOS——解决 H2 状态外部化。Tools, MCP Skills工具接口与协议Toolformer、Gorilla、MCP、主动工具发现、技能库。Orchestration任务分解与角色、协调拓扑、编排优化、Agent 协议MetaGPT、AutoGen、LangGraph、A2A。Hooks Middleware预定义规则钩子、用户自定义钩子、运行时自适应钩子Claude Code hooks、ShieldAgent——安全与可恢复性的落点。Verification验证目标、验证层级、验证器策略Reflexion、CRITIC、AgentHarm、OWASP。⚙️ 支柱 IIOptimization —— 把能力内化进策略第 5 章完整的 Agent 训练流水线从架构到自演化Architectural Substrate显式上下文 / 压缩状态 / 混合架构 / 高吞吐机制DeepSeek、NSA、FlashAttention、Mamba。Data Environment Synthesis任务合成、环境合成、轨迹合成WebShaper、SWE-Gym、SWE-smith、EnvScaler——论文直言环境构建才是下一阶段的能力瓶颈而非模型规模。Pre/Mid-training推理先验、长上下文状态、多模态感知、数据混合策略DeepSeek-V3、Qwen3、GLM-4.5。Fine-tuning指令筛选与混合、课程学习、蒸馏AgentTuning、CodeActInstruct、ToolACE。Agentic Reinforcement Learning重点章节Credit AssignmentOutcome / Process / Rubric / Multi-granularity 四类信用分配Policy OptimizationGRPO 等Sampling StrategyInteraction Patterns层级、工具使用、多智能体协作、记忆。On-Policy Distillation (OPD)教师引导 OPD 自改进 OPDGKD、SCoRe、MAD-OPD——在线自适应生成监督。Self-evolution离线自演化 / 在线自演化 / Agent-环境共演化ExpeL、Absolute Zero、ADAS、DGM——对应 H3 的能力内化。五、应用场景五类 Agent按交互接口划分应用接口反馈强度关键技术Software Engineering代码 / 终端强测试/编译硬 oracle仓库定位、工作流规划、反馈驱动修复Information Seeking搜索引擎/文档弱仅证据深度搜索、广度搜索、研究综合Computer Use截图/DOM/键鼠部分延迟状态浏览器/桌面 GUI/移动端 AgentMultimodal视频/音频/图像流稀疏多模态理解/生成、全模态 AgencyGeneral-purpose多工具/多接口/人混合个人助理、具身 Agent、生产性 Agent一个重要洞见从软件工程边界清晰、反馈强、可验证到通用 Agent开放、异构、反馈弱是能力需求递增的光谱——越往右越依赖 Harness 的验证与恢复机制。评测资源SWE-bench、WebArena、OSWorld、Mind2Way、AndroidWorld、GAIA、AgentBench、τ-bench、MLE-bench、Terminal-Bench、METR 等覆盖从代码到具身的完整基准。六、前沿挑战Frontier四条主线维度核心问题EvolutionHarness/模型自演化、Harness 的泛化与可迁移性、持续终身学习Effectiveness真实世界环境交互、从数字 Agent 到具身 AgentEfficiency成本/预算感知、多模态与全模态 Harness 的证据调度何时观察、保留什么、如何压缩Trustworthiness反思与错误鲁棒性、安全与治理几处点睛观点作者 Outlook下一阶段能力瓶颈是环境构建而非模型规模忠实度faithfulness值得像任务成功率一样被显式评测反思reflection应基于外部可验证证据而非让模型自说自话安全上需把人类纠偏轨迹纳入训练让 Agent 学会何时 如何请求干预。七、重点提炼TL;DR长时程 ≠ 时间长而是决策强耦合 误差累积 持续反馈 需恢复。核心公式Agent π θ ⊕ H \text{Agent} \pi_\theta \oplus \mathcal{H}Agentπθ​⊕H能力由 Harness 与模型共同演化塑造——这是全文灵魂。三层任务 H1/H2/H3 ↔ 三种能力 C1/C2/C3上下文推理 → 状态记忆 → 经验积累递进嵌套。Harness 六件套循环、记忆、工具、编排、钩子、验证是可靠长时程的工程落点Optimization 七步走架构→数据环境→预训练→微调→Agent RL→OPD→自演化是能力内化的训练路径。瓶颈转移下一步限制因素从模型规模转向环境构建 忠实度评测 可恢复性/安全性。实践启示想让 Agent 可靠跑数小时靠的不只是换更大模型而是好的 Harness验证器 checkpoint 记忆 预算控制与长时程训练数据/RL的组合。八、相关benchmarkReference[1] Towards Long‑Horizon Agents: A Survey[2] 人大高瓴最新发布149页综述-迈向长程智能体
返回列表