ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

再迎突破!openJiuwen技术论文刷新Coding多榜单SOTA,并在WorkSwarm落地

再迎突破!openJiuwen技术论文刷新Coding多榜单SOTA,并在WorkSwarm落地 2026 年编码智能体的竞争正在悄悄换赛道。过去两年比拼的重心一直是模型——谁的推理更强、谁的代码补全更准。但当越来越多团队用上同一批顶尖模型一个值得关注的问题浮出水面同样的大脑换一套驱动它运转的执行架构成绩到底能差多少针对以上问题一篇名为《openJiuwen: Beyond Static Harnesses for Long-Horizon Coding Agents》的技术报告给出了强有力的参考该报告结果直接刷新了SWE-bench Verified和Terminal-Bench 2.1两大榜单的SOTA——在500个真实GitHub issue构成的编程“黄金标准”中拿下82.6%在真实终端环境复杂指令集中斩获87.19%双双超越此前最强表现3个百分点以上。笔者了解到报告背后的openJiuwen是华为 2012 实验室、华为云、终端、计算联合构建的开源 AI Agent 平台报告同时指出其Coding Harness核心能力已在面向办公、编程的蜂群智能体WorkSwarm中落地一键下载安装即可体验。在SWE-bench Verified上openJiuwen 与榜单最强系统使用同一款模型Claude Opus 4.5最终成绩却高出3.4 个百分点达到82.6%在Terminal-Bench 2.1上openJiuwen 以87.19%的准确率超越 Codex、Claude Code、Terminus 2 等一众强力对手比官方榜首高出3.39 个百分点更关键的是一组同模型对照实验换上与榜首 Claude Code、榜二 Terminus 2 完全相同的Fable 5模型openJiuwen 依然拿到84.04%反超 Claude Code 的 83.8%比 Terminus 280.4%高出3.6 个百分点。同一个模型差出来的分数只能来自模型之外的那一层——Coding Harness即真正驱动编码智能体理解任务、调用工具、诊断错误、持续推进的执行框架。论文地址https://arxiv.org/abs/2608.27969Coding Harness 的局限长时复杂任务既考验结构对开发者是否友好也考验运行时能否应对新情况为什么很多 Code Agent 在演示视频里游刃有余一到真实、复杂、长链路的任务里就掉链子根子在于多数编码智能体沿用的仍是一套静态的 Harness——写死的流程、写死的工具列表、写死的上下文策略。这套机制处理三五步的短任务问题不大但长程编码任务会带来两方面的压力让它的短板逐渐显现根子在于多数编码智能体沿用的仍是一套静态的 Harness——写死的流程、写死的工具列表、写死的上下文策略。这套机制处理三五步的短任务问题不大但长程编码任务会带来两方面的压力让它的短板逐渐显现举个例子一个 Agent 在修复某个仓库级 bug 时改完代码后产生了新的类型错误但静态 Harness 不会主动去检查Agent 继续按原计划往下走最终交付了一个看似完成、实则编译不过的结果——直到 CI 报错才发现问题。这类长任务翻车在真实场景里并不少见。结构上越来越复杂对开发者不友好。一个编码 Agent 要用到的能力持续增多——安全策略、代码记忆、任务规划、上下文管理、语义反馈、子任务委派、多智能体协作。如果这些能力各自为战开发者每新增一种能力都得读懂并改动整个执行内核新功能牵一发而动全身排查问题要在纠缠在一起的逻辑里来回跳转维护成本随能力数量增加而显著上升。运行时越来越动态。任务推进过程中会不断冒出事前无法预知的新信息代码改动后有没有新的语义错误、任务到底是真的完成了还是看起来完成了、上下文里哪些该留哪些该扔、这次踩过的坑下一次会不会重蹈覆辙。一套只会按预设剧本往前走的 Harness难以应对这些信息。openJiuwen 把这两类压力概括为Structural Composability结构可组合性与Runtime Adaptivity运行时自适应性并围绕这两个方向重新设计了整套执行架构。结构可组合性执行内核稳定不变能力模块可插拔扩展对开发者友好openJiuwen 的第一处关键设计是把能力和执行逻辑彻底解耦——开发者不必啃透整个执行内核就能像搭积木一样组装、扩展系统这正是结构可组合性对开发者友好的核心所在。openJiuwen Coding Agent 整体架构Inner Loop观察—推理—行动—验证与 Outer Loop目标—计划—执行—评估—更新之间由一层可插拔的 Rail 组成稳定执行核心Inner Loop / Outer Loop同一套执行内核覆盖从单个 Agent 到团队协作的所有场景。不论是独立工作的单个 Agent、被委派处理子任务的 Agent还是 Swarm 团队里的一名成员跑的都是同一套内层负责观察—推理—行动—验证外层判断要不要再来一轮的执行引擎。开发者不需要为每一种使用场景重新设计一套调度逻辑。Rail 机制能力即插件想接就接。安全策略、记忆管理、任务规划、工具治理、语义理解、人机交互……这些能力全部以 “Rail” 的形式挂载在执行生命周期的固定钩子上通过优先级决定谁先谁后、谁能覆盖谁。给 Agent 新增一种能力只需要声明一个新的 Rail完全不用改动执行内核。这意味着很低的扩展成本想加一条自定义规则、接一个内部工具不必读懂整个框架源码照着 Rail 的接口写一个 handler 即可。Swarm Flow不是一套固定的多智能体架构而是一组可自由拼装的编排算子。它提供budget()查询剩余预算、parallel()并发派发并等待收齐、compact()过滤空结果、pipeline()流式传递结果、agent_session()维护有状态会话、human()引入人工兜底等算子最后以return收口。示例中一个编码 Agent 用它们拼出了查预算 → 并行生成 → 过滤 → 流式复核 → 仲裁 → 必要时人工 → 返回的流程——但这只是众多拼法之一开发者可以按自己的任务自由重排、增减这些算子不必绑定某一种协同架构。Swarm Flow 编排示例budget()查询预算 →parallel()并行生成候选 →compact()过滤空结果 →pipeline()流式复核 →agent_session()有状态仲裁 → 必要时human()人工兜底 →return返回结果。运行时自演进让编码 Agent 真正学会边做边学架构再清晰如果 Agent 不能根据执行中出现的新信息调整长任务依然容易出问题。围绕这一核心问题openJiuwen 给出了四套配套机制Goal Mode目标驱动不再是跑够固定步数就收工而是持续评估目标是否完成、是否被卡住并把完成判断和预算耗尽严格区分开——既不会明明做完了还在空转也不会明明卡住了还在硬撑预算。LSP-Driven Passive Feedback语言服务器被动反馈每次代码改动语言服务器产生的类型错误、悬空引用等诊断信息会被自动过滤、去重、排序后主动推送给下一步决策不必等 Agent 自己想起来去查——相当于配了一位随时在线的 Code Reviewer。Context Management动态上下文管理不再是把系统提示词加完整对话历史直接塞进上下文而是根据实时压力做渐进式压缩、结构化摘要、死循环折叠甚至把体积过大的内容卸载到外部存储、按需检索取回——避免长任务被上下文窗口拖累。Self-Reflection跨任务经验沉淀任务完成后系统会从执行轨迹中提炼可复用的经验存入经验库供未来相似任务检索调用——相当于给 Agent 配了一本自己越写越厚的复盘笔记。模型参数没有变但 Agent 会随着使用不断积累经验。这四套机制彼此关联构成一个此消彼长的权衡系统更丰富的上下文能带来更好的决策却会挤占有限的上下文预算更严格的完成判断能减少假装做完却要多付出评估成本。openJiuwen 的价值正是把这些原本要靠工程师逐个项目摸索的取舍沉淀成了可配置、可组合的工程能力。约束优化视角下的运行时自适应机制在 Context Construction上下文构建、Diagnostic-Feedback Injection诊断反馈注入、Acceptance Stopping接受与停止三个维度上系统不断向可行且理想的运行时配置区域逼近。BenchmarkSWE-bench Verified 与 Terminal-Bench 2.1 双双刷新 SOTAopenJiuwen 在两个差异极大的基准上系统评测了这套架构。SWE-bench Verified500 个源自真实 GitHub issue 的修复任务考验仓库级长程软件工程能力openJiuwen 使用 Claude Opus 4.5Resolved 82.6%超过当前榜单最强的同模型系统79.2%3.4 个百分点。值得注意的是榜单最强的对比系统用的同样是 Claude 4.5 Opus——同样的模型差出来的 3.4 个百分点只能来自 Harness 本身。Terminal-Bench 2.189 个容器化终端任务覆盖软件工程、系统运维、数据处理、模型训练与安全等更广泛场景openJiuwen 使用 GPT-5.6 SolAccuracy 87.19%超过官方榜单最强结果Claude Code Fable 583.8%3.39 个百分点超过 Codex、Claude Code、Terminus 2 等多个强力系统。同时还有一组模型对齐实验把 openJiuwen 换成与榜首、榜二完全相同的 Fable 5成绩依然是84.04%比 Claude Code Fable 5 高 0.24 个百分点比 Terminus 2 Fable 5 高出 3.64 个百分点。这组对比排除了模型强弱这个混淆变量——即便模型完全一致Harness 本身的贡献依然十分明确。数据分析优势来自架构的两个设计维度总分好看只是结果把总分拆开看更有意思——正好能看出 Structural Composability 和 Runtime Adaptivity 这两条设计主线各自兑现了多少。证据一细看分类目openJiuwen 在工具密集型任务上优势明显——这正是结构可组合性的红利。在同样使用 Fable 5 的模型对齐设置下file-operations文件操作openJiuwen 0.76Claude Code 0.56Terminus 2 0.52system-administration系统运维openJiuwen 0.889Claude Code 0.778Terminus 2 0.844换成主力配置 GPT-5.6 Sol 后system-administration 冲到0.956software-engineering 达到0.908data-science 达到0.950。这几类任务高度依赖工具——反复读写文件、操作终端、核对环境状态。openJiuwen开箱即用的操作型工具加上 Rail 提供的统一执行接口让 Agent 不必为每个任务临时现造工具省下的执行轨迹能更多用在推理和验证上——结构可组合性由此兑现成了具体的分数差距。模型对齐设置均使用 Fable 5下openJiuwen 在>从论文到应用能力开源并集成至WorkSwarm也进入华为云码道这篇论文的价值不只是刷新了两个榜单而是这套架构从设计之初就是为了被真正用起来——它已经开源并封装进了可以直接安装使用的产品。对开发者而言openJiuwen SDK 把结构可组合性落到了实处Rail 机制让你无需读懂整个框架源码就能插入自定义能力Inner Loop/Outer Loop 统一的执行语义让单 Agent 脚本可以平滑扩展为多智能体 Swarm 团队Goal Mode、LSP 被动反馈、上下文管理等工程能力开箱即有。对普通用户而言WorkSwarm 支持 HarmonyOS / Windows / Mac 一键安装下载。打开应用后像聊天一样描述需求Agent 会自动读文件、搜代码、跑 Shell、装依赖、改代码、跑测试直到任务完成。驱动它的正是拿下 SWE-bench Verified 82.6% 与 Terminal-Bench 2.1 87.19% 的同一套 openJiuwen 架构。这也是 openJiuwen 团队反复强调的一件事Coding Harness 不该只掌握在少数团队手中它应该像操作系统一样开发者能扩展普通用户能直接用。同时openJiuwen社区与华为云码道深度协同作为码道的社区联创版本也持续将开源框架中的优秀能力集成到码道中。WorkSwarm 官网https://www.openjiuwen.com/workswarm支持 HarmonyOS / Windows / Mac 一键下载安装安装后即可通过自然语言对话方式驱动 Agent 完成任务。结语编码智能体竞争的关键已不仅是模型能力Terminal-Bench 2.1 和 SWE-bench Verified 的难点在于Agent 必须在真实环境里连续做对很多件事理解任务、诊断错误、管理上下文、判断何时收手、把结果真正交付出来。模型决定的是 Agent 的基础智力而 openJiuwen 用两个榜单证明的是真正决定 Agent 能走多远的是那套包裹在模型外面、看不见却始终在起作用的 Coding Harness。这一次openJiuwen 论文公开、代码开源、产品可装。从一篇技术论文到两个权威基准双双刷新 SOTA再到一次下载安装就能用上的桌面体验验证的始终是同一件事——Harness不该只活在论文和榜单里它应该装进每一个人的电脑。一键下载安装 WorkSwarm立即体验吧相关资源论文地址https://arxiv.org/abs/2608.27969openJiuwen 官网https://www.openjiuwen.com/WorkSwarm GitHubhttps://github.com/openJiuwen-ai/jiuwenswarmWorkSwarm AtomGithttps://atomgit.com/openJiuwen/jiuwenswarmSwarm Skills Hubhttps://swarmskills.openjiuwen.com/
返回列表