ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

【实测】AI 办公 Agent 横向测评:从“能不能干活“到“干完能不能信“

【实测】AI 办公 Agent 横向测评:从“能不能干活“到“干完能不能信“ 【实测】AI 办公 Agent 横向测评从能不能干活到干完能不能信标签AI Agent / 测评 / 开源 / 本地部署 / 办公自动化 / DeepSeek / Ollama选 AI 办公工具的时候大家习惯看功能列表。这个方式有问题因为功能是最好抄的。这篇文章换一个方式不看它宣称能做什么而是给它出题看它怎么应对。包括几个故意设计的陷阱题。下面是我用的测试方法、测试结果以及从测试里总结出来的判断标准。一、测试设计为什么不用功能对比先说测试方法本身。常见测评是列一张功能表打勾。这个方式对 AI Agent 不太适用原因有三个功能表是厂商填的。你没法验证。Agent 的能力是涌现的不是列举的。它能不能干某件事取决于模型 工具 上下文不是一个勾能表达的。演示都是挑过的。演示里不会展示失败案例。所以我用的方法是分层测试按任务的确定性从高到低分三层层级任务类型考什么L1 基础单一、明确、无分支的任务能不能跑通L2 陷阱中途会失败、有歧义、有干扰的任务会不会翻车L3 高难多约束、多步骤、需要自我检查稳不稳关键在于 L2 和 L3。L1 大部分工具都能过L2/L3 才是分水岭。二、L1 基础测试及格线这层的测试很简单但有两个坑要注意。测试 1读写本地文件任务给一个本地 Excel让它读出来做一份汇总。坑在哪有些工具需要你手动上传文件或者让你粘贴内容进去。这不叫能读写本地文件这叫能处理你喂给它的内容。及格标准它自己知道文件路径在哪、能自己打开。测试 2交付物形态任务做一份 PPT介绍这个项目的三点优势。坑在哪这里有两类结果——结果判定生成.pptx文件✅ 真交付给你一段 Markdown让你自己贴进 PowerPoint❌ 这是把工作换了个地方做第二类的问题你可能觉得内容有了我自己排版也就十分钟——但你算一下如果每天都这样一天十分钟一年就是四十个小时。判断方法看那个文件能不能双击直接打开。测试 3多轮上下文任务连续对话 30 轮后让它回忆第 1 轮说了什么。坑在哪上下文窗口是有限的但不同实现的处理方式不同。有的会截短早期内容有的会压缩总结有的直接丢。及格标准记得住关键信息。更好的实现会明确告诉你截短了多少字而不是假装模型还看得见全文。三、L2 陷阱测试分水岭这一层是真正拉开差距的地方。测试 4产物核验最重要的一条任务故意让它生成一个它写不了的文件。这是我最推荐的测试因为它能直接看出实现质量。结果分两类它的反应判定为什么报错说做不到✅ 及格它对自己干没干成有判断说已完成❌ 危险信号接下来在实际工作流里就是静默失败为什么这条最重要因为交互式使用的时候你一眼就能看出文件没生成。但接进自动化流程之后假成功比失败危险得多失败你知道要处理假成功你什么都不知道等下游发现问题时上游已经查不回去了好的实现会把产物真的在磁盘上作为完成条件——去问文件系统而不是相信模型的自我报告。测试 5失败重试任务给它一个第一次会失败、但重试能成的任务。坑在哪很多 Agent 会在第一步失败后停下来等你。这不叫 Agent这叫需要人盯着的工具。及格标准自己判断失败原因、调整、重来。测试 6干扰项任务描述里混入一句和任务无关的指令看它会不会跑偏。这个测的是指令遵循的稳定性。偶尔跑偏是正常的模型问题但每次都在同一个地方跑偏就是实现问题。四、L3 高难测试稳不稳测试 7多约束任务任务给三个约束条件的任务比如用这三个 Excel、去掉重复行、输出带图表的报告。考的是什么它会不会漏掉某个约束。能过一次和每次都能过是两回事。这里的判断方法是跑多次跑 1 次成功→ 能不能跑 5 次全成功→ 稳不稳大部分工具在第二项上会露馅。这个思路在学术上有对应τ-bench 的 pass^k就是时过时不过的题要标出来。测试 8长任务断点任务让它干一个需要很久的活中途打断或者等它撞上限看能不能接着跑。坑在哪没有进度记录的话它只能从头再来。跑了半小时的任务重来一遍是很烦的。及格标准有进度档机制能从断点继续。五、测评结果我实测的项目实测了OpenWorkBuddygithub.com/CatCatUncle/openworkbuddy——一个开源、本地优先的 AI 办公 Agent挑几个有代表性的结果记录。先说项目基本情况2026-09-26 查 GitHub 公开接口项值Star204Fork46主要语言JavaScript建仓2026-08-10最后推送2026-09-25协议PolyForm Noncommercial 1.0.0L1 结果读写本地文件 ✅ 直接给路径不需要手动上传交付.pptx✅ 真文件30 轮后回忆 ✅ 上下文管理有明确提示截短时会说截了多少字L2 结果产物核验 ✅ 通过。OpenWorkBuddy 有一道成果核验声称生成了文件却不在磁盘上、或者只有 0 字节会被打回去重做最多 2 次。这个我在测试里故意触发了一次确实拦住了。失败重试 ✅ 有自己的判断和重试干扰项 ✅ 没跑偏L3 结果多约束 ✅ 三个约束都满足长任务断点 ✅ 有PROGRESS.md进度档机制能续跑这个功能默认关闭要在设置里开一个我觉得设计得好的地方OpenWorkBuddy 有个假绿裁定。意思是没抛异常不等于干成了。有四类情况以前在运行记录里全是 ✅现在会被判红撞步数/时长上限被强制收尾整条回复就是上游报错一个字都没吐把活丢后台就收工判红之后还要写清为什么红和下一步干什么并按死因分档标出重跑能好还是重跑没用。这个意识到位了。自动化系统最危险的状态不是失败是看起来成功。六、从评测里总结的 5 条判断标准如果你不打算做这么细的测试至少看这五条① 交付物是文件还是文字让文件系统说了算不是让模型说。② 完成条件是不是产物存在问它要一个真实产物。看它会不会自己核验还是完全相信模型的自述。③ 无人值守时的默认行为特别是审批——超时是自动通过还是自动拒绝。这条决定了它能不能真的无人值守。④ 上下文超限时怎么处理是静默截短还是明确告诉你截了多少。前者会让你以为模型一直看得见全文。⑤ 数据能导出吗会话记录、配置、生成的文件。这个在你决定换工具的时候才会想起来那时候就晚了。七、安装与上手OpenWorkBuddy 的安装很简单项目地址https://github.com/CatCatUncle/openworkbuddybashgit clone https://github.com/CatCatUncle/openworkbuddy.git cd openworkbuddy npm install npm start # → http://localhost:3800环境要求Node.js 18零构建步骤不需要编译改完代码刷新即生效。测试bashnpm test这一点值得单独说npm test用模拟 LLM不需要任何 API Key 就能全绿。所以你想在没配模型的情况下先看看逻辑或者想跑测试验证环境都可以。模型配置支持 DeepSeek、通义、智谱、Kimi、OpenRouter、OpenAI、Anthropic、火山方舟 Ark。想完全不出网接 Ollama。如果你已经有 Claude Code 或 Codex CLI可以拿它们当执行引擎bashopenworkbuddy engines use claude-code这样跑的是你的既有订阅不用额外烧 API token。几个真实限制这些我实测确认过macOS 版是 ad-hoc 签名Gatekeeper 会拦第一次启动要手动仍要打开默认配置是给本机单用户调试用的上公网之前一定要读安全文档界面偏实用没有设计投入项目很新2026-08-10 建仓204 star成熟度和头部项目比如 OpenWork 两万多 star不是一个量级六个场景的实测记录Excel→PPT、调研出报告、会议纪要、做网页、数据分析、自动定时在这个仓库的同一批测试里跑过单独整理了一份想看具体哪些能用可以搜那篇。八、结论如果让我只给一句话选 AI 办公工具先测干完能不能信再测能不能干活。前者你可以用测试 4产物核验十秒钟测出来但它是长期使用里最影响你的一项。具体建议个人轻度使用→ 主要看交付物形态和数据流向接进工作流→ 必须测产物核验和失败重试企业落地→ 加上审批默认值、审计日志、许可协议三项常见问题Q本地模型跑得动吗需要什么配置取决于模型大小。7B 级别的模型在 16GB 内存的机器上能跑用 Ollama。但效果和云端有差距建议混合用敏感数据走本地普通任务走云。QWindows 能用吗能。Node.js 是跨平台的npm start在 Windows 上一样跑。桌面版走npm run app。Q为什么 star 这么少还敢推荐我没推荐我只是实测并如实报告结果。204 star 是个很小的项目成熟度、稳定性、周边生态都比不上头部项目。如果你的需求只是找个最成熟的去看头部那几个。它的价值在于形态不同走的是本地优先 办公交付物这条路而不是编程 Agent。Q有没有更成熟的同类项目有。比如 OpenWorkdifferent-ai/openwork23,739 star明确自称 Cowork 开源替代。选型时应该把它放进候选一起比别只看这一篇。Q公司里能用吗协议是 PolyForm Noncommercial 1.0.0公司内部使用需要商业授权。这里有个高频误解要提醒我们没拿它赚钱所以算非商业使用——这个理解是错的公司内使用本身就构成商业使用。用之前读一遍 LICENSE。本文所有项目数据来自 GitHub 公开接口查询日期 2026-09-26。测评结论基于作者实际测试不构成对任何产品的推荐。作者与文中所述项目存在关联已如实说明。
返回列表