ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

【Agent 学习笔记 05】成本、上下文与评测:附项目故事模板和面试自测清单

【Agent 学习笔记 05】成本、上下文与评测:附项目故事模板和面试自测清单 这是 Agent 学习笔记的最后一篇讲三件事成本与上下文怎么控、评测怎么做、项目故事怎么讲。本系列导航00 开篇Agent 是什么与 Chatbot / Workflow / RAG 的边界01 推理范式ReAct / Plan-and-Execute / Reflexion02 记忆系统四类记忆与冲突处理03 工具调用Schema 设计与工具幻觉防护04 可靠性工程循环、假终止、多 Agent 与安全05 成本、上下文、评测与项目故事本篇一、上下文退化Agent 的越走越糊涂症状执行到第 10 步开始胡言乱语。原因上下文里塞满了历史工具返回的原始结果真正重要的状态被淹没。处理每 5 步做一次摘要只保留当前状态 最近 3 步。我的理解Agent 的上下文应该像工作台不是仓库。台上只放当前在做什么、还缺什么历史过程压缩成一句结论就够了。二、成本控制三招症状单次任务 $1.2。优化手段做法限制轮数最多 8 轮分档路由前 5 轮小模型后 3 轮大模型工具结果截断单次结果截到 500 字效果成本降到$0.08。分档路由值得单独说这是我觉得最实用的一个工程技巧不是所有步骤都需要最贵的模型。前几步多是决定要不要调工具、调哪个这类简单判断用小模型足够真正需要推理的关键步骤再上大模型。这和我之前在 RAG 里学到的召回用便宜的、精排用贵的是同一个思想把贵的算力花在离结果最近的环节。三、评测Agent 必须看过程这是 Agent 评测和 RAG 评测最大的区别RAG 评测Agent 评测看什么检索 生成过程 结果Agent 要看的过程指标指标说明工具调用是否正确该调的调了没参数对不对有没有多余调用轮数是否高效同样的任务用 3 轮还是 8 轮延迟端到端耗时、首响应耗时成本单次任务的 token / 金额为什么不能只看最终答案因为答案对了也可能是蒙的工具调错了但结论碰巧对、或者多绕了 5 轮但最终答对。这种侥幸正确在流量变大后一定会出问题。A/B 怎么做扩展同一批任务集跑两版 Agent比如换提示词、换模型、加不加 Reflexion对比成功率 平均轮数 P95 延迟 单次成本四组指标上线用灰度 回滚先放 10% 流量指标不退化再扩。一句话Agent 的 A/B 不是比哪个答得好而是比哪个在同等成本下更稳。四、面试答题万能模板文档里给了一个五段式结构任何 Agent 题都能套一句话定义关键区别 / 原理选型标准项目例子场景 → 方案 → 效果边界 / 追问缺点、失败、安全、成本用它回答Agent 和 Workflow 区别定义Workflow 是固定流程路径预先定义LLM 只在节点内做局部决策Agent 是动态决策路径由 LLM 根据观察实时决定。选型能画成流程图就用 Workflow分支无法穷举才用 Agent。项目我们客服系统 80% 走 Workflow20% 复杂问题走 Agent综合成本降低 60%。我把它记成四个词定义 → 区别 → 选型 → 例子 边界。没有选型和边界的答案在面试官眼里就是背书。五、项目故事模板电商客服 Agent文档推荐用电商客服 Agent当主项目因为它能覆盖 80% 考点。我把它整理成可直接口述的版本我们做的是电商客服 Agent用户问我上周买的鞋能退吗。规划查订单 → 查退货政策 → 判断是否可退 → 回复。记忆存用户 ID、订单历史。工具订单 API、退货政策 RAG、退款 API。反思执行后检查信息够不够。工程分层Workflow 处理 80% 常见问题Agent 处理 20% 复杂问题。兜底max_iterations8、工具白名单、Pydantic 校验、高危转人工。效果人工介入率从 40% 降到 15%处理时长从 3 分钟降到 45 秒成本降低 60%。准备好这四个追问追问答法为什么不用纯 Agent贵、慢、不稳定为什么不用纯 Workflow复杂问题的分支画不完怎么防循环最大轮数 重复 Action 检测怎么防注入输入过滤 工具隔离 人工审批注意这段是模板数字是示范。面试时一定要换成你自己项目的真实数字否则被追问细节比如40% 这个值怎么测的会露馅。六、7 天学习计划天主题D1总框架 Agent / Workflow / RAG 区别D2ReAct、Plan-and-Execute、Reflexion、ToT/GoTD3记忆系统短期 / 长期 / 情景 / 语义、冲突、遗忘D4工具调用Schema、选择、参数、失败、幻觉D5循环、终止、假终止、上下文、成本、安全D6多 Agent、评测、A/B、生产事故D7模拟面试 项目故事打磨每天产出三件东西这条我觉得最有用一张思维导图一个项目例子三个追问自答。七、自测清单达到游刃有余的标准能不看稿回答这 10 题基本就差不多了Agent 五组件是什么Agent 和 Workflow、RAG、Chatbot 的区别ReAct、Plan-and-Execute、Reflexion 的区别记忆冲突、遗忘、检索排序怎么做工具 Schema 怎么写工具幻觉怎么防无限循环、假终止怎么处理什么时候转人工Prompt 注入、越权怎么防怎么控成本、控上下文怎么评测 AgentA/B 怎么做高频模拟题速答我练的时候用这版打底问题速答Agent 是什么LLM 为大脑能规划、记忆、调工具、执行、反思的闭环系统Agent 和 Chatbot 区别Chatbot 只对话Agent 能行动Agent 和 RAG 区别RAG 查资料Agent 做事情可组合Agent 把 RAG 当工具ReAct 是什么Thought → Action → Observation 循环可解释、可纠错Plan-and-Execute 和 ReAct 区别先想后做 vs 边想边做Reflexion 是什么失败 → 反思 → 重试解决一次性 Agent 无法从错误中学习记忆冲突怎么办时间戳优先、置信度加权、显式确认按风险分级工具幻觉怎么防白名单 Schema 校验 Prompt 约束 Few-shot无限循环怎么解决max_iterations 重复 Action 检测 明确终止条件什么时候转人工无法完成、高 stakes、用户要求、情绪负面、权限不足最后一句自检标准我给自己定的不是能背出清单而是能对每一项说出一个反例——比如别人问什么时候不该用 Agent你能立刻举出能画成流程图的场景。八、系列总结Agent 的知识骨架6 篇下来我把它压成一张图Agent LLM 大脑 ├── 规划 → ReAct / Plan-and-Execute / Reflexion / ToT / GoT ├── 记忆 → 短期 / 长期 / 情景 / 语义 → 冲突与遗忘 ├── 工具 → Schema 设计 → 选择 → 参数校验 → 结果处理 ├── 执行 → 循环控制 / 终止条件 / 假终止校验 └── 反思 → 复盘写回记忆 工程护栏白名单 · Schema 校验 · 幂等 · 权限注入 · 人工审批 · 成本与上下文预算 评测过程工具/轮数/延迟/成本 结果正确率如果只记一句话我记这个Agent 的价值是能办事Agent 的风险是办了错事还停不下来——所以设计 Agent 时边界、兜底、评测比能力更重要。本系列完
返回列表