ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

深度图解 AI Agent 核心循环:看完这15 张图,你将彻底搞懂它的底层原理

深度图解 AI Agent 核心循环:看完这15 张图,你将彻底搞懂它的底层原理 你能说出 Agent 是什么LLM 加工具、加记忆、加规划被一个循环串起来。但如果有人接着问一句——**那一轮里从你的目标进去到某个工具真正被调用中间到底发生了什么**多数人会卡在这儿。不是不懂是没见过它被拆开的样子。这篇不讲概念用 15 张原理图把这条链从头拆到尾。看完你应该能自己画出来。关于这些图封面那张是横版原图放进文章里字会缩得看不清所以下面这 15 张都转成了竖版重画。想要横版高清大图就是封面那种电脑上看很清楚私信发「循环图」。▍ 一、先建立坐标四个部件一个循环先记住这张。后面 14 张不是把它放大而是逐个剖开每个环节的内部机制——数据在里面怎么流、状态怎么变、哪一步是模型做的、哪一步是你的代码做的。四个部件里只有大脑LLM会做决策其余三个都是被它调用的资源手脚工具连外部世界记忆存已经发生的事规划把大目标拆成小步。底部那行是能证伪的部分——缺大脑它退化成写死的脚本那叫工作流不叫 Agent缺手脚只能闭眼聊天缺记忆第二步不知道第一步干了啥多步任务必散架缺规划要么乱走要么原地绕圈。四块缺一不可不是凑数的定义。▍ 二、一字之差谁决定下一步同一个会幻觉的 LLM上下两条路的区别只有一个下一步做什么谁说了算。单次问答里是你说了算——你问一句它答一句然后停。Agent 里是它自己说了算它看着当前状态决定下一步调什么工具拿到结果再决定下一步直到它认为完成。这就是「自主性」。它全部的能力来自这个它全部的麻烦也来自这个。▍ 三、一轮里到底发生了什么这是全篇的心脏也是最值得点开逐条追的一张。一轮上下文装配 → LLM 一次前向 → 动作解析 → 工具执行 → 观察结果 → 判定编号 1 到 7 就是数据流经的顺序。图里那句红字是最容易被忽略的LLM 是无状态的。它不记得上一轮说过什么历史全靠这一轮的 prompt 重新带一遍。用后端的话说它是个彻底无状态的服务每次调用都得把全量状态当入参传进去——你以为的「它记得」其实是你或框架每轮都重新塞了一遍。三条带小数点编号的支线才是这张图的深处5.1 解析失败不是终点它把报错当成一次观察回填给装配环节让模型下一轮自己改6.1 危险动作在沙箱那一层就被拒绝根本走不到真实调用9.3 转太多轮强制收尾。它们不是补丁是这个循环能跑在生产上的前提。▍ 四、上下文每一轮是怎么拼出来的同一个目标跑三轮prompt 里真正变的只有红色那一段——已经走过的「想法动作结果」其余几段每轮都一样。但红色那段每轮都在变长。这就是 token 越烧越多的真正原因不是模型变贵了是你每轮都把整条 prompt 重新交给它读一遍而这条 prompt 每轮都比上一轮长。所以「让 Agent 少走弯路」不只是准确率问题它直接决定下一轮的输入有多长、多贵。图的下半段是撞上窗口上限之后的三条出路——截断最老的、摘要压缩、沉淀进长期记忆它们都在拿「信息完整度」换「还能不能继续跑」没有免费的压缩。▍ 五、模型吐出来的到底是什么这张是本篇信息密度最高的一张三段真实 JSON 摆在一起左边是你注册工具时给模型的说明书input_schema中间是模型的输出一个tool_use块含idnameinput右边是你回填的结果tool_result靠tool_use_id配回去。**模型从头到尾没有执行任何东西。**它只吐了一段结构化文本。get_weather是你的代码调的参数校验是你做的沙箱是你套的。中间那列黄块是纪律input的 JSON 转义在不同模型上可能不同必须用 JSON 解析不能拿字符串匹配。这条踩过的人才知道疼。▍ 六、为什么「想」和「做」必须交织ReAct 就是把思考塞进每一步决策里想 → 做 → 看三段一组反复循环Yao et al. 2022。右边是一条真实轨迹先查周杰伦哪年生拿回 1979第二步用的是第一步真查回来的 1979而不是模型脑补的年份于是查到卡特。两边的死穴都在图上纯推理拿不到外部事实想到一半只能瞎编纯行动不会规划看到报错也不知道换什么策略只会机械重试。交织的价值就是让它俩互相纠正——推理决定调哪个工具观察修正下一步的推理。▍ 七、一轮里要调两个工具怎么办模型可以在一条消息里同时要求调多个工具。这时候id的作用才真正显出来谁的结果是谁的全靠它。两个坑写在图下面。一是两个结果必须放进同一条 user 消息里回填拆成两条发回去模型下次就不再并行调用了——它会以为并行不被接受。二是某个工具失败也要回填带is_error不能直接丢掉少一个结果这一轮就配不齐。▍ 八、这个循环凭什么会停三条模型自己说完成了、撞上轮数上限max_iterations典型设 10~25 轮、连续报错或超预算熔断。第一条是正常出口后两条是保险丝。**保险丝不是可选项。**模型自己不会知道「我已经绕了 20 轮」——它每一轮都觉得当前这个决定是合理的。这跟你给下游调用加超时和熔断是同一件事不是因为它一定会挂是因为它挂的时候你得能停下来。▍ 九、什么时候想、想多少同一个循环骨架换一种「什么时候调用大脑」的策略性格完全不同。ReAct每步现场决策适应性强但每步一次大模型调用贵且容易绕圈Plan-and-Execute先一次性列出完整步骤表执行时不再问大脑省调用、大目标不易跑偏代价是计划僵硬现实一变就得重规划Reflexion是另一个维度——失败后把原因反思成文字写进记忆带着教训重试。一句话取舍环境越确定越偏 Plan-and-Execute越是探索性任务越偏 ReActReflexion 可以叠在前两种之上。▍ 十、记忆分三层分别活在哪短期记忆就是窗口里那串累加的历史任务一结束就没了长期记忆在外部向量库跨任务跨会话都在工作记忆是一块结构化的草稿记着当前子目标和已收集的变量。这张最该看的是代价那一列短期受窗口上限约束、越堆越贵长期要检索、检不准就等于没用工作记忆得自己维护、不维护就过期。三层的区别本质上是「谁负责把它塞进这一轮的 prompt」——因为模型每轮只能看到被装配进去的东西没塞进去的等于不存在。▍ 十一、长期记忆是怎么实现的没有魔法写进去是切片加向量化取出来是相似度检索。本质就是对 Agent 自己的历史做一次 RAG。所以「这个 Agent 记住了我的偏好」这句话准确的说法是它把上次那条记录检索出来、重新塞进了这一轮的 prompt。反过来也成立——检不准就等于没记住。长期记忆的上限就是这一步检索的上限。这跟缓存穿透是一个道理存了不等于取得到。▍ 十二、它到底能看到什么这张图把前面几张串成了一条认知边界。左边绿色是它能看到的**只有这一轮 prompt 里的那串字一个字都不多。**右边红色是它看不到的——你代码里的变量、上一轮那个对象、你的数据库、你脑子里默认的前提它一概不知道。于是只剩两条路**要它知道什么就装配进 prompt要它做什么就给它一个工具。**没有第三条。这也是排查 Agent 出错最有效的一招——先别猜模型在想什么把这一轮真实的 prompt 原样打出来看一眼十次里有八次问题就在那儿明摆着。▍ 十三、它为什么会绕圈死循环不是模型「笨了」是这一轮的输入和上一轮几乎一模一样上下文没变 → 采样出同一个想法 → 发出同一个动作 → 拿回同样的观察 → 追加进去但没带来新信息 → 下一轮输入还是几乎一样。闭环成立的条件只有一个这一轮的观察没有改变状态。图右边两个兜底轮数上限以及重复动作检测近 N 轮出现相同 action 就中断。最麻烦的地方在于——模型自己看不出来它在绕圈它每一轮都觉得这是个合理决定所以这道闸只能加在你的代码里。▍ 十四、它会编出根本不存在的工具你从没给过它query_database这个工具它照样能一本正经地写出来编参数也一样。因为模型输出的只是文本名字对不对、参数合不合法得你的代码去对。校验的位置很明确在执行之前——不在工具表里就拒绝执行然后把「没有这个工具」当结果回填回去。这跟后端处理不可信入参是同一套心智客户端传什么你都得校验区别只是这里的「客户端」是个会一本正经胡说的模型。有意思的是把错误原样喂回去之后它下一轮通常就会改用真实存在的那个。▍ 十五、一页记住这一张能讲给别人听前面 14 张就没白看。回到开头那个问题——一轮里到底发生了什么装配上下文一次前向解析出动作沙箱执行结果回填判定要不要继续。中间任何一步都不是模型替你做的校验是你的代码做的配对是你的代码做的保险丝是你的代码装的。**Agent 不是更聪明的模型是把一个会幻觉的 LLM包进了一个能调工具、能记东西、能自己决定下一步的循环。**它全部的能力来自「自主决定下一步」它全部的麻烦也来自这同一件事。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
返回列表