ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

大模型的能力究竟从何而来?训练、推理、Reasoning、Tools、Agent:一篇文章理清大模型全链路

大模型的能力究竟从何而来?训练、推理、Reasoning、Tools、Agent:一篇文章理清大模型全链路 0. 前言最近的大模型越来越像一场“军备竞赛”。OpenAI 的 GPT 系列、Anthropic 的 Claude、Google 的 Gemini国内的 DeepSeek、Qwen以及 xAI 的 Grok都在不断推出新模型。竞争重点也从最早的语言和知识能力快速扩展到 Reasoning、代码、长上下文、工具调用和 Agent。我也很感兴趣这些能力到底是怎么来的一个模型又是怎么被训练出来、运行起来最后变成真正可用的 AI 系统完整链路其实可以概括为数据 模型架构 训练目标 算力 → Training → Model → Inference → LLM Application → Agent前半段解决的是模型怎么得到。大规模预训练让模型获得语言、知识、代码等基础能力后训练进一步强化指令遵循、偏好、推理和工具使用。训练完成后才得到一个真正可以保存、部署和调用的Model。后半段解决的是模型怎么被使用。用户输入 Prompt模型运行并生成结果这是Inference复杂任务中的多步骤分析属于Reasoning需要外部知识时接入RAG需要搜索、数据库、代码执行等能力时接入Tools如果系统还能持续规划、调用工具、读取结果并继续行动就进入Agent。所以真正看懂一个新模型不能只看参数和榜单。我觉得更重要的是了解它的能力是怎么训练出来的Inference 阶段发生了什么Reasoning、RAG、Tools 又分别解决什么问题以及一个 Model 最后如何变成 Agent。接下来就沿着这条链路把 Training、Inference、Reasoning、RAG、Agent 一次讲清楚。1. 大模型全链路核心概念Training是制造模型的过程。模型最开始有一套结构和初始参数通过大量数据、计算和优化不断修改参数最终得到一个训练完成的模型。Model是训练之后真正留下来的“成品”。从最核心的数学意义上可以粗略理解成Model Architecture Learned Parameters也就是模型结构 训练得到的参数。Inference 是使用模型的过程。模型已经训练好了用户给它一个 Prompt系统加载模型参数执行计算生成输出这整个过程叫 Inference。再往外看Inference 之后还会叠加一系列能力和系统组件。比如Prompt Context → 模型运行RAG → 给当前任务补充外部知识Tools → 给模型增加外部操作能力Reasoning → 模型在复杂任务中表现出来的分析、规划、推导能力Agent → 把模型、上下文、工具、状态和执行循环组织成一个完整系统所以如果一定要把整个大模型技术体系分层我觉得可以这么理解第一层模型本体包括Architecture Parameters它决定“这个神经网络是什么”。第二层模型运行包括Inference Runtime Prompt Context。它决定“怎么把这个模型跑起来”。第三层LLM 应用包括RAG Tools Database Application Logic。它决定“怎么把一个模型变成真正有用的应用”。第四层Agent 系统包括Planning Actions Environment State Feedback Loop。它决定“怎么让 AI 不只是回答一次而是围绕目标持续完成任务”。后面所有概念基本都可以放回这四层里理解。2. Training一个大模型到底是怎么被“训练出来”的很多人第一次接触大模型会把 Training 理解成“给模型看很多资料”。这个说法不算错但太浅。Training 真正做的事情是通过训练数据不断计算误差再利用误差反向修改模型参数。可以把最基础的训练循环写成Training Data → Model Forward → Prediction → Loss → Backward → Gradient → Update Parameters → Repeat。模型最开始不是“什么都没有”。它通常先有一个确定的网络架构以及一组初始化参数。假设初始参数是θ₀然后通过一次又一次训练θ₀ → θ₁ → θ₂ → θ₃ → … → θ*最终得到一组训练后的参数。所以从这个角度看Training 的核心本质上就是Learning Parameters。也就是说把数据中的模式通过计算逐步编码进参数。这也是为什么训练完成之后模型即使断网、关闭、躺在硬盘上它依然已经是一个完整的训练模型。因为真正被训练出来的东西已经存在于它的参数中。(1) Pre-training先获得基础能力现代大模型训练最重要的两层是Pre-training → Post-trainingPre-training也就是预训练主要解决一个问题先让模型从大规模数据里学会语言、知识、结构、模式和大量潜在能力。以典型 GPT 类自回归语言模型为例常见的训练目标是根据前面的 Token预测下一个 Token。比如The capital of France is → Paris模型会不断调整参数让正确 Token 获得更高概率。数学上可以粗略理解成P(xₜ | x₁, x₂, …, xₜ₋₁)也就是在已有上下文条件下预测接下来最可能出现什么。自回归 Next-token Prediction是现代生成式 LLM 极其重要的一类预训练和生成范式。(2) Post-training从“会生成”到“会按要求做事”预训练完成后模型已经有了大量能力。但它可能仍然存在一个很实际的问题。比如用户问一个问题它未必知道应该如何遵循指令什么答案更符合用户意图什么回答风格更合适哪些内容应该拒绝什么场景应该调用工具如何更好地完成数学、代码、分析等任务所以还需要 Post-training。常见的方法包括SFT、Preference Learning、RLHF、RLAIF、DPO以及其他后训练方法。SFT也就是 Supervised Fine-Tuning可以简单理解为Prompt 高质量理想回答 → 继续训练模型。比如问题解释牛顿第二定律配上一份高质量参考回答让模型学习“这种问题应该怎样回答得更好”。再往后可以加入偏好数据。例如同一个问题有两个答案Answer AAnswer B人类或者其他系统判断A B那么模型就可以继续学习什么样的回答更符合偏好。经典 RLHF 会进一步引入 Reward Model 和强化学习。而 DPO 等方法则可以直接利用偏好数据进行优化不一定需要完整走传统 RLHF 的流程。因此Post-training 是一大类继续塑造模型行为、指令遵循、偏好、推理、工具使用等能力的方法集合。3. Model 与 Inference模型训练完之后用户到底在使用什么Training 结束后真正得到的是 Model。从最核心的角度理解Model Architecture Learned Parameters这里有两个词需要分开。(1) Architecture决定模型“怎么算”Architecture 是神经网络的结构设计。Transformer 是现代大模型最重要的架构基础之一,也是是今天主流 LLM 最重要的架构基础之一。一个典型的 Transformer 类语言模型可以非常粗略地理解成Token → Embedding → Transformer Layers × N → Output ProbabilityTransformer Layer 内部又包含 Attention、Feed Forward Network、Normalization 等模块。Architecture 决定的是信息进入网络以后以什么计算结构被处理。(2) Parameters训练真正学出来的东西你经常看到7B、32B、70B、175B。其中 B 是Billion。比如7B 约 70 亿参数70B 约 700 亿参数这些参数就是训练过程中不断被更新的权重。可以把训练理解成在寻找θ* arg min L(θ)也就是寻找一组尽可能降低训练目标损失的参数。所以Architecture θ* → Trained Model(3) Inference用户真正调用模型时发生了什么模型训练结束之后用户开始用它。这个阶段就是 Inference。可以把一次最基础的调用写成Trained Model Prompt → Inference → Output。比如用户输入1 1 ? → 模型运行 → 输出2这整个“模型加载已有参数并基于输入计算结果”的过程就是 Inference。而 Training 与 Inference 最本质的区别Training → 修改参数Inference → 使用参数4. Inference 不等于 Reasoning为什么“推理模型”越来越重要(1) Inference 是“运行模型”Inference 强调的是模型正在根据输入执行计算并生成结果。无论你问什么只要模型在处理输入、生成输出就发生了 Inference。比如法国的首都是哪里模型回答巴黎。这是 Inference。(2) Reasoning 是“解决复杂问题的能力”Reasoning 强调的是模型是否能够进行多步骤分析、逻辑推导、数学求解、规划、判断等。比如A BB CC D谁最大模型仍然是在做 Inference。但这个任务需要 Reasoning。所以Reasoning 是模型在 Inference 阶段可能表现出来的一类能力。换句话说所有正常模型响应都涉及 Inference但不是所有任务都需要复杂 Reasoning。一个简单事实问答也要 Inference。但复杂数学题、代码调试、战略规划、多约束决策才更依赖 Reasoning。这一区别也决定了为什么今天“推理模型”会变得越来越重要。5. RAG 与 Tools模型连接外部世界(1) RAG给模型接入外部知识模型有一个天然限制参数里的知识不可能永远保持最新。RAG全称Retrieval-Augmented Generation核心流程是Question → Retrieval → External Knowledge → Context → LLM → Answer例如公司有大量内部文档。与其每次文档更新都重新训练模型不如用户提问 → 检索最新资料 → 放进 Context → 模型基于资料回答RAG 没有把新知识重新写进模型参数。知识只是临时进入当前 Context。所以 RAG 本质上是模型外部的知识增强机制。而且 RAG 不只是“企业知识库 向量数据库”。它可以连接网页、数据库、论文、企业文档、实时数据、用户私有数据等。本质都是让模型在推理时获得当前任务真正需要的信息。(2) Tools给模型接入外部能力模型可以决定什么时候调用外部工具例如搜索引擎、Python、数据库、浏览器、邮件系统、日历、CRM、企业 API等。模型负责的是什么时候调用、调用什么、参数是什么、拿到结果后下一步做什么。流程是User Request → LLM → Tool Call → Tool Result → LLM → Final Answer。这是当前主流 LLM Agent / Function Calling 的核心循环也就是“推理—行动—观察”循环。不过不是所有大模型都能调用工具。大模型本身只是文本生成模型它不会真正执行搜索引擎、数据库或 Python。要支持工具调用通常需要模型经过 function calling / tool use 相关训练或对齐部署平台或框架支持工具调用接口模型能稳定输出结构化参数例如 JSON。6. 从 LLM 到 Agent普通模型很多时候是Input → Model → Output一次请求一次回答。Agent则形成了一个持续运行的控制循环更像一个系统LLM Context Tools State Control Loop Environment。其中LLM负责理解、分析、生成、决策。Context负责保存当前任务所需的信息。Tools负责真正与外部系统交互。State / Memory记录任务目前执行到了哪里。Planning决定下一步应该做什么。Action真正执行搜索、写文件、发请求、调用 API 等操作。EnvironmentAgent 正在操作的外部世界。Feedback Loop执行完以后读取结果再继续决定下一步。所以一个典型 Agent 系统可能是Goal → LLM → Reasoning → Planning → Tool Call → Environment → Observation → Update Plan → Next Action7. 总结我经常思考、串联不同领域的知识关联逻辑。从大模型到智能体、技术路径和框架层出不穷各个方向都经历过一定的技术革新和发展。今天我刚看到了阿里千问大模型的招聘信息从招聘岗位就能大致看出如今厂商主要做的哪些工作。25种类岗位大概如下其实就是基本对应文中大模型全链路的各个环节从模型底座预训练、到后训练与强化学习、再到多模态、Agent 与 Coding等等。所以我觉得先有整体框架思维、再学习局部细节是比较合理的路径。以后再遇到任何一个 AI 新概念都能先判断它是在“制造模型”它属于“模型本体”它是在“运行模型”还是在“给模型增加外部能力”或者它已经属于一个完整 Agent 系统当这几个层级分清之后很多看起来复杂的大模型概念就会变得简单。推荐阅读一文读懂智能体发展史从单一范式到自主协作的进化之路从Embedding到Transformer一文读懂自然语言处理核心技术Harness 最佳开源项目从 learnClaudeCode 看懂 Agent 的真正运行机制Graph Engineering 一文看懂智能体新范式持续分享欢迎关注
返回列表