ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

大模型学习操作文档(13个核心概念串讲)

大模型学习操作文档(13个核心概念串讲) 大模型学习操作文档(13个核心概念串讲)核心概念全解第一阶段和模型对话Prompt:你和模型说的每一句话System Prompt:给模型定规矩第二阶段理解模型的边界Token:模型不是按照“字”来读的上下文窗口模型一次能看多少幻觉模型会一本正经的胡说八道第三阶段让模型可用Structured Output:输出别乱来Function Calling:别编了去查真实数据RAG模型不认识你的私有数据Embedding:RAG背后的“翻译官”向量数据库存向量的“专用仓库”微调和RAG的区别第四阶段让模型自主Agent:让模型自己跑起来MCP工具对接的USB协议Skill:能力的标准化封装Prompt:你和模型说的每一句话Prompt就是你输入给大模型的内容System Prompt:给模型定规矩普通的Prompt是你问一句它答一句但是如果你想让模型始终按照某种风格回答这个时候就需要System Prompt在对话之前给模型设定一个角色和行为规范Token:模型不是按照“字”来读取的Token是大模型处理文本的最小单位一个汉字通常是1-2个Token一个英文单词可能是1-3个Token大模型的一切都以Token计量上下文窗口模型一次能看多少窗口满了怎么办最早的内容会被挤出去-模型忘记你前面说了什么上下文窗口越大成本越高、延迟越高还可能使中间的内容注意不到agent model harness在一个ai agent系统里面除了模型本身之外几乎所有决定它能不能稳定交付的东西都属于harness从prompt到context到harnessai工程的三次重心转移第一阶段Prompt Engineering 让模型听懂大模型本质上是一个对上下文极度敏感的概率生成器你给他什么样的输入他就沿着那个方向所以同一件事换个说法效果效果会差很多核心模型不是不会而是你没有把话说明白提示词擅长把任务表达清楚但是不擅长凭空补出模型不知道的知识。它解决的是“表达”的问题不是“信息”的问题第二阶段Context Engineering 让模型知道核心模型未必知道所以系统必须在合适的时机把正确的信息送出去召回找最相关的信息、压缩摘要提炼省空间、组装按照顺序排好重要的放后面第三阶段Harness Engineering 让模型做对前两代工程关注的是怎么让模型更会想Harness关注的是“怎么让模型不跑偏、跑的稳、出了错还能爬起来”成熟的Harness分为6层按照他在干啥分为3组输入侧让模型看到正确的东西上下文精细化管理记忆与状态管理动作侧让模型做出正确的事工具系统任务执行编排校验侧让模型知道做没做对出错可以爬起来评估观测约束恢复第一层上下文精细化管的是空间发给模型的那一坨上下文长啥样装了啥怎么排布。核心把角色和目标钉死大部分agent跑偏根源是没有说清楚身份。模型要知道自己是谁、任务是啥、成功的标准动态筛选不是一次塞满让agent边干活边按需抓信息而不是一上来就把所有可能有用的东西塞进去结构化组织固定规则放一处动态证据放一处中间结论放一处第二层工具系统没有工具的大模型就是文本预测器接上工具之后才能真正活过来给他哪些工具、什么时候使用、工具结果怎么喂回来模型MCP本质上就是在做工具的标准化让任何工具都能用同一种方式接到任何agent第三层执行编排agent的本质其实就是一个for循环:思考一步-行动一步-观察结果-在思考下一步职责给模型一条明确的工作轨道让他知道“我现在在哪一步下一步干啥”第四层记忆与状态幻觉模型会一本正经地胡说八道大模型会编造不存在的东西幻觉不是BUG是大模型工作方式的副产物它本质上是在预测下一个最可能出现的Token而不是在检索事实幻觉的存在催生了后面的一系列技术Function Calling:不让模型自己编答案而是让他去调用真实的接口查数据RAG把真实的文档检索出来塞进上下文让模型基于事实来回答Structured Output:输出别乱来模型的默认输出是自由文本想说什么说什么但做应用开发需要的往往是结构化数据Structured Output就是约束模型按照指定格式输出格式在Prompt里规定格式用JSON Schema约束可靠api支持Function Calling别编了去查真实数据模型有两个硬伤不知道实时信息也不能操作外部系统Function Calling就是解决这个问题的你给模型定义一组“工具”函数模型在回答时可以决定调用哪个工具你的代码负责执行把结果返回RAG模型不认识你的私有数据模型训练用的是公开数据你公司的内部文档、会议纪要、需求文档—它都不知道最直觉的想法就是:把相关资料找出来塞进上下文让模型基于这些资料来回答RAG检索增强生成RAG不改变模型本身而是在提问的时候给模型补充资料离线阶段把你的文档切成片段转成向量存进数据库在线阶段用户提问时检索最相关的片段塞进上下文模型基于这些片段回答Embedding:RAG背后的翻译官如何判断相关Embedding就是把文本翻译成一组数字向量语义越相近的文本向量距离越近向量数据库存向量的“专用仓库”有了Embedding还需要来存放这些向量普通数据库Mysql)擅长精确匹配和范围查询但是向量检索是找“最近的邻居”这是不同的查询方式向量数据库存向量、快速做相似度检索。微调和RAG的区别简单来说要让模型“知道新知识”-RAG要让模型“学会新能力”-微调Agent让模型自己跑起来有了Function Calling,模型就能调用工具有了RAG模型有私有知识Agent就是把”你判断下一步“这件事交给模型自己做一个典型的agent循环接收用户任务自己规划这件事分几步执行第一步调用工具、检索资料、直接回答观察结果判断是否继续如果没有完成回到第二步任务完成输出最终结果agent的本质思维链规则能力Funciton Calling执行能力循环迭代能力所谓思维链就是让模型把推理过程一步一步写出来而不是直接给结论。让模型”想清楚再行动“这就是agent自主规划的基础MCP工具对接的“USB”协议agent能调工具但是问题来啦每次接一个新工具就要写一套对接代码换个大模型又要重新写就像是手机充电口以前每个手机平牌一个接口充电器不能通用。MCP就是AI领域的“USB-C”一个标准化协议让任何模型都能用统一的方式连接外部工具和数据源有了MCP工具开发者只需要实现一次MCP协议所有支持MCP的模型都能用应用开发者不需要为每个工具写适配代码换模型不需要改工具对接逻辑skill:能力的标准化封装skill在agent和mcp之上进一步抽象skill把agent的某个能力封装成一个可复用的”技能包“每个skill定义了”能做什么、需要什么输入、输出什么格式、依赖那些工具“
返回列表