)
潜在问题与未来发展完全依赖虚拟的奖励模型学习也可能带来问题例如模型可能学到一些奇怪但能“讨好”奖励模型的模式如在摘要结尾总是加“please???”而这些模式并不符合真实人类的偏好。这可能导致模型输出变得刻板、冗长或过度谨慎。因此研究人员正在探索无需奖励模型的新算法如DPO、KTO等。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/lee-agent-2026/img/81ea55ec878790cc3ba494b103aa743b_79.png展望未来当AI能力更强时我们可能进入RLAIF阶段即由AI如另一个强大的模型来提供反馈。甚至模型可以具备“反省”能力自己评价自己的输出实现自我迭代。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/lee-agent-2026/img/81ea55ec878790cc3ba494b103aa743b_81.pnghttps://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/lee-agent-2026/img/81ea55ec878790cc3ba494b103aa743b_83.png根本挑战何为“好”https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/lee-agent-2026/img/81ea55ec878790cc3ba494b103aa743b_85.png强化学习面临一个根本性挑战“好”的标准是什么答案的好坏可能涉及多个有时相互冲突的维度例如安全性拒绝回答危险问题。帮助性尽力满足用户请求。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/lee-agent-2026/img/81ea55ec878790cc3ba494b103aa743b_87.pnghttps://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/lee-agent-2026/img/81ea55ec878790cc3ba494b103aa743b_89.png当安全性和帮助性发生冲突时哪个更重要这没有固定答案不同模型有不同的权衡标准。未来当语言模型需要处理连人类都无法判断优劣的复杂问题时如何获取有效的反馈以继续进步将是更大的挑战。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/lee-agent-2026/img/81ea55ec878790cc3ba494b103aa743b_91.png总结本节课中我们一起学习了大型语言模型训练的第三阶段——基于人类反馈的强化学习。我们回顾了三个阶段的特点深入探讨了RLHF的原理、与指令微调及AlphaGo的异同并分析了其核心挑战反馈获取与“好”的标准定义以及未来的发展方向奖励模型、RLAIF等。通过这三个阶段的“修炼”语言模型从拥有基础知识的“基石模型”逐步被“对齐”到人类的偏好和需求上。71以大型语言模型打造的AI Agent https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/lee-agent-2026/img/a444bdcfc959fcac7cffb31cd1760043_1.png在本节课中我们将要学习如何利用大型语言模型构建能够自主执行多步骤复杂任务的AI Agent。我们将从AI Agent的基本概念出发探讨其运作原理并通过具体实例理解其在实际场景中的应用。目前大多数人在使用AI协助完成任务时通常只要求AI执行单一、独立的步骤。例如让GPT进行翻译或让ChatGPT调用DALL·E生成图像。然而人类能够处理更复杂的任务这些任务往往需要多个步骤才能完成。以“组织朋友聚餐”为例这个任务涉及多个环节首先需要调查大家的时间然后统计出最合适的时间接着预订餐厅。在执行过程中计划可能发生变化例如首选餐厅没有空位就需要寻找其他备选餐厅。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/lee-agent-2026/img/a444bdcfc959fcac7cffb31cd1760043_3.png这种需要规划、按顺序执行多个步骤并能根据情况调整计划的复杂任务正是我们希望AI能够胜任的。在本课程中我们将这种能够自主处理此类任务的AI称为AI Agent。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/lee-agent-2026/img/a444bdcfc959fcac7cffb31cd1760043_5.png 什么是AI AgentAI Agent指的是能够执行多步骤复杂任务、制定计划并能根据环境反馈修改计划的智能体。虽然目前此类应用尚不普遍但随着大型语言模型能力的提升AI Agent有望在不久的将来成为现实。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/lee-agent-2026/img/a444bdcfc959fcac7cffb31cd1760043_7.png当前已有一些知名的AI Agent尝试例如AutoGPT。用户可以给它一个任务如“制作一个网页”它便会自主尝试规划步骤、使用工具如网络搜索并反思进展以期完成任务。尽管其成功率仍有局限但这代表了AI发展的一个重要方向。未来的趋势是AI将不再局限于简单的“一问一答”模式而是能够自主与环境互动通过多步骤推理和行动来解决问题。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/lee-agent-2026/img/a444bdcfc959fcac7cffb31cd1760043_9.pnghttps://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/lee-agent-2026/img/a444bdcfc959fcac7cffb31cd1760043_11.pnghttps://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/lee-agent-2026/img/a444bdcfc959fcac7cffb31cd1760043_13.pnghttps://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/lee-agent-2026/img/a444bdcfc959fcac7cffb31cd1760043_15.png AI Agent的应用实例https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/lee-agent-2026/img/a444bdcfc959fcac7cffb31cd1760043_17.pnghttps://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/lee-agent-2026/img/a444bdcfc959fcac7cffb31cd1760043_19.pnghttps://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/lee-agent-2026/img/a444bdcfc959fcac7cffb31cd1760043_21.png上一节我们介绍了AI Agent的基本概念本节中我们来看看它在不同领域的具体应用。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/lee-agent-2026/img/a444bdcfc959fcac7cffb31cd1760043_23.pnghttps://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/lee-agent-2026/img/a444bdcfc959fcac7cffb31cd1760043_25.png以下是几个著名的AI Agent研究与应用实例虚拟社会模拟如斯坦福小镇其中由AI扮演的虚拟居民能够进行社交、制定计划并生活。游戏世界探索例如Voyager项目让AI在《我的世界》游戏中自主探索、学习技能如制作工具甚至最终打造出钻石剑。实体机器人操控Figure 01机器人展示了如何用大型语言模型理解指令并操控实体完成如“清理桌子”等任务。更早的研究如Inner Monologue论文2022年也已探索让机器人通过语言模型规划动作并在遇到障碍时调整计划。自动驾驶研究如Talk to Drive展示了如何用大型语言模型理解自然语言指令如“小心驾驶”并结合交通、天气等信息生成控制代码来驾驶车辆。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/lee-agent-2026/img/a444bdcfc959fcac7cffb31cd1760043_27.png⚙️ AI Agent的运作原理了解了AI Agent的潜力后我们来深入探讨其背后可能的运作机制。一个AI Agent系统通常包含以下几个核心组件AI Agent 循环 1. 感知状态 - 2. 结合目标与记忆 - 3. 制定/调整计划 - 4. 执行行动 - 5. 影响环境 - (回到1)https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/lee-agent-2026/img/a444bdcfc959fcac7cffb31cd1760043_29.png终极目标Agent需要完成的最终任务。记忆存储过去与环境互动获得的经验。状态感知通过传感器如文字输入、视觉、听觉获取当前环境信息。规划根据目标、记忆和当前状态制定短期行动计划。行动执行计划输出可以是文字、代码或物理动作。反思与调整根据行动对环境造成的影响新状态来更新记忆并调整后续计划。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/lee-agent-2026/img/a444bdcfc959fcac7cffb31cd1760043_31.png大型语言模型在生成计划、根据新信息调整计划、以及通过反思积累经验方面已展现出初步能力这为构建实用的AI Agent奠定了基础。 记忆与学习能力https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/lee-agent-2026/img/a444bdcfc959fcac7cffb31cd1760043_33.pnghttps://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/lee-agent-2026/img/a444bdcfc959fcac7cffb31cd1760043_35.png一个关键的挑战是让AI Agent拥有长期记忆。当前的ChatGPT对话记忆仅限于单次会话。然而OpenAI曾测试过具有记忆功能的版本其思路是对历史对话进行摘要并在新对话中检索相关记忆从而实现更个性化的交互。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/lee-agent-2026/img/a444bdcfc959fcac7cffb31cd1760043_37.png研究如Memory-GPT也探索了为大型语言模型添加外部记忆模块的方法。记忆使Agent能够从经验中学习从而在未来遇到类似情况时采取更优行动。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/lee-agent-2026/img/a444bdcfc959fcac7cffb31cd1760043_39.pnghttps://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/lee-agent-2026/img/a444bdcfc959fcac7cffb31cd1760043_41.pnghttps://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/lee-agent-2026/img/a444bdcfc959fcac7cffb31cd1760043_43.pnghttps://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/lee-agent-2026/img/a444bdcfc959fcac7cffb31cd1760043_45.png 实例分析AI Agent如何运作如果觉得以上描述仍不够具体让我们通过一个虚构但清晰的例子来理解AI Agent的运作流程。我们将分析一个需要自主执行救援任务的“泥人戈列姆”如何作为AI Agent工作。背景戈列姆的任务是“安全地将受伤考生带出迷宫”。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/lee-agent-2026/img/a444bdcfc959fcac7cffb31cd1760043_47.png初始化目标安全带离考生。记忆空。初始状态通过图像描述技术获得“眼前是遭遇攻击而重伤的考生艾黛尔”。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/lee-agent-2026/img/a444bdcfc959fcac7cffb31cd1760043_49.pnghttps://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/lee-agent-2026/img/a444bdcfc959fcac7cffb31cd1760043_51.png制定初始计划语言模型根据目标、记忆和状态生成计划。例如立即评估艾黛尔的伤势。提供急救。规划逃离路线。执行与遭遇变化Agent开始执行“评估伤势”行动。环境状态变化在评估过程中敌人发动了袭击。状态更新“正在评估伤势时遭遇袭击。”https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/lee-agent-2026/img/a444bdcfc959fcac7cffb31cd1760043_53.png调整计划语言模型根据新状态反思并调整计划。新计划可能变为优先保护艾黛尔免受攻击。在安全情况下评估伤势。寻找机会撤离。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/lee-agent-2026/img/a444bdcfc959fcac7cffb31cd1760043_55.png积累经验任务结束后语言模型可以反思整个过程总结经验如“在危险环境中需保持高度警觉”并将其存入记忆。当未来再次处于类似环境时这些记忆会影响其优先采取的行动例如可能先观察环境再接近伤员。这个例子展示了AI Agent如何实现“感知-规划-行动-学习”的闭环。当前研究如DEPS、ReAct、Reflection等论文正在探索如何让语言模型更好地完成计划调整和经验积累。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/lee-agent-2026/img/a444bdcfc959fcac7cffb31cd1760043_57.pnghttps://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/lee-agent-2026/img/a444bdcfc959fcac7cffb31cd1760043_59.png 总结与展望https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/lee-agent-2026/img/a444bdcfc959fcac7cffb31cd1760043_61.pnghttps://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/lee-agent-2026/img/a444bdcfc959fcac7cffb31cd1760043_63.png本节课中我们一起学习了AI Agent的核心概念。我们认识到AI Agent是一种能够为复杂目标制定多步骤计划、执行行动、并根据环境变化灵活调整计划的智能体。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/lee-agent-2026/img/a444bdcfc959fcac7cffb31cd1760043_65.pnghttps://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/lee-agent-2026/img/a444bdcfc959fcac7cffb31cd1760043_67.png我们探讨了其运作原理包括感知、规划、行动和学习的循环。通过多个实例如虚拟世界、机器人、自动驾驶以及一个详细的“戈列姆”任务分解我们具体了解了AI Agent如何在实际中应用。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/lee-agent-2026/img/a444bdcfc959fcac7cffb31cd1760043_69.png尽管将语言模型生成的文字计划转化为物理世界或复杂虚拟世界中的具体行动仍是主要挑战但现有研究已显示出可行性。随着大型语言模型能力的持续发展可以预见在不久的将来各种形式的AI Agent将广泛出现在我们的生活和工作中。如果你希望深入了解可以参考关于AI Agent的综述论文其中描绘了未来由众多AI Agent构成的丰富虚拟世界图景。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/lee-agent-2026/img/a444bdcfc959fcac7cffb31cd1760043_71.png