)
生活中常见的豆包deepseekchatgtp等的核心都是大模型LLM(Large Language Model作为Agent开发人我们不需要知道它的底层数学原理但对于它的产生过程和特点还是需要懂的。这里我推荐一个视频可以帮助不怎么懂的人有效了解大模型的产生过程。我个人看完之后觉得整个人醍醐灌顶。产生过程简答来说大模型是通过学习海量知识拥有丰富的知识库能有逻辑地回答问题的助手。通过上面的简短总结也可以看出大模型的一些特点也能解释一些问题。特点TokenToken是大模型处理文本的最小单位。一个Token可能是一个字也可能是一个词。大模型思考时就算是在计算一个Token后出现的下一个Token是哪一个通常这个过程其实带有随机性因为大模型计算得到是当前Toke出现的下一个Token的概率会有很多个大模型会根据算法选择一个但同样的情况下一次的选择可能是不一样的这也是为什么同一个问题大模型的回答会不一样。调用大模型API也是通过Token进行计费的对话内容越多Token消耗也越多费用也会更高。上下文窗口大家应该听过或者体验过聊着聊着ai突然没有反应了有点死了需要打开新的对话并且不会记得之前对话的内容。这中间就涉及到了大模型的上下文窗口。大模型的记忆是有限的记不了太多的东西这个存放记忆的容器就是上下文窗口。同一个对话里你之前说过什么它会记得新开一个对话就不记得了因为不是同一个上下文窗口了。对于一个上下文窗口因为Token容量有限当达到最大值时一般有两种处理方式。一种是不在支持对话另一种是将最早的对话记录删除给新对话腾地方。这也就导致大模型的记忆能力有限Agent有一个技术RAG就是来解决这个问题。再说一下上下文窗口会放一些什么。包括系统提示词System Prompt用户和大模型的聊天记录有的会包括一些上传文件 / 图片解析出来的文本图片本身不进窗口是图片转成文字放进去等信息。其实每次调用API的时候大模型本身是空白的依赖传输来的历史记录才能了解的更清楚。这个历史记录类似伪代码 { system prompt:..........., user:.............., ai:.............., user:..........., .......... user:(新的问题) }总结大模型可以遵照给的人设System Prompt按照要求做事能听懂用户的话能思考做出计划能生成用户想要的内容比如文案代码等。但它却不能真正动手做比如对大模型说帮我把某个地方的某个文件删除或者帮我给项目增加一个什么功能解决一下报错它会给出达到目标的方案第一步怎么做第二步怎么做当具体还是需要人亲手去做。这是大模型的局限之处而Agent的出现就是给大模型安装上手让大模型真正地去做事情让大脑和双手协作起来。