AI Agent从无到有5: 大语言模型(LLM)的前世今生与全景扫描
纲要大语言模型的定义与基础LLM概念基于深度学习的自然语言处理模型核心能力文本生成、分类、摘要、翻译等技术演进路线词向量与One‑Hot编码的局限词嵌入低维稠密向量与语义关系RNN/LSTM序列建模与长短期记忆Transformer自注意力机制与预训练范式BERTvsGPT微调与多任务统一多模态与推理模型终极目标人工通用智能AGI当前主流LLM格局国际模型OpenAI o1/GPT‑4、Claude、Gemini、LLaMA国内模型豆包、文心、通义千问、DeepSeek、GLM能力维度推理、编码、数学、视觉、文生图模型选择关键因素闭源 vs 开源上下文窗口大小调用成本任务匹配度代码实战调用大模型 API 的通用封装使用 Python 同时调用 OpenAI 和 DeepSeek比较回复质量与成本总结与趋势大语言模型AI Agent 的超级大脑随着 AI Agent 的兴起几乎所有智能化应用都围绕着一个核心组件运转——大语言模型Large Language Model简称LLM。对于刚刚踏入这一领域的开发者而言理解LLM是什么、它经历了怎样的发展、目前有哪些主流选择是后续构建 Agent 不可或缺的理论基础。LLM是基于深度学习的自然语言处理模型能够学习自然语言的语法和语义并生成人类可读的文本。这类模型通常拥有数十亿到数万亿的参数通过在互联网海量文本上进行训练掌握了文本生成、分类、摘要、翻译、语音识别等多种能力。而这一切能力的源头可以追溯到一项颠覆性的架构Transformer。从词向量到 Transformer大模型的“前世今生”要让计算机理解自然语言第一步是将文字转换为数字。这一过程经历了多次迭代。词向量与 One‑Hot 编码最朴素的想法是“一个词一个位置”。例如假设语料中只有“猫、狗、牛、羊”四个词那么可以这样表示猫 →[1, 0, 0, 0]狗 →[0, 1, 0, 0]牛 →[0, 0, 1, 0]羊 →[0, 0, 0, 1]这种One‑Hot编码虽然简单但有两个致命缺陷无法表达词与词之间的关系且向量维度随词汇量线性膨胀导致计算和存储效率极低。词嵌入让语义在空间中对齐词嵌入Word Embedding将高维稀疏的One‑Hot向量映射到一个低维稠密的向量空间。在这个空间里语义相近的词距离更近。例如“牛”和“羊”同属家畜其向量会彼此靠近“猫”和“狗”同为宠物也会聚成一簇。这种表示不仅维度大幅降低还具备优秀的迁移学习能力可以在不同自然语言任务中复用。下面用一段简单的 Python 代码演示词嵌入的效果使用Gensim加载预训练的Glove模型importgensim.downloaderasapi# 加载小型 GloVe 词向量首次运行会自动下载modelapi.load(glove-wiki-gigaword-50)# 查看词语向量print(猫的向量部分:,model[cat][:10])# 计算语义相似度print(猫和狗的相似度:,model.similarity(cat,dog))print(猫和汽车的相似度:,model.similarity(cat,car))# 寻找与“国王”语义最接近的词经典类比国王 - 男人 女人 ≈ 王后resultmodel.most_similar(positive[king,woman],negative[man],topn1)print(king - man woman ,result[0][0])运行这段代码你会直观地看到词嵌入如何捕捉语义关系。从 RNN 到 LSTM处理序列信息自然语言是典型的序列数据——单词的顺序直接影响含义。循环神经网络RNN专门为序列建模而设计它按顺序处理每一个单词并将前文信息传递给后续步骤。但普通RNN会遭遇短期记忆丢失和训练成本高的问题。长短时记忆网络LSTM引入“记忆单元”和门控机制能够选择性地记住重要信息、遗忘无关内容从而在机器翻译、语音识别等任务中表现优异。不过这两类模型仍然需要大量人工标注数据且在并行计算方面效率低下。Transformer 与预训练革命2017 年Google 提出Transformer架构彻底改变了 NLP 的范式。其核心是自注意力机制让模型在理解一个词时能够同时关注句子中所有其他词而不必像RNN那样顺序传递。这使得模型可以并行训练大幅缩短训练时间捕捉长距离依赖缓解遗忘问题采用自监督学习在海量无标注文本上进行预训练不再依赖昂贵的人工标注。Transformer就像一个“超级完形填空”机器给定一段话并挖去一些词它通过上下文预测被挖掉的内容从而学会语言的深层规律。在Transformer基础上BERT通过“掩码语言模型”进行预训练然后为每个具体任务如情感分析、问答添加一个微调层。其缺点是一个任务一个模型通用性较差。而GPT系列采用自回归生成方式并逐步统一为“预训练 提示Prompt”范式使得同一个模型可以完成写作、翻译、聊天等多种任务。2022 年底 ChatGPT 的问世标志着大模型真正走向通用化和实用化。下图简要概括了从词向量到现代LLM的发展主线早期词向量/One-Hot稀疏高维, 无语义词嵌入(Word2Vec/GloVe)低维稠密,语义相似性序列建模RNN处理序列数据,短期记忆丢失LSTM长短期记忆,门控机制架构突破Transformer(2017)自注意力, 并行训练,自监督预训练BERT掩码预训练微调,单任务专用GPT系列自回归生成,多任务统一现代LLMChatGPT/GPT-4通用对话, 推理,多模态AGI探索通用人工智能大语言模型演进路线多模态与推理模型未来方向当前最前沿的大模型已经突破纯文本的边界进入多模态时代能够同时理解文字、图像、声音甚至视频。这就像拥有一个全能助手既能听懂你的口头指令又能看懂你展示的图片还能分析视频内容。在医疗诊断中它可以同时分析病患症状描述和 X 光片在教育领域它能结合学生的口语提问和手写作业给出个性化指导。此外以 OpenAI o1 为代表的推理模型在回答问题前会进行“思考”——内部执行多步推理过程从而在数学、编程等复杂任务上大幅超越传统模型。这些技术的持续进化最终指向一个宏大目标人工通用智能AGI。AGI 不仅能完成特定任务还能像人类一样思考、学习、推理适应各种未知环境。尽管伦理和安全问题尚待解决但大模型无疑是通往 AGI 的关键阶梯。全景扫描国内外主流大模型当前大模型市场竞争激烈模型数量几乎每天都在增长。为了方便开发者选型我们可以从闭源/开源、性能、上下文窗口、成本等维度进行横向对比。国际主流模型国际市场的领头羊是 OpenAI 系列其 GPT‑4 和 o1 推理模型在多任务推理、编码、数学等领域遥遥领先。Anthropic 的 Claude 系列紧随其后在长文理解和代码生成方面表现突出。Google 的 Gemini 拥有目前最大的上下文窗口可达 100 万 token约 40 万字擅长处理超长文本。Meta 的 LLaMA 系列则是开源社区的基石衍生出众多微调版本。以下是国际头部模型的能力简况数据源自公开评测榜模型多任务推理(MMLU)编码能力数学能力上下文窗口价格水平OpenAI o1★★★★★★★★★☆★★★★★128k高GPT‑4o★★★★☆★★★★☆★★★★☆128k中高Claude 3.5 Sonnet★★★★☆★★★★★★★★★☆200k中Gemini 1.5 Pro★★★★☆★★★☆☆★★★★☆1M低LLaMA 3 405B (开源)★★★★☆★★★☆☆★★★☆☆8k~128k自托管成本国内主流模型国内大模型同样百花齐放。根据对话、视觉、文生图、开源等维度的评测对话模型字节跳动的豆包 32k 版分数领先百度文心 4.0 紧随其后。视觉模型GPT‑4o 几乎满分豆包和 Claude 表现不俗。文生图模型华为的盘古 Image 目前排名较高豆包也位居前列。开源模型阿里的通义千问Qwen72B 占据榜首DeepSeek‑V2.5 和 LLaMA 3.1 405B 并驾齐驱。下面的流程图可以帮助你快速梳理模型选择的基本逻辑是否是否是否对话视觉长文本低成本开始选型是否可访问国外API?是否需要最强推理?倾向开源自托管?OpenAI o1 / GPT-4oClaude / GeminiQwen2 / DeepSeek / LLaMA3任务类型?豆包 / 文心4.0GPT-4o 或 豆包视觉Gemini (1M窗口)DeepSeek / GLM关键对比维度上下文窗口决定模型一次能处理多少信息。窗口越大越适合分析长篇文档或进行多轮对话。Gemini 的 100 万 token 窗口几乎可以吞下一整本小说。调用价格对开发者至关重要。GPT‑4 系列仍然较为昂贵而 DeepSeek、GLM 等模型的价格极具竞争力。通常1k token 约对应 300~500 个汉字你可以根据预估调用量计算成本。闭源 vs 开源闭源模型通过 API 调用开箱即用但数据需传输至第三方开源模型可以本地部署数据安全性更高但需要自行维护硬件和推理服务。如果你的机器性能有限可以先从 API 调用开始实践 Agent 开发。代码实战调用大模型 API 的通用示例为了更具体地体验不同模型的表现这里提供一个 Python 脚本同时调用 OpenAI 和 DeepSeek 的 API发送相同问题并打印回复方便对比。前置准备注册并获取 OpenAI API Key或使用兼容的代理地址。注册 DeepSeek 并获取 API Keyplatform.deepseek.com。安装依赖pipinstallopenai可运行代码请将your-openai-api-key和your-deepseek-api-key替换为你的真实密钥importopenaiimporttime# 配置两个客户端openai_clientopenai.OpenAI(api_keyyour-openai-api-key,# 替换为你的 OpenAI Key# 如果使用代理可以指定 base_url# base_urlhttps://api.openai.com/v1)deepseek_clientopenai.OpenAI(api_keyyour-deepseek-api-key,# 替换为你的 DeepSeek Keybase_urlhttps://api.deepseek.com)defask_model(client,model_name,prompt,max_tokens200):starttime.time()responseclient.chat.completions.create(modelmodel_name,messages[{role:user,content:prompt}],max_tokensmax_tokens,temperature0.7,)latencytime.time()-start contentresponse.choices[0].message.content token_usageresponse.usage.total_tokensreturncontent,latency,token_usage# 测试问题question请用简短的比喻解释什么是大语言模型的注意力机制。print( OpenAI GPT-4o-mini )try:ans,lat,tokensask_model(openai_client,gpt-4o-mini,question)print(ans)print(f延迟:{lat:.2f}s, 消耗 token:{tokens}\n)exceptExceptionase:print(f错误:{e}\n)print( DeepSeek V3 )try:ans,lat,tokensask_model(deepseek_client,deepseek-chat,question)print(ans)print(f延迟:{lat:.2f}s, 消耗 token:{tokens})exceptExceptionase:print(f错误:{e})运行后你可以直观比较两个模型的回答质量、响应速度和 token 消耗。根据任务敏感度、预算和延迟要求选择合适的模型接入你的 AI Agent。总结大语言模型从早期的词向量出发历经RNN/LSTM、Transformer演变为如今的多模态、强推理巨兽。国内外市场涌现出众多闭源与开源模型各有千秋。在开发 AI Agent 时没有“万能模型”需要根据任务类型、上下文长度、成本预算和隐私要求进行权衡。通过调用 API 或自托管结合灵活的代码封装你完全可以搭建出基于大模型的智能应用。随着 AGI 的探索不断深入大模型的能力边界还将持续扩展而智能体的未来正与此相伴而行。