AI 入门看了很多,为什么还是不懂?从 Prompt、AI 工具到大模型原理一次讲清楚
AI 入门看了很多为什么还是不懂从 Prompt、AI 工具到大模型原理一次讲清楚最近看了一些 AI 入门教程内容通常包括什么是人工智能Prompt 提示词怎么写常见 AI 工具有哪些ChatGPT 这类大模型如何工作每一个概念单独看好像都能理解。但把它们放在一起时还是容易产生一种感觉我知道这些名词但不知道它们之间到底是什么关系。例如AI、机器学习、大模型之间有什么区别Prompt 真的是几个“关键词”吗ChatGPT、Cursor、Midjourney、Agent、MCP 分别属于哪一层大模型到底是在思考还是在猜答案为什么同一句话问两次得到的结果可能不同为什么 AI 有时候回答得很自信内容却是错的这篇文章不准备堆积太多专业名词而是尝试从一个普通开发者的角度把 AI 的整体结构串起来。一、先建立一张 AI 的整体地图理解 AI可以先把它分成三个层次底层AI 模型 中间层AI 工具 上层AI 工作流这三层分别解决不同的问题。1. AI 模型提供基础能力AI 模型相当于一台“智能发动机”。它能够完成理解文字生成文字分析图片编写代码总结资料翻译内容推理问题常见的大语言模型包括 GPT、Claude、Gemini、Qwen、DeepSeek 等。模型本身通常只负责接收输入并生成输出。可以把它理解成一个函数输出结果 模型输入内容例如输入请解释什么是闭包 输出闭包是一个函数以及它所引用的外部变量环境的组合……但是单独拥有模型并不代表它就能自动读取你的项目、修改代码、搜索网络或者操作电脑。这些能力通常由上层工具提供。2. AI 工具给模型装上操作界面ChatGPT、Cursor、Copilot 等产品本质上不是一个单纯的模型。它们通常由几部分组成AI 工具 模型 用户界面 文件能力 搜索能力 工具调用能力例如在一个 AI 编程工具中模型可能获得以下能力读取项目目录搜索代码修改文件执行命令查看编译错误根据错误继续修改模型还是那个模型但工具让它可以参与真实工作。这就像发动机本身只能产生动力汽车还需要方向盘、轮胎、刹车、导航和车身结构。所以我们不能简单地说Cursor 就是一个大模型。更准确的说法是Cursor 是一个集成了大模型能力的编程工具。3. AI 工作流让多个步骤自动协作当 AI 不再只是回答一个问题而是连续完成多个步骤时就形成了 AI 工作流。例如我们让 AI 完成下面的任务读取需求文档 → 分析项目结构 → 编写代码 → 执行编译 → 分析错误 → 修改代码 → 生成测试报告这已经不是简单的“一问一答”而是一套任务流程。如果 AI 能够自己判断下一步做什么、选择工具并根据结果继续行动通常就会被称为 Agent也就是智能体。因此可以简单记住模型负责思考和生成 工具负责提供操作能力 工作流负责组织执行步骤 Agent 负责在工作流中自主决策二、AI、机器学习、深度学习和大模型有什么区别这些词经常一起出现但它们不是同一个概念。可以把它们理解成从大到小的包含关系人工智能 AI └── 机器学习 Machine Learning └── 深度学习 Deep Learning └── 大语言模型 Large Language Model1. 人工智能人工智能是一个很大的概念。只要机器表现出了某种类似人类智能的能力都可以被归入 AI例如语音识别人脸识别推荐系统自动驾驶下棋程序文本生成2. 机器学习传统程序一般由开发者直接编写规则如果温度大于 30 度就显示“天气炎热”而机器学习不是把所有规则都写死而是给机器大量数据让它从数据中学习规律。例如我们给系统很多垃圾邮件和正常邮件它会逐渐学习哪些词、结构和发送方式更像垃圾邮件。3. 深度学习深度学习是机器学习的一种方法核心是使用多层神经网络处理复杂数据。它特别适合处理图像语音自然语言视频多模态信息目前我们常见的大模型大多数都建立在深度学习基础之上。4. 大语言模型大语言模型主要学习人类语言中的规律。它不是把互联网内容原封不动地保存起来而是通过训练学习大量文字之间的关系例如哪些词经常一起出现一句话通常如何继续一个问题通常对应什么回答结构一段代码应该遵循什么语法一篇文章如何组织标题、段落和论点所以大语言模型可以生成看起来非常自然的文字。三、大模型到底是怎么“说话”的很多人第一次使用 ChatGPT 时会感觉它真的理解了自己。但从底层原理看大模型最核心的任务可以概括为一句话根据前面的内容预测下一个最可能出现的 Token。1. Token 不完全等于一个字模型不会直接按我们理解的“字”或者“单词”处理文本而是先把文本拆成 Token。Token 可以是一个汉字一个词的一部分一个英文单词一个标点符号一段常见字符例如我喜欢学习人工智能可能会被拆分成若干 Token然后转换成数字交给模型处理。2. 模型不断预测下一个 Token假设输入是中国的首都是模型会计算后面最可能出现的内容。“北京”的概率通常最高所以它会生成“北京”。生成一个 Token 后模型会把它加入上下文再继续预测后面的 Token。中国的首都是 → 北京 → → 它 → 位于……一段完整回答本质上就是这样一步一步生成出来的。3. 为什么它看起来像在思考因为模型学习过大量语言中的表达结构、知识关系和推理模式。当你问一个问题时它会根据这些模式生成一条看起来合理的回答路径。在复杂任务中模型确实可以进行多步骤推理但它的推理方式并不完全等同于人类意识。更稳妥的理解是大模型是一个非常强大的语言规律学习器和生成器它能够模拟理解、推理和表达但不能简单地把它等同于人脑。四、为什么 AI 会一本正经地回答错误内容这种现象通常被称为“幻觉”。模型的首要目标是生成语言上合理的后续内容而不是自动保证每句话都经过事实核验。例如你问请介绍一个并不存在的开源框架。如果问题的写法让模型误以为这个框架真实存在它可能根据常见技术文章结构生成项目背景核心功能安装方式使用示例这些内容读起来很完整但可能全部是编造的。这不是因为模型故意欺骗而是因为它在执行“生成最合理文本”的任务。因此在以下场景中不能只依赖模型记忆最新新闻法律政策医疗建议软件最新版本API 最新文档具体数据和引用项目中真实存在的文件和方法更可靠的方法是让 AI 结合外部资料模型能力 搜索结果 官方文档 项目文件这也是为什么现在很多 AI 产品会提供联网搜索、文件读取和知识库功能。五、Prompt 到底是什么Prompt 通常被翻译为“提示词”。很多教程会告诉你要使用角色、目标、背景、格式、限制条件等关键词。这些方法没有错但容易让初学者误以为Prompt 就是一套必须背下来的固定口诀。实际上Prompt 的本质是把你的任务、背景、约束和期望结果描述清楚。它更像给同事写任务说明而不是念一段咒语。1. 一个模糊的 Prompt帮我写一个登录页面。这个请求缺少很多信息使用什么技术页面运行在哪里是否需要接口是否需要表单校验输出完整项目还是单个文件页面是什么风格AI 只能自行猜测因此结果容易与预期不同。2. 一个更清晰的 Prompt使用 HTML、CSS 和原生 JavaScript 编写一个登录页面。 要求 1. 包含手机号和密码输入框 2. 点击登录前校验不能为空 3. 不调用真实接口使用 Promise 模拟请求 4. 登录成功后显示提示信息 5. 分别输出 index.html、style.css 和 main.js 6. 代码中添加必要注释。它并没有使用多么神秘的关键词只是把需求交代得更清楚。3. 一个实用的 Prompt 结构可以使用下面这个结构角色你希望 AI 以什么身份处理任务 背景当前项目和问题是什么 任务具体需要完成什么 约束不能做什么必须遵守什么 输出最终结果采用什么格式 验收怎样才算完成例如你是一名 HarmonyOS ArkTS 开发工程师。 背景项目通过 ArkWeb 加载 rawfile 中的本地 H5 页面当前需要验证 H5 调用 ArkTS 的最小通信链路。 任务实现一个 JavaScriptProxy 示例H5 点击按钮后向 ArkTS 发送 JSON 字符串ArkTS 解析后打印日志再通过 runJavaScript 回调 H5。 约束 - 不引入第三方库 - 不实现完整 Dispatcher - 只验证最小通信闭环 - 使用 ArkTS 可通过类型检查的写法。 输出 - Index.ets - index.html - myascf.js - 文件目录说明 - 关键调用链说明。 验收标准点击 H5 按钮后ArkTS 能收到请求H5 能收到响应。这类 Prompt 对编程任务会明显更有效。六、Prompt 不是越长越好Prompt 的目标不是“写得长”而是“减少歧义”。一段很长但没有关键信息的 Prompt依然可能得到很差的结果。真正重要的是任务是否明确背景是否足够约束是否具体输出是否可检查例如帮我优化代码要高级一点专业一点完整一点。这句话看起来有很多要求但“高级”“专业”“完整”都很模糊。可以改成重构下面的 ArkTS 代码要求 1. 消除重复逻辑 2. 补充明确的参数和返回值类型 3. 不使用 any 4. 保持现有功能不变 5. 列出每一项修改的原因。修改后的要求更容易执行也更容易验收。七、为什么同一个 Prompt 会得到不同答案大模型生成内容时通常不会永远只选择概率最高的那一个 Token。为了让回答更自然、更有创造性系统可能会从多个高概率候选中进行选择。因此同一个问题多问几次结果可能不同。影响结果的因素包括当前上下文模型版本系统提示词温度等生成参数是否开启搜索和工具输入内容的细微差异这也是为什么重要任务不能只依赖“一次生成”。更合理的使用方式是第一次让 AI 给出方案 第二次让 AI 自查问题 第三次结合真实环境验证 第四次根据报错继续修正AI 更适合参与迭代而不是被当作一次性答案机器。八、AI 工具全景到底应该怎么看市面上的 AI 工具很多但不需要逐个背名称可以按照任务类型分类。1. 对话与知识类主要用于问答总结翻译写作学习分析资料典型形态是 ChatGPT 这类聊天产品。2. 编程类主要用于代码补全项目问答修改文件排查错误生成测试执行命令典型形态包括 IDE 插件、AI 编辑器和命令行编程 Agent。3. 图像类主要用于文生图图片编辑海报设计产品效果图风格转换这类工具背后通常是图像生成模型或多模态模型。4. 音频和视频类主要用于语音识别文本转语音数字人视频生成自动剪辑字幕制作5. 办公与自动化类主要用于邮件总结会议纪要表格分析PPT 生成文档整理跨系统自动执行任务与其记住几百个工具不如先问自己我当前想解决的是写作、编程、搜索、图片、视频还是自动化问题确认任务类型后再选择工具会简单很多。九、Chat、Agent、Skill、MCP 和 API 分别是什么这些词是 AI 应用中最容易混淆的部分。1. Chat对话入口Chat 是人与模型交互的一种形式。你输入问题模型返回答案适合处理即时任务。用户 → 对话界面 → 模型 → 回答2. Agent能连续执行任务的智能体普通聊天通常是“一问一答”。Agent 更强调理解目标拆分步骤选择工具执行操作检查结果根据结果继续行动例如让一个编程 Agent 修复项目时它可能会读取报错 → 搜索相关文件 → 定位代码 → 修改代码 → 重新编译 → 根据新错误继续调整3. Skill可复用的任务规范Skill 可以理解为写给 AI 的“标准作业说明书”。例如一个文档格式化 Skill可以规定标题层级怎么使用中英文之间是否留空格表格采用什么格式代码块如何标注语言哪些内容不能改动输出前需要检查什么普通 Prompt 通常只服务于当前一次任务而 Skill 更强调长期复用和统一标准。可以简单理解为Prompt这一次怎么做 Skill以后遇到这类任务统一怎么做4. MCP连接外部工具的通用协议模型本身不能直接访问所有软件和数据。如果要让 AI 读取数据库、操作 GitHub、访问内部文档或调用其他系统就需要把这些能力提供给模型。MCP 可以理解为一种标准连接方式。它试图解决的问题是不同 AI 应用如何用统一方式连接不同工具和数据源可以类比为 USB 接口。以前每种设备都使用不同接口连接成本很高有了统一接口后不同设备可以按同一种规范接入。MCP 不负责让模型变聪明它负责让模型能够连接外部世界。5. API程序之间的调用接口API 是软件系统之间进行通信的接口。例如你的程序可以通过大模型 API 发送一段文字并获得模型返回结果。你的应用 → 大模型 API → 模型 → 返回结果如果你准备把 AI 能力集成到自己的产品中通常就需要使用 API。十、AI 为什么需要上下文大模型每次回答时都会根据当前能够看到的上下文生成结果。上下文可能包括你刚刚发送的问题前面的聊天记录系统给模型的规则上传的文档搜索到的网页工具执行结果项目中的代码上下文越准确回答通常越贴近真实需求。但上下文不是无限的。模型有一个“上下文窗口”表示一次最多可以处理多少 Token。当内容太多时可能发生早期信息被忽略重点不突出回答偏离任务项目细节混淆因此给 AI 提供资料时不是越多越好而是要尽量保证内容相关信息准确重点明确文件结构清晰十一、AI 是怎么训练出来的从宏观角度看大语言模型的形成通常会经历几个阶段。1. 预训练模型阅读大量文本通过“预测下一个 Token”学习语言规律。例如输入今天天气很好我们一起去模型需要预测后面可能是“公园”“散步”“爬山”等内容。经过大量训练后模型逐渐学会语言结构常见知识表达方式代码模式一定程度的推理规律2. 指令微调只有预训练的模型更像一个自动续写器。为了让它学会回答问题、执行要求需要使用大量“指令—回答”数据继续训练。例如指令把下面内容翻译成英文 回答……经过这个阶段模型更懂得如何服从用户指令。3. 对齐训练模型还需要进一步学习什么回答更有帮助什么内容不应该生成如何减少冒犯和危险内容如何按照人类偏好组织答案这个过程通常会结合人工反馈或自动评估。4. 推理和工具能力增强现代模型还会针对数学、代码、复杂推理和工具使用进行专门训练。所以现在的模型不仅会写文章还能分析程序错误调用搜索工具阅读文件执行代码操作外部系统十二、普通开发者应该如何真正学会使用 AI只看概念很容易产生“好像懂了”的感觉。真正理解 AI最好从实际任务开始。第一阶段学会描述任务先不要追求复杂 Prompt 模板。每次提问时至少说清楚我要做什么 当前是什么情况 有哪些限制 最终要什么结果第二阶段学会让 AI 分步骤工作不要一次让 AI 完成一个特别大的项目。例如不要直接说帮我写一个完整的小程序运行时框架。可以拆成第一步设计目录结构 第二步实现 Web 容器 第三步验证 H5 到 ArkTS 通信 第四步增加请求 ID 和 Promise 回调 第五步抽离 Runtime 第六步增加 API 注册机制拆分后更容易理解也更容易验证。第三阶段学会验证结果AI 生成代码后要检查是否可以编译API 是否真实存在类型是否正确是否符合当前版本是否遗漏异常处理是否改变了原有功能AI 可以帮助写代码但真实编译器和运行环境才是最终标准。第四阶段形成自己的 Skill当你反复做同一类任务时可以把要求沉淀成 Skill。例如文档格式化 SkillArkTS 代码检查 SkillAPI 测试用例生成 Skill博客写作 SkillGit 提交信息生成 Skill这样就不需要每次从头解释规则。第五阶段尝试自动化工作流当单个任务使用稳定后再考虑把多个步骤连接起来。例如读取需求 → 生成代码 → 编译验证 → 修复错误 → 生成测试记录 → 更新文档这时你就开始从“使用聊天机器人”进入“设计 AI 工作流”的阶段。十三、一个开发者实际使用 AI 的例子假设我们要测试一个 HarmonyOS Web 容器中的通信接口。传统做法可能是阅读接口文档手动创建测试页面编写调用代码运行项目收集错误日志修改测试代码整理测试记录。使用 AI 后可以把部分工作交给模型输入接口文档和项目结构 → AI 生成最小测试页面 → AI 根据日志分析可能原因 → AI 修改调用参数 → AI 生成测试记录表但是这里有一个非常重要的边界AI 可以提高分析和编写效率但不能代替真实环境验证。因为模型不知道你的远程机是否连接成功当前安装的是哪个框架版本某个接口在真实运行时是否暴露权限配置是否正确编译器实际返回了什么错误所以比较合理的协作方式是人负责目标、判断和验证 AI 负责整理、生成和辅助分析 工具负责执行和提供真实结果十四、使用 AI 时最常见的几个误区误区一把 AI 当搜索引擎搜索引擎通常返回已有网页大模型则会重新组织和生成内容。如果需要最新、准确、可引用的信息应该让 AI 搜索并查看来源而不是只依赖模型记忆。误区二认为 Prompt 有万能公式不存在一个 Prompt 模板可以解决所有问题。不同任务需要不同信息。写文章关注受众和结构写代码关注技术栈和验收标准排查错误关注日志和环境。误区三认为 AI 输出就等于正确答案AI 输出首先是一个候选方案。代码需要编译数据需要核对文档需要确认结论需要验证。误区四一次让 AI 做完整项目任务越大模型越容易遗漏细节。拆分任务、逐步验证通常比一次生成全部内容更可靠。误区五只学工具不理解任务工具更新非常快。今天流行某个编辑器明天可能出现新的产品。真正长期有效的能力是准确描述问题拆分复杂任务提供有效上下文验证输出结果设计可复用流程十五、最后总结理解 AI只需要先抓住五件事第一大模型是能力核心它通过学习大量数据中的规律根据上下文生成结果。第二Prompt 是任务说明书重点不是堆关键词而是减少歧义让目标、背景、约束和结果足够清楚。第三AI 工具是模型的外壳工具给模型提供文件、搜索、代码执行和系统操作能力。第四Agent 是能够连续行动的 AI它可以拆解任务、选择工具、执行操作并根据结果继续处理。第五AI 输出必须经过验证模型擅长生成合理答案但“合理”不一定等于“真实”和“正确”。可以用一句话概括整个 AI 应用体系模型负责生成Prompt 负责表达工具负责执行工作流负责组织人负责判断。当我们理解了这几个层次就不会再被各种新名词绕晕。以后再看到 Agent、Skill、MCP、RAG 或 AI 工作流时可以先问它是在增强模型能力提供外部工具补充上下文还是组织任务流程只要能回答这个问题大部分 AI 概念就能找到自己的位置。结语AI 入门真正困难的地方不是某个概念特别复杂而是各种概念经常混在一起出现。初学者不需要一开始就研究复杂数学公式也不需要记住所有工具。先从自己的真实工作开始用 AI 解释一段代码用 AI 整理一次报错用 AI 拆分一个需求用 AI 生成一个最小 Demo再通过编译和运行验证结果。当你完成几次真实闭环后会发现自己不只是“会问 AI”而是在逐渐学会如何把 AI 变成工作流程中的一个可靠协作者。