全面解析与选型实战)
Generative AI 初学者课程第 16 课开源模型Open Source Models全面解析与选型实战【免费下载链接】generative-ai-for-beginners21 Lessons, Get Started Building with Generative AI项目地址: https://gitcode.com/GitHub_Trending/ge/generative-ai-for-beginners本课是 generative-ai-for-beginners 课程体系中的第 16 课。课程共 21 课从生成式 AI 基础、提示工程、文本/图像应用构建一路深入到函数调用、RAG、AI Agent 与微调。本文聚焦开源模型这一主题带你厘清开源模型与开放模型的概念边界、理解选用开放模型的核心收益逐一剖析 Llama 2、Mistral、Falcon 三大代表家族的架构特点与微调生态并给出可落地的选型方法论。读完本文你将具备为具体业务场景挑选、评估并快速上手开放模型的能力并能借助仓库中 Mistral 与 Meta 两课的实战 Notebook 直接开跑。什么是开源模型Open Source Models开源软件在各技术领域的发展中扮演了关键角色。Open Source InitiativeOSI为软件能否被归类为开源定义了 10 条标准其核心要求是源代码必须在 OSI 批准的许可证下公开共享。然而LLM 的开发过程与软件开发虽有相似之处却并不完全相同。因此社区围绕在 LLM 语境下如何定义开源展开了大量讨论。要让一个模型符合传统意义上的开源定义以下信息应当公开可用用于训练模型的数据集训练过程中产生的完整模型权重评估代码微调代码完整的模型权重与训练指标。目前真正满足上述全部标准的模型寥寥无几。Allen Institute for Artificial IntelligenceAllenAI 推出的OLMo模型是符合这一类别的少数代表之一——它同时公开了训练数据、权重与完整训练管线。需要特别指出的是本课将统一使用开放模型open models这一说法因为截至写作时市面上绝大多数号称开源的大模型其实并未完整满足上述标准例如训练数据通常不公开它们更多是开放权重open-weight模型。这一术语上的严谨区分对后续做技术选型和合规评估都至关重要。延伸阅读关于开放权重/开源模型与专有模型proprietary models的对比、以及它们在生产环境中的适用性讨论可参见本课程 第 2 课探索与对比不同的 LLM。第 2 课明确指出开源与开放权重模型允许检视、下载与定制模型产物但许可证各不相同——有的是完全开源有的则是带使用限制的开放权重模型团队在生产环境使用前仍需审查许可证条款、服务成本、维护、安全更新与评估质量。开放模型的核心优势选择开放模型并非跟风而是有切实的技术与商业考量。本课从三个维度阐述了开放模型的价值高度可定制Highly Customizable—— 开放模型发布时附带详细的训练信息研究人员和开发者可以修改模型内部结构。这使得创建高度专业化的模型成为可能——针对特定任务或研究领域进行微调。典型例子包括代码生成、数学运算和生物学等垂直领域。成本Cost—— 使用和部署开放模型的每 token 成本低于专有模型。在构建生成式 AI 应用时必须针对自己的用例评估性能 vs 价格的比值开放模型在这一维度上往往更具竞争力。灵活性Flexibility—— 使用开放模型可以灵活地选用不同模型或将其组合使用。一个典型例子是 HuggingChat Assistants用户可以直接在界面中选择当前使用的模型随时切换对比这为产品原型验证提供了极大的便利。探索主流开放模型Llama 2面向聊天场景优化的开放模型由 Meta 开发的 Llama 2 是专为聊天类应用优化的开放模型。其秘诀在于微调方法训练过程中包含了大量对话数据与人类反馈。通过这种方式模型产出的结果更符合人类预期从而提供更好的用户体验。Llama 家族有着丰富的微调版本生态例如Japanese Llama专精于日语场景的微调版本Llama Pro在基础模型之上增强的改进版本。仓库佐证本仓库 第 21 课Meta 模型 对 Llama 家族的后续演进做了更深入剖析。Llama 3.1 以405B 参数规模跻身开放 LLM 之列相比 Llama 3 带来了上下文窗口从 8k tokens 提升至128k tokens、最大输出 tokens 从 2048 提升至 4096、以及因训练 token 数增加而更强的多语言支持。这些能力使其胜任原生函数调用Native Function Calling、更优的 RAG 性能和合成数据生成等复杂用例。Llama 3.2 则补齐了多模态能力11B/90B Vision 变体可同时评估文本与图像输入并提供了面向边缘/移动设备部署的 1B/3B 纯文本变体。Mistral高性能与高效率的混合专家模型Mistral 是高度聚焦性能与效率的开放模型。它采用Mixture-of-ExpertsMoE混合专家方法将一组专精的专家模型组合进一个统一系统根据输入内容选择性地激活某些专家模型。由于每个模型只处理自己擅长的输入计算效率显著提升。Mistral 的微调版本同样覆盖多个垂直领域BioMistral聚焦医学领域OpenMath Mistral专注于数学计算。仓库佐证第 20 课Mistral 模型 展示了 Mistral 家族的完整产品矩阵旗舰级Mistral Large 2128k 上下文窗口、数学与编程任务平均准确率大幅提升、支持 13 种语言擅长 RAG、原生函数调用与代码生成、成本效益型Mistral Small相比 Large/NeMo 价格降低约 80%低延迟适合摘要、情感分析、翻译等高频文本任务以及唯一的Apache 2.0 许可证免费模型 Mistral NeMo采用更高效的 Tekken tokenizer 而非常见的 tiktoken支持微调且是首批原生支持函数调用的开源模型之一。该课还演示了用 Mistral Large 2 运行 RAG 模式的完整代码以及 NeMo 与 Large 在 tokenizer 上的 token 数对比实验。Falcon低计算预算下的高性能选择Falcon 是由 Technology Innovation InstituteTII打造的 LLM。其中Falcon-40B在 400 亿参数规模上训练已证明可以用更少的计算预算获得优于 GPT-3 的表现。这得益于其使用的FlashAttention 算法与multiquery attention多查询注意力机制——后者能显著削减推理阶段的内存需求。更短的推理时间使 Falcon-40B 非常适合聊天类应用。Falcon 的微调版本包括OpenAssistant构建在开放模型之上的助手GPT4ALL提供优于基础模型的性能表现。如何选择开放模型一套可操作的评估路径面对琳琅满目的开放模型本课给出了清晰的选择思路——不存在唯一正确答案但存在行之有效的起点使用 Microsoft Foundry 模型目录的按任务筛选功能。这能帮你快速理解某模型是针对哪些任务类型训练的是缩小候选范围的第一道过滤器。参考 Hugging Face 维护的 LLM Leaderboard。它根据特定指标展示表现最佳的模型可用于横向对比。借助 Artificial Analysis 对比不同类别的 LLM。当需要在不同类型模型之间做细致比较时这是一个优秀的第三方参考资源。针对具体用例寻找微调版本。如果你在某个特定领域如医疗、数学、多语言工作搜索聚焦同一领域的微调版本往往更有效。多模型实验。用多个开放模型在你的真实数据上跑一遍观察它们是否符合你与用户双方的预期——这本身就是最佳实践。延伸阅读Microsoft Foundry原 Azure AI Studio模型目录除了筛选外还支持查看模型卡含预期用途、训练数据、代码示例与评估结果、跨模型基准对比Model Benchmarks、对受支持模型进行微调、以及通过托管计算或无服务器方式部署实时推理端点——详见 第 2 课 的如何在 Azure 上测试与迭代不同模型一节。补充开放模型与微调、RAG 的关系开放模型的开放特性使其与微调fine-tuning、RAG 等技术栈的亲和度极高这也是选择开放模型时值得权衡的要点微调Fine-Tuning开放模型附带详细训练信息甚至提供可微调的基座版本如 Mistral NeMo这让团队可以针对特定领域重新训练模型权重获得更精确、更符合业务需求的模型同时可能降低提示词的 token 消耗。微调属于高级技术需要专业经验如果数据质量不足或执行不当可能不仅没有提升、反而会损害模型在目标域的表现——详细决策框架用例、替代方案、成本、收益四问可参见 第 18 课微调你的 LLM。RAG大上下文窗口如 Llama 3.1 与 Mistral Large 2 的 128k使开放模型在检索增强生成场景中表现突出可以用检索到的领域数据补充模型训练数据之外的知识。实践中开放模型、微调与 RAG 三者常常组合使用形成完整的落地技术栈。动手实践从仓库代码开始快速上手开放模型最大的魅力在于上手极快。你可以直接在本仓库中找到完整的可运行示例第 20 课 Mistral 实战 Notebook演示了基于 Azure AI Foundry 推理 APIazure-ai-inferenceSDK 的ChatCompletionsClient/EmbeddingsClient调用 Mistral 模型的全过程包括用 Cohere 多语言 Embedding 模型 FAISS 向量库实现端到端 RAG 问答问题为韩语、答案以自然语言返回、用同一提示词对比 Mistral Small 与 Large 的延迟差异、以及用mistral-common库对比 NeMoTekken tokenizer示例中 128 tokens与 Largetiktoken135 tokens在相同含工具调用消息上的 token 化差异。第 21 课 Meta 实战 Notebook演示 Llama 3.1 405B 的原生函数调用通过系统提示词声明brave_search、wolfram_alpha两个内置工具模型会返回形如|python_tag|brave_search.call(queryStockholm weather)的工具调用指令以及 Llama 3.2 90B Vision 的多模态图像理解同时传入文本问题与本地图片输出对图像的详细描述。两个 Notebook 的环境准备一致安装azure-core与azure-ai-inference从 Microsoft Foundry 项目的 Overview 页面获取AZURE_INFERENCE_ENDPOINT与AZURE_INFERENCE_CREDENTIAL环境变量即可运行。下一步开放模型让你能以极低门槛开始构建生成式 AI 应用。接下来可以前往Microsoft Foundry 模型目录ai.azure.com其收录了一个专门的 Hugging Face 模型集合包含本课讨论过的 Llama、Mistral、Falcon 等模型直接在目录中筛选、试用并部署开启你的开放模型之旅。【免费下载链接】generative-ai-for-beginners21 Lessons, Get Started Building with Generative AI项目地址: https://gitcode.com/GitHub_Trending/ge/generative-ai-for-beginners创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考