ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

从DeepSeek、Kimi到“黄仁勋联盟”:AI模型开源,到底“开”了什么?

从DeepSeek、Kimi到“黄仁勋联盟”:AI模型开源,到底“开”了什么? “开放权重”正在改变的AI游戏规则8月13日凌晨DeepSeekV4 Pro正式登场给开源模型生态又添一把猛火。从KimiK3到MiniMaxH3再到DeepSeekV4 flash、DeepSeekV4 Pro在中国开源模型的猛攻之下美国的AI公司这次是真的坐不住了。黄仁勋亲自下场发表了人生第一条推文呼吁全行业共同推动美国开源生态的发展。目前这个联盟除了Anthropic之外美国AI圈的主要玩家几乎全员到齐Sam Altman、Sundar Pichai等闭源模型掌门人也都罕见发文表示支持。为什么这些平时斗得最厉害的公司这次却罕见地站到了同一战线而Anthropic坚持不加入的原因又是什么要回答这个问题我们得先搞明白一个更基础的事情那就是今天AI行业所说的“开源模型”到底是什么以及模型开源之后对于模型厂商以及整个行业又意味着什么01开源模型到底开了什么很多人会觉得一个 AI 模型就是一套代码所谓“开源”就是把代码发布出去但其实并不是。要理解模型到底开放了什么我们首先需要捋一遍一个大模型从训练到最终发布的完整流程。这个过程大致可以拆成七个部分。第一训练数据。研发团队首先要决定使用什么数据训练模型比如网页、书籍、代码以及不同类型数据如何配比再经过清洗和筛选。这一步决定了模型的“底子”好不好。第二模型架构和参数规模。这个阶段主要进行模型规划和设计包括采用什么模型架构、参数规模有多大以及各种训练配置。这些设计决定了模型的能力上限和训练效率。需要注意的是参数规模并不是指训练数据的大小。训练一个模型本质上是在不断地做“调整”而参数规模说的是“这次总共要调整多少个地方”。参数规模越大模型能捕捉和处理的细节、规律也越复杂。第三训练基础设施。模型设计完成后需要庞大的算力来完成训练包括GPU集群、高速网络、存储系统以及各种训练框架。而如何把这些算力高效组织起来正是如今最火的AI Infra人工智能基础设施领域。像DeepSeek的DeepGEMM、KimiK3的FlashKDA、MoonEP都属于这一层的创新。数据、架构和基础设施准备完成后才进入真正的训练阶段。第四训练流程和Checkpoint。在这个阶段模型会进行预训练、微调和强化学习在训练过程中也会不断存档方便继续训练、测试或回滚。第五“模型权重”。经过漫长的训练之后模型内部数十亿甚至数万亿个参数都会被逐步调整到合适的数值。这些参数最终形成的集合就是“模型权重”也是整个模型最核心的成果记录着模型在训练过程中学到的知识和能力。第六模型部署。训练完成后还需要将权重部署到服务器通过API或者本地部署的方式真正提供给开发者和企业使用。最后“技术报告”。这些流程结束之后模型厂商们通常还会写一个“技术报告”。里面会介绍模型架构设计的思路、数据大致的构成、训练中踩过的坑和最终的评测结果等内容让外界理解这个模型是怎么做出来的。但技术报告不是可以照着复现的操作步骤它讲的更多是一种方法论。清楚了训练流程之后那么“开源”具体是指开放的什么环节呢按照模型的开放程度现在主要分为闭源、开放权重和完全开源这三大类型我们先说两端。闭源模型很好理解就是以上环节全部都不对外开放客户只能在模型部署层面通过API或具体产品使用模型能力。Anthropic、OpenAI和谷歌目前的大部分模型都是这种形式。完全开源的模型叫Open Source是指从训练数据、训练代码到中间存档、技术报告都完全公开。Ai2 艾伦人工智能研究所推出的OLMo系列就是这样的代表。但现在说的大部分的开源模型其实都不是真正的Open Source而是位于开源和闭源中间地带的Open Weight开放权重。相当于只是送出了模型训练的最后结果大家可以直接拿去用也可以在结果之上进行微调和改进。但现在不同的开放权重模型之间开放的程度也存在很大差异我们用几个比较具有代表性的模型来具体说明一下。首先“模型权重”严格来说只是一个巨大的数字文件光靠它并不能直接运行。如果从Hugging Face上直接下载KimiK3的权重得到的是约2.8万亿个浮点数按照模型架构规定的顺序整齐排列在其中。所以除了权重本身厂商通常还会公开一份推理代码专门负责教用户如何读取权重文件、按照什么顺序进行计算以及最后怎么把结果变成一句话回复用户。最基础的“开放权重”就是把模型权重以及这个能跑、能微调的推理代码公布出来让任何人都可以把模型下载到自己的服务器上运行。其中最具代表性的就是Meta的Llama系列。但训练数据的具体配方、训练过程中不断调整的策略以及支撑整个模型训练的内部工具链这些更核心的部分Meta始终没有开放。此前从Llama 1到Llama 3Meta还会发布较为详细的技术报告分享模型设计和工程经验。但到了去年的Llama 4Meta只发布了一篇简短的博客没有再公开完整的技术报告开放的程度也变得更加保守。而DeepSeek之所以震撼整个行业其中一个重要原因就在于它不只是把方法详细地讲了出来甚至还把内部的工程工具链本身开源了可以说是“Open Weights”的Plus版本。在此之前大部分模型厂商的技术报告更像是公关稿通常会告诉大家模型有多少参数、在哪些Benchmark基准测试上取得了什么成绩却很少解释这些成绩是怎么做出来的。但DeepSeekV3和DeepSeek-R1却把过去一些很少公开的研发细节几乎毫无保留地写了出来。比如它详细介绍了MoE混合专家模型是如何设计的、为什么要采用Multi-head Latent AttentionMLA来降低KV Cache的内存占用、FP8训练是如何稳定实现的以及不同方案之间为什么最终选择了现在的设计、放弃了其他路线。除了技术报告DeepSeek还陆续开源了DeepEP、FlashMLA等训练和推理基础设施组件把很多过去只属于内部工程团队的工程经验也变成了整个行业都可以使用的工具。可以说DeepSeek开启了一种新的模型开放形式而此次KimiK3也延续了这种做法。除了公布非常详细的技术报告介绍模型架构、训练方法和大量工程细节KimiK3此次还同步开放了三大自研底层基础设施。其中包括解决MoE混合专家模型里几百个“专家”之间通信效率的MoonEP加快注意力计算的FlashKDA以及给智能体训练搭建可运行的环境的AgentEnv。这三项分别对应训练大模型时会遇到的三个卡点通信、计算、训练环境也让大家能更了解Kimi团队是怎么高效训练出这个模型的。不过在目前整个训练环节中大多数开放权重模型真正公开的其实只有模型权重、推理代码以及一部分技术报告和基础设施工具。而训练数据和完整训练流程仍然是各家最核心的商业机密。而且开放权重也并不意味着毫无限制。真正决定开发者能不能将模型商用、修改以及再发布的是模型附带的许可证License。02开放权重模型怎么赚钱过去一年一个很明显的趋势是中国大部分模型厂商的许可证正在变得越来越开放。比如DeepSeek最早发布模型时采用的是自己制定的协议对使用场景还有一些限制。但到了DeepSeek-V3和R1已经全面切换到了MIT License。这意味着只要保留版权声明开发者几乎可以自由下载、修改、商用限制非常少。阿里的Qwen也走了一条类似的路线。从最初采用阿里自定义协议到后来切换为国际上广泛使用的Apache 2.0许可证同样大幅降低了商业使用门槛。值得注意的是此前Qwen的旗舰Max系列一直是保持闭源、只能走API但在这个月初阿里表态将首次把旗舰模型Qwen3.8-Max的权重开源。智谱GLM也是一样他们从2025年的GLM-4-0414开始使用MIT License后来一直沿用至今商业使用限制很宽松。当然也并不是所有公司都会选择“完全放开”。Kimi之前的K2系列用的是一种叫Modified MIT的许可证。但这次K3启用了一份全新的叫做KimiK3 License的协议不再自称是MIT的修改版。对绝大多数开发者和中小企业来说其实实际使用体验和MIT差别不大因为都是免费下载、商用和修改。但它加了两道门槛一是产品月活超过1亿或者月收入超过2000万美元的需要在界面上显著展示“KimiK3”标识第二如果做的是模型即服务的托管生意且连续12个月总收入超过2000万美元就必须先和月之暗面另行签署商业协议才能商用。而限制最多的则是Meta的Llama。它没有采用MIT、Apache这些主流开源许可证而是自己制定了一个Llama Community License中间的限制非常多例如月活用户超过7亿的产品需要额外申请授权部分版本曾限制在欧盟地区使用同时协议还明确禁止开发者利用Llama的输出去训练其他大型模型等等。不过Meta近期也在重回开放路线它们最新发布了300亿参数的开放权重模型Muse Glimmer就采用了Apache 2.0许可证。此外扎克伯格还宣布Meta目前最强基础模型Muse Spark 1.2也即将开放权重。王铁震前Hugging Face亚太生态负责人把这些东西写清楚之后很多专门做模型推理和云服务的厂商实际上就没有办法take free ride不劳而获。过去一些开源项目包括开源数据库最担心的就是云厂商没有出工、没有出力却可以直接把开源项目部署到自己的云上赚钱。所以这种不劳而获一直是开源社区想要避免的。当然许可证只是划定了红线并不能把模型变成收入。那么这些开源模型的公司靠什么赚钱呢实际上开放权重并不等于放弃商业化。企业下载模型只是第一步要真正把模型稳定部署到生产环境还需要算力、运维、持续更新以及针对业务场景的定制开发等等。相比自己组建团队很多企业依然会选择直接购买模型公司的API服务、企业版部署或行业解决方案。因此开放模型可以带动一整套围绕模型的服务收入。第一种是通过开放模型带动云计算和基础设施消费。以千问为例模型权重虽然可以免费下载但企业想要大规模部署依然需要GPU、云存储、网络、数据库和模型管理平台。对于阿里这样的云厂商来说开放模型更像是一个入口模型本身可以免费但运行模型所需要的整套云服务都是收费的。第二种是为企业提供部署和定制服务。很多金融、医疗、政府或大型企业不希望把内部数据发送给外部API而是希望把模型部署在自己的服务器或私有云里。但下载权重之后企业还需要完成模型适配、数据清洗、安全评测、推理优化和后续维护。模型公司可以向这些客户出售私有化部署、行业微调、技术支持和长期维护服务。第三种则是提供收费的后训练和模型开发平台。现在的企业更希望在现有开放模型的基础上加入自己的数据和业务规则把它变成更适合特定任务的专用模型。模型公司可以提供微调、强化学习、评测、数据管理和版本管理等工具并按照训练算力、使用量或企业订阅收费。像Thinking Machines的思路就更接近这种。Keith ZhaiTinyFish联合创始人关于 AI一个核心问题是intelligence智能到底应该是我租借来的还是应该真正变成自己的。而整个的大背景是越来越多企业正在接受这样一种观点智能应该为我所有而不应该是租借。以Kimi为例虽然模型权重已经开放但它们依然提供付费订阅、API调用以及企业级AI服务。除此之外开源模型厂商的另一部分收入来源是提供模型服务的MaaSModel as a Service厂商和云厂商。MaaS厂包括最近很火的Together AI、Fireworks AI等等是把开放权重模型部署到自己的GPU集群上再通过API提供给开发者使用。云厂商也就是大家熟悉的卖基础设施的AWS、阿里云等等现在也会卖模型服务。在K3这样的许可证下这类厂商也要向Kimi交钱。公开信息显示Moonshot AI当前的年化经常性收入ARR已经达到约3亿美元。王铁震前Hugging Face亚太生态负责人一个反常识的观点是云厂商和MaaS厂实际上应该非常欢迎Kimi来找他们收钱。因为只要Kimi收钱就意味着你和Kimi存在官方认证关系包括你卖的token质量等等都是有官方给你做保证和背书的。Kimi官方还发布了一套vendor verification供应商验证流程有点像“Intel Inside英特尔商标”。只有通过验证的流程卖出来的token才能被证明是好的包括准确性和性能都是有保障的。对消费者来说也更容易知道应该购买谁的token。所以开放权重并不意味着商业价值的消失更多的是一种商业模式的变化。而对于整个AI生态来说它也有着非常重要的价值。03开放权重意味着什么过去几年Claude、ChatGPT、Gemini这些业界最强的模型几乎都是闭源的但这些模型能力始终牢牢掌握在少数几家公司手里。而开放权重则让拥有前沿能力的AI模型可以像软件一样被下载、部署、微调并在此基础上继续创新。对于企业用户来说这绝对是件天大的好事。首先是成本。还记得今年年初编程Agent开始流行每家企业都开始token maxxing的几个月吗这一通操作下来每家公司都发现自己的token账单水涨船高。在这样的背景下开源模型显然成了最优解。毕竟中国开源模型能力已经能追平最强闭源模型又很便宜还能自己调整谁不爱呢而现在一种主流的企业做法就是最困难的任务还是使用几家能力最强的闭源模型日常的任务就都通过中国的这些开放权重模型来实现。其次是所有权问题。Keith ZhaiTinyFish联合创始人如果模型的一切都取决于对方是否开放就像Fable今年早一点的事情对大家影响很大的。突然有一天美国商务部说不可以用了那就一夜之间就都不可以用了之前做的部署可能都没有了那这种情况怎么办这就是为什么对于企业来说在能力几乎相当的情况下开放模型有绝对的优势了。而对于普通开发者来说开放权重也大大降低了参与模型创新的门槛。以前开发者想要基于GPT或者Claude开发产品能做的事情其实很有限。但借助权重和技术报告开发者就能够自己去尝试修改模型、继续训练模型甚至让模型适配完全不同的场景。而且现在vLLM和SGLang等开源推理引擎都能够对大部分开源模型做到Day-0支持这也意味着开发者们不需要自己解决复杂的推理部署问题就能直接部署模型。如今开放权重模型已经成为大量AI Agent、机器人等项目的重要基础推动着整个AI创业生态的繁荣。此外开放权重本身也在加速着模型的迭代。比如在KimiK3的技术报告里有一部分专门介绍了他们如何优化MoE混合专家模型中的负载均衡而这套方法就是他们在DeepSeekV3方案基础上的继续演进。闭源模型的技术突破很可能永远留在自己的服务器里。但借助于开放的技术经验整个行业就能够站在巨人的肩膀上加速往前走。所以无论是从商业、还是整个AI生态的角度开放权重都正在成为非常重要的一条技术路线。这也是为什么此次黄仁勋会牵头来做这件事并且一呼百应。最近针对中国开源模型的强势崛起有消息传出美国政府正在考虑采取相关限制行动。“开放安全AI联盟”的核心观点是美国既需要最先进的闭源模型也需要最先进的开放模型。他们认为开源模型对网络安全和AI创新、AI主权都至关重要。监管应该针对具体风险而不是因为安全担忧就限制开放权重这种技术路线本身。但这个联盟背后也有着更深的商业考量。比如对于微软、亚马逊、谷歌这几个大型云厂商来说不管客户最终部署的是OpenAI、Llama、DeepSeek还是Kimi只要运行在云上它都能够从中获益。对于英伟达、AMD、Baseten这样的基础设施企业来说开放权重意味着会有更多企业、开发者和国家把模型部署到自己的服务器。而每一次部署、微调和推理都会带来新的算力需求。不少基础设施公司的业务增长甚至就是伴随着一代代开源模型而发展壮大。Keith ZhaiTinyFish联合创始人英伟达从芯片、基础设施的角度看它肯定是所有人每个人都能自由搭建一个模型最好。因为它并不在乎这个谁能挖到金子重要的就是它能卖更多的铲子。而对于像Palantir、Databricks这样的企业软件和AI应用公司来说它们卖的本来就是模型之上的数据平台、AI应用和行业解决方案。模型越开放它们能够服务的客户和场景反而越多。目前这个联盟名单几乎聚齐了美国所有主要AI公司的名字但唯独少了Anthropic它们为此也专门发了一篇长文来阐明立场。Anthropic首先表态它们从来没有主张过禁止开放权重模型但它们担心两件事一是前沿开放模型带来的安全风险。在闭源的情况下一些危险的AI能力还被掌握在少数模型公司手里但如果最强大的模型权重被公开任何人都可以下载、部署、修改那么恶意使用这些能力的门槛也会随之降低这将让整个世界都处于危险之中。第二是蒸馏问题。它认为中国的开源模型之所以发展的这么快就是大规模地蒸馏了美国最前沿的这些闭源模型进而也会大幅降低追赶最前沿模型所需要的算力。与其纠结要不要管开源美国政府更应该先管管“蒸馏”。但很多人认为Anthropic之所以坚持不开源更多的也是出于商业利益的考虑。对于闭源模型公司来说开放权重无疑是会严重冲击它们的商业模式。因为一旦越来越多高性能的开放模型出现企业就有了更多本地部署和自主定制的选择对闭源API的依赖也会降低。而模型能力本身也更容易被快速追赶和复制让闭源模型赖以建立的竞争壁垒受到挑战。而最近在美国全行业越来越强的开源声势下Anthropic坚持闭源的立场现在正在遭受着越来越大的压力对它AI安全立场的质疑声也逐渐变大。但是我们也看到并不是所有人都反对Anthropic的这些观点。比如本次KimiK3开源之后网上就出现了不少声音认为把这样已经达到最前沿能力的模型开放出来本身就是一种风险。最近OpenAI和Anthropic的模型接连曝出越狱攻击事件让这种担忧进一步升温。因为即便是部署在官方服务器、拥有持续监控和安全更新能力的闭源模型目前看来也并非绝对安全。而如果未来越来越多能力接近Fable 5这一水平的开放权重模型被部署到成千上万家企业、本地服务器甚至个人设备上情况就会变得更加复杂模型治理、安全更新和风险控制必然将面临更大的挑战。目前业界关于开源模型的讨论还在激烈的进行着但无论如何开放权重已经成为推动这一轮AI发展的重要力量。它降低了技术门槛加快了创新速度也让越来越多企业和开发者有机会参与到AI生态中。但与此同时它确实可能也会带来新的问题和风险。接下来我们也会持续追踪中美开源模型的发展以及它对整个AI产业的影响。原文链接从DeepSeek、Kimi到“黄仁勋联盟”AI模型开源到底“开”了什么-36氪
返回列表