Kimi 昨天发布了 K3 的技术文章,我从中读到的信息

Kimi 昨天发布了 K3 的技术文章,我从中读到的信息
昨天月之暗面把Kimi K3的完整模型权重和技术报告一并放了出来。报告是一份 2.5MB 的 PDF我花了一段时间读完。先说结论这份报告不像一篇模型宣传稿更像一份路线宣言。它通篇在回答一个问题——“开源模型要追上闭源前沿到底差在哪、该怎么补”。下面我按从报告里读到了什么的思路拆一遍尽量讲那些参数表以外的、真正值钱的工程判断。一、题眼开源模型缺的不是会推理是够大报告开篇第一段就把基调定死了。它说过去两年 frontier 研究的重心都在test-time scaling推理时计算这一轴上——o 系列、Claude 的 extended thinking、DeepSeek-R1、Kimi K1.5 都在把推理当第二增长曲线。开源社区在这条轴上追得很快。但另一条轴——pre-training 参数规模——开源阵营普遍还卡在 1T 量级附近没动。报告的原话是当越来越复杂的推理/agent RL 方法被套在差不多规模的预训练底座上时开源的进步会收敛而和最强闭源的差距反而越拉越大。K3 的做法是直接把两条轴一起推到前沿预训练底座干到2.8T 参数3T 级同时在 1M 上下文上做推理时 scaling。我的感觉这其实是给开源路线定了一个判断——光堆推理技巧补不了底座的代差。要么上参数要么接受被甩开。DeepSeek 之后Kimi 是把这个判断落到实处的第二家。二、架构不是单点创新是三维信息流的协同设计很多人看 K3 只盯着2.8T、896 专家这些数。但报告反复强调的一个词是information flow信息流——它要在三个维度上同时把信息打通序列维sequence length用KDAKimi Delta Attention做高效长序列混合再周期性插入Gated MLA保住全局交互。每块 3 个 KDA 1 个 MLA3:1最后一层强制全局注意力。深度维network depth用AttnRes注意力残差让每层能选择性回看前面所有层而不是像普通残差那样把所有前层信息压成一个 state。宽度维model width每个注意力层后接Stable LatentMoE每 token 只激活 896 个路由专家里的 16 个。三者合起来配 refine 过的数据和训练配方相对 K2 拿到约2.5× 的 scaling efficiency把算力转成智能的效率。原文这代架构的核心思想不是某个模块多牛而是用不同机制分别照顾序列、深度、宽度三个方向的信息瓶颈。这是系统级架构不是魔改一层。三、最被低估的工程细节KDA 的下界衰减KDA 本质是带 channel-wise 遗忘门的 delta-rule 线性递归。但报告里最值得工程师记笔记的是一个看起来很小的改动——下界衰减lower-bounded decay。KDA 在 chunk 内要用累计衰减的倒数去重缩放 key而这个倒数在有限精度下会溢出。Kimi Linear 原来的做法是负 Softplus 无界映射导致对角 tile 必须走显式的 position-pair 计算这是性能瓶颈。K3 改成用 scaled sigmoid 把 log-decay 从下方封死gmin -5。这样一来每个保留因子都大于e^-5 ≈ 6.7e-316-token tile 的累计对数衰减落在 (-80, 0)倒数小于e^80刚好落在 BF16 动态范围内。于是对角和斜对角 tile 全都能用 dense Tensor Core 矩阵乘那条 position-pair 的慢路径被彻底消掉。所以线性注意力能不能上规模瓶颈往往在数值稳定性而不在算法表达力。一个gmin-5的小改把能不能吃满 Tensor Core这个工程天花板直接抬高了。这呼应了报告里反复提的算法-系统协同设计algorithm-system co-design。四、AttnRes把注意力装到深度方向标准残差连接把所有前层信息压进一个h_l本质上是个沿深度方向的 RNN 瓶颈。Transformer 当年是把注意力引入了序列方向每个位置能看所有前序位置AttnRes 干的是同样的事、但放在深度方向每层用一个可学习的伪查询对所有前层表示做 softmax 加权回看。直接全量做是O(L²d)算力 O(Ld)内存要留住所有层输出。K3 用Block AttnRes把 L 层分成 N 个 block块内求和、块间才做注意力内存从O(Ld)降到O(Nd)。报告说N8 就能恢复大部分收益K3 实际用 8 个 block含 embedding 共 9 个。KDA的整体运行流程如下所示左上角:带有共享和路由专家的稳定隐式MoE模块。左下角:KDA模块。右下角:原生视觉通路。相对而言一般的残差链路是会遗忘/混淆的。给深度方向也装一个注意力等于让深层能直接调取浅层特征而不是靠一层层残差慢慢渗。做深网络的都该留意这个思路。五、NoPE 递归门控1M 上下文不用动 RoPE位置编码这事K3 走了一条很省心的路KDA 用递归门控和衰减隐式编码位置NoPEMLA 层也跟着用 NoPE不显式加位置编码。好处是外推到 1M 上下文时完全不用改位置编码超参——不用重调 RoPE 频率基、不用 YaRN 插值。配合四阶段课程8K→64K 预训练256K→1M cooldown把最贵的超长序列计算集中在训练预算很小的一部分里既省钱又让模型渐进适应长依赖。这里我的看法是很多模型的长上下文是后期硬拗出来的改 RoPE、加插值容易掉链子。K3 把位置信息长在机制里扩展长度几乎是免费的。这解释了它为什么能稳吃百万 token 而不崩。六、Stable LatentMoE极端稀疏下的两个坑怎么填把路由专家池拉到 896、每 token 只激活 16稀疏度 56会放大两个 vanilla 设计的失败模式激活爆炸路由分支是门控 GLU 多分支专家 FFN 上投影近四个矩阵乘的链式结构在 2.8T 规模下内部激活会爆。负载不均近千个专家传统辅助损失均衡法管不住。K3 的解法三件套Normalized LatentMoE专家聚合和上投影之间插一层 RMSNorm压住尺度抖动还顺手提升了验证集 loss 和下游榜。SiTU-GLU用tanh软封顶的 GLU近端近似 SwiGLU、远端有界杜绝大坐标下溢/溢出。Quantile Balancing分位数均衡免辅助损失路由给每个专家的偏置直接取匹配目标负载的分位数。工程上还用直方图估计代替全局精确分位数一次 all-reduce 几百个 bin 就够把通信成本压到极低。而 MoE 上规模后均衡和稳定才是真难题不是容量。QB 这套用分位数定偏置 直方图近似的思路对任何人训大 MoE 都有直接参考价值。七、训练方法的真经9 个专家再蒸馏成一个Post-training 是三段式SFT 冷启动 → RL 训出领域专家 → 多教师在线蒸馏MOPD合并。关键是 RL 的切法跨3 个领域通用 / 通用 agent / 编码 agent× 3 档推理力度low / high / max 9 个专家模型。然后这 9 个专家通过 on-policy 蒸馏合并回一个统一模型。几个工程亮点Partial Rollout部分回滚长程任务一个 trajectory 可能跨多个训练迭代天然产生陈旧数据off-policy。他们用per-token 正则容忍极端陈旧稳住训练——这是个很反直觉但很实用的设计。推理力度预算控制每个问题估个初始 token 预算b0超了直接给-1奖励逼模型别 overthinking。再分阶段退火出 high/low 档专家。白盒 RL 环境把 agent harness 拆成可配置模块工具接口、system prompt、上下文管理、skills、memory、subagents…能动态实例化出 Kimi Code / Claude Code / Codex / OpenClaw / Hermes 等不同 harness——专门为了防止模型过拟合某一种工具 schema。我的读数有意思的是报告点名的主流 harness里就有OpenClaw我们正在做的方向。这侧面说明可插拔 harness已经是 agent 训练的基础设施共识了。另外先训多个专家再蒸馏比硬训一个全能模型更稳这条对做垂直 agent 的人很值钱。八、任务从哪来知识图谱引导的合成RL 效果好不好七分看环境。K3 建了一套自演化的分层知识图谱DAG从粗粒度种子节点出发agent 递归做网络检索、扩展出更细的节点边永远从粗指向细采样相关概念组合成关键词 → 检索真实公开材料论文、博客、代码库→ 合成任务。我的读数这是训练数据从哪来的工业级答案——不是堆语料而是用知识图谱保证覆盖度和细粒度再挂钩真实材料保证任务可验证。做垂直领域 agent 训练的人这套 pipeline 比模型本身更值得抄。九、部署感知训练和推理用同一套量化K3 从 SFT 阶段起就做MXFP4 量化感知训练QAT专家权重压到 MXFP4、激活用 MXFP8非专家部分保持高精度。关键是rollout 和 training 用同一套量化方案消除 train-inference mismatch。推理加速上把预训练的 MTP 层 fine-tune 成 EAGLE-3 风格的草稿模型并且直接优化投机解码的接受率LK loss而不是常规 KL 散度——因为 KL 不保证小容量草稿模型的接受率最大。我的读数2.8T 模型不把部署成本当后处理而是从训练第一天就耦合进去。这点对开源模型能不能真用得起是决定性的一笔。十、报告自己说了实话最让我高看一眼的是报告的诚实。它明确写“整体表现仍落后于最强的专有系统——Claude Fable 5 和 GPT-5.6 Sol——但稳定领先我们评测套件里的其他开源与闭源模型。”没有全面超越只有在开源前沿里带头、逼近闭源天花板。这种定位反而体现了Kimi开源工作者的不骄不躁的性格我相信在以后开源模型一定会交一份更满意的答卷。写在最后对我们意味着什么把这份报告连起来看K3 给的不是一个更强模型而是一张开源追前沿的施工图底座不够大推理技巧补不上代差架构要按序列 / 深度 / 宽度三个信息瓶颈分别设计上规模后数值稳定、负载均衡、off-policy 陈旧这些工程脏活才是胜负手训练数据要用知识图谱真实材料自动合成而不是靠人工堆部署成本要从训练第一天就耦合。如果我们自己做 OpenClaw 这类 agent 框架时第 7 节的白盒 harness 多专家蒸馏和第 8 节的知识图谱任务合成是最能直接平移的两块。模型会一代代换但这套训练/架构的方法论才是能留下来复用的东西。