【月之暗面拥抱开源】KIMI K3已经开源了,一夜下载量高达2850次

【月之暗面拥抱开源】KIMI K3已经开源了,一夜下载量高达2850次
技术博客Tech Blog 完整技术报告Full Report1. 模型介绍Kimi K3 是一款开源权重、原生多模态智能体大模型也是月之暗面迄今为止能力最强的模型。该模型总参数量达2.8万亿基于 Kimi 增量注意力KDA与注意力残差AttnRes技术构建原生内置视觉能力上下文窗口支持100万 Token。它是全球首款开源3万亿参数级大模型面向长周期代码开发、知识工作与复杂推理等前沿智能场景打造。核心特性全新自研架构Kimi K3 依托 Kimi 增量注意力KDA与注意力残差AttnRes搭建通过稳定隐式混合专家Stable LatentMoE框架拓展稀疏专家能力模型共896个专家单次推理激活16个相比 Kimi K2整体扩展效率提升约2.5倍。长周期任务处理仅需极少人工监督Kimi K3 即可完成长时间工程会话、解析大型代码仓库、调度终端工具适用场景覆盖GPU内核优化、编译器开发、视觉闭环游戏开发、CAD制图乃至芯片设计。全能知识智能体Kimi K3 可端到端完成专业知识工作能够生成带交互式可视化组件、控件与数据看板的深度研究报告同时支持动效设计、视频剪辑全部能力均依托原生多模态架构实现。原生多模态百万级超长上下文单模型统一处理文本、图像、视频输入上下文窗口最高支持1048576 Token100万Token。开源前沿完整权重我们基于 Kimi K3 专属许可证开放完整模型权重前沿AI能力可面向学术研究、工程部署与二次创新公开使用。2. 模型基础参数模型架构混合专家 MoE总参数量2.8万亿单次激活参数量1040亿总层数93层稠密层数量1层注意力层构成69层KDA增量注意力 24层门控MLA注意力注意力隐藏维度7168注意力头数量96个隐式MoE维度3584单专家MoE隐藏维度3072专家总数896个每个Token激活专家数16个共享专家数量2个词表大小16万上下文长度上限1048576 Token注意力机制KDA增量注意力 门控MLA激活函数SiTU-GLU视觉编码器MoonViT-V2视觉编码器参数量4.01亿量化方案权重MXFP4 / 激活值MXFP8全程量化感知训练支持模态文本、图像3. 评测结果评测基准Kimi K3最大推理强度Claude Fable 5最高强度含降级兜底GPT-5.6 Sol最高强度Claude Opus 4.8最高强度GPT-5.5超高强度GLM-5.2最高强度推理与知识能力GPQA Diamond 专业知识问答93.592.694.191.093.591.2CritPt 深度批判性推理23.428.632.320.927.120.9AA-LCR 长文本逻辑推理74.770.073.767.774.371.3HLE-Full 高阶长文本问答43.5 / 56.053.3 / 63.044.5 / 58.049.8 / 57.941.4 / 52.2—代码能力DeepSWE 真实仓库代码修复67.570.073.059.067.046.2ProgramBench 通用程序生成77.876.877.671.970.863.7Terminal-Bench 2.1 终端命令自动化88.388.088.884.683.482.7FrontierSWE 前沿大型代码项目修复81.286.671.366.764.967.3SWE-Marathon 长周期代码马拉松42.035.039.040.014.013.0PostTrainBench 模型微调代码36.641.434.634.128.434.3MLS-Bench-Lite 机器学习脚本48.349.946.242.835.540.4SciCode 科研代码生成58.760.256.153.556.150.5Kimi Code Bench 2.0 月之暗面自研代码基准72.976.964.871.769.064.2智能体工具调用能力BrowseComp 网页浏览综合任务91.288.090.484.384.4—DeepSearchQA 深度检索问答F1值95.094.2—93.1——ResearchRubrics 专业研究报告生成76.2—73.873.564.071.1GDPval-AA v2 通用智能体Elo评分168617471736159314911510Toolathlon-Verified 工具调用综合挑战赛76.577.974.976.273.559.9MCPMark-Verified 多工具协作评测94.587.492.976.492.9—MCP-Atlas 多轮复杂工具交互84.284.783.683.682.882.6AutomationBench 系统自动化任务30.829.129.727.222.712.9JobBench 职场办公自动化54.357.445.448.438.343.4AA-Briefcase 商业办公智能体Elo评分154815831495135411581260Agents Last Exam 高阶智能体综合大考28.325.7†29.627.026.620.4APEX-Agents 复杂专业智能体任务41.043.339.939.438.535.6OfficeQA Pro 图文文档办公问答63.369.963.263.960.941.4SpreadsheetBench 2 表格数据处理34.834.732.431.629.128.1OSWorld-Verified 操作系统操控验证集84.885.083.083.479.0—OSWorld 2.0 全版本操作系统操控58.366.162.655.749.5—SaaS-Bench 软件平台自动化操作60.1—61.456.143.8—τ³-Banking 银行金融智能体33.426.833.027.631.326.8Harvey Lab-AA 实验室科研智能体94.693.687.291.186.391.0CorpFin v2 企业财务分析71.671.864.466.768.466.1Finance Agent v2 通用金融智能体54.456.353.853.951.849.7Legal Research Bench 法律检索与文书44.249.548.143.840.431.3视觉多模态能力WorldVQA ForceAnswer 开放世界视觉问答51.056.741.839.138.5—OmniDocBench 全类型图文文档解析91.189.885.887.989.4—PerceptionBench 基础视觉感知自研基准58.557.259.747.255.8—Video-MME带字幕视频理解90.0—89.586.089.3—MMVU 通用多模态视频理解82.1—81.279.281.7—BabyVision 视觉Python代码推理85.790.588.981.283.6—MMMU-Pro 专业多模态综合问答81.6 / 83.481.2 / 86.583.0 / 84.678.9 / 82.781.2 / 83.2—CharXiv (RQ) 图表数据分析84.8 / 91.388.9 / 93.584.6 / 89.180.5 / 89.984.1 / 89.0—MathVision 数学图像解题94.3 / 97.894.8 / 98.695.8 / 97.886.7 / 97.192.2 / 96.8—ZeroBench (pass5) 零样本视觉复杂任务23.0 / 41.023.0 / 46.017.0 / 35.017.0 / 34.022.0 / 41.0—注释说明所有Kimi K3评测结果均采用推理强度设为“max最大”、温度参数1.0单步任务如GPQA Diamond、HLE-Full、无工具视觉基准top-p0.95智能体多工具任务top-p1.0。 HLE-Full、MMMU-Pro、CharXiv (RQ)、MathVision、ZeroBench单元格内两组分数格式为无工具得分 / 启用工具后得分HLE-Full使用通用工具视觉类基准使用Python工具。推理与知识类基准CritPt、AA-LCR数据来源为 Artificial Analysis 平台2026年7月23日榜单。代码类基准DeepSWEKimi K3使用自研Kimi Code评测框架GLM-5.2分数取自官方发布博客其余模型数据来自DeepSWE官方榜单Kimi K3搭配mini-SWE-agent框架得分67.3评测基于DeepSWE v1.1任务集。Terminal-Bench 2.1Kimi K3使用自研Kimi Code评测框架其他模型取各框架最优分GLM-5.2搭配Claude CodeClaude Opus 4.8、Claude Fable 5搭配Terminus 2GPT-5.5、GPT-5.6 Sol搭配Codex框架。ProgramBenchKimi K3使用自研Kimi Code评测框架GLM-5.2分数取自官方博客其余模型数据来自Vals AI平台。SWE-MarathonKimi K3、Claude Opus 4.8、Claude Fable 5使用Claude Code框架GPT-5.6 Sol使用Codex框架GLM-5.2分数取自官方博客。评测基于2026年7月9日H20显卡校准分支正式v1.1发布前版本GPU任务镜像、校验标准已适配H20正确性校验与反作弊逻辑不变。评测中Claude Fable 5有35%任务触发降级兜底一定程度拉低最终得分。FrontierSWEKimi K3使用Kimi Code框架GPT-5.6 Sol使用Codex框架其余模型数据来自FrontierSWE官网榜单优势分数由官方脚本基于原始分数重新计算数据更新至2026年7月16日。PostTrainBenchGLM-5.2、GPT-5.5、Claude Opus 4.8采用官方榜单原始分数Kimi K3、Claude Fable 5、GPT-5.6 Sol使用官方Harbor实现、最大推理强度在H20 GPU上重复三次取均值官方标准为H100Kimi K3与Claude Fable 5搭配Claude Code框架GPT-5.6 Sol搭配Codex框架。MLS-Bench-LiteKimi K3使用Kimi Code框架GLM、Claude系列使用Claude Code框架GPT系列使用Codex框架。SciCode数据来源 Artificial Analysis 2026年7月23日榜单。Kimi Code Bench 2.0月之暗面自研基准Kimi K3使用Kimi Code框架搭配Claude Code框架得分73.7GLM-5.2、Claude Opus 4.8、Claude Fable 5使用Claude Code框架GPT-5.5、GPT-5.6 Sol使用Codex框架。全部模型开启最大推理强度GPT-5.5除外使用超高强度xhigh。基准包含网络安全与安全校验任务各模型拒绝/兜底任务数量Claude Fable 5共80题13题兜底、1题拒绝GPT-5.6 Sol安全拦截10题GPT-5.5拒绝3题。智能体工具类基准OfficeQA Pro全部测试用例仅提供PDF图片渲染文件无机器可读文本。OfficeQA Pro、SpreadsheetBench 2Kimi K3、GLM-5.2、Claude Opus 4.8、Claude Fable 5使用Claude Code框架GPT-5.5、GPT-5.6 Sol使用Codex框架。MCP-Atlas评测采用公开500任务子集单任务最大交互轮次100使用Gemini 3.1 Pro作为结果裁判。AutomationBench评测采用公开600任务子集其余配置严格遵循官方GitHub标准。BrowseComp开启30万Token上下文压缩策略若直接使用完整100万上下文、无压缩策略Kimi K3得分可达90.4。Claude Fable 5、Claude Opus 4.8、GPT-5.6 Sol、GPT-5.5分数取自Anthropic、OpenAI官方发布内容。GDPval-AA v2、AA-Briefcase、τ³-Banking、Harvey Lab-AA、APEX-Agents数据来源 Artificial Analysis、APEX-Agents官方榜单更新至2026年7月23日Harvey Lab-AA报告任务通过率。CorpFin v2、Finance Agent v2、Legal Research Bench数据来源Vals AI平台。Agents’ Last Exam分数取自官方榜单2026年7月23日指标为任务通过率各模型固定搭配评测框架Kimi K3搭配Kimi CodeGPT-5.6 Sol/GPT-5.5搭配CodexClaude Fable 5/Claude Opus 4.8/GLM-5.2搭配Claude Code。†标记Claude Fable 5采用超高推理强度40%任务结果降级。多模态视觉基准除ZeroBench重复五次取结果外其余多模态评测均运行三次取平均分。MMMU-Pro严格遵循官方评测协议原图前置输入文本。PerceptionBench月之暗面自研基准聚焦基础原子级视觉感知能力。4. 原生MXFP4量化方案Kimi K3从监督微调SFT阶段即全程采用量化感知训练权重使用MXFP4格式、激活值使用MXFP8格式适配广泛硬件推理环境。5. 部署指南注意你可前往 Kimi 开放平台 https://platform.kimi.ai 选择模型kimi-k3调用API同时提供兼容OpenAI、Anthropic格式的标准接口。当前推荐使用以下推理引擎部署Kimi K3vLLM — 部署教程https://recipes.vllm.ai/moonshotai/Kimi-K3SGLang — 使用手册https://docs.sglang.io/cookbook/autoregressive/Moonshotai/Kimi-K3TokenSpeed — 部署脚本https://lightseek.org/tokenspeed/recipes/models#kimi-k36. 模型调用使用说明Kimi K3默认开启深度思考输出接口会返回独立字段reasoning_content思考过程。推理强度通过请求顶层参数reasoning_effort配置可选值low低、high高、max最大默认。Kimi K3训练时保留完整思考历史多轮对话、工具调用场景下必须将接口返回的完整助手消息原样传入messages数组包括思考内容reasoning_content与工具调用tool_calls不能仅传入最终回答content。importopenaidefchat_with_preserved_thinking(client:openai.OpenAI,model_name:str):messages[{role:user,content:给我三个随机数字。},{role:assistant,reasoning_content:我先列出五个数字473、921、235、215、222然后告诉你前三个。,content:473、921、235},{role:user,content:你心里剩下另外两个数字是什么}]responseclient.chat.completions.create(modelmodel_name,messagesmessages,streamFalse,max_tokens4096,reasoning_effortmax,)# 模型会读取上一轮思考内容输出215和222print(f模型思考过程{response.choices[0].message.reasoning})returnresponse.choices[0].message.content图文输入、结构化输出、增量模式、工具选择、动态工具加载、上下文缓存等完整教程与示例详见官方文档Kimi K3 快速上手文档、推理强度配置指南代码智能体配套框架Kimi K3搭配 Kimi Code CLI 智能体框架效果最佳。欢迎在终端运行Kimi Code输入/model命令切换至Kimi K3。期待你的使用反馈7. 开源许可证代码仓库与模型权重均遵循 Kimi K3 专属许可证 开放。8. 联系我们如有任何问题可发送邮件至 supportmoonshot.ai 咨询。