Kimi K3 深度测评(一):2.8万亿参数、1M上下文背后,它到底是“全能王“还是“偏科生“?

Kimi K3 深度测评(一):2.8万亿参数、1M上下文背后,它到底是“全能王“还是“偏科生“?
Kimi K3 深度测评一2.8万亿参数、1M上下文背后它到底是全能王还是偏科生系列总览篇。本文不吹不黑只做一件事把 Kimi K3 的公开真实规格与基准数据摆上桌再和 Claude Fable 5、GPT-5.6 Sol、DeepSeek V4 Pro 等一线模型正面对比帮你判断它到底适合什么场景。0. 一句话结论Kimi K3 不是全能通用王而是当前开源阵营里最强的长上下文 代码/智能体特化模型前端代码登顶、1M 上下文、agentic 长程任务强但在专家级数学、研究级物理、以及事实幻觉控制上明显落后于同代的 Claude / OpenAI 旗舰。下面用数据说话。一、先看清规格它到底什么来头Kimi K3 由月之暗面Moonshot AI于2026 年 7 月 16 日托管上线7 月 17 日在 WAIC 上海亮相并承诺于7 月 27 日放出完整权重Modified MIT 许可证。核心规格如下维度数据来源参数规模2.8 万亿总参数稀疏 MoE896 个专家每 token 激活 16 个Moonshot 官方上下文窗口1,048,576 tokens1MMoonshot 官方输入模态文本 原生图像/视频理解Moonshot 官方推理模式默认 always-on thinking持续思考Moonshot 官方架构创新Kimi Delta AttentionKDA混合线性注意力 Attention Residuals Stable LatentMoE MXFP4/8 量化感知训练Moonshot 技术报告随权重发布API模型 IDkimi-k3OpenAI / Anthropic SDK 兼容Base URLhttps://api.moonshot.ai/v1Moonshot 官方API 价格3 / 百万非缓存输入0.30 / 百万缓存输入$15 / 百万输出Moonshot 官方自部署vLLM / SGLang / TensorRT-LLM需 A100 级 GPU 集群Moonshot 官方ARR2026 年 6 月达 3 亿美元4 月为 2 亿国内媒体 / 公司披露⚠️注意2.8T 是总参数不是每 token 计算量。稀疏 MoE 每 token 只激活 16/896 专家所以它在容量大的同时推理算力成本远低于同规模稠密模型——但权重存储、路由通信和 1M 上下文的内存压力依然巨大。二、和谁比真实智能指数横评最干净的跨模型对比来自Artificial Analysis Intelligence Index v4.1同一套 harness、同一批设置测所有模型。K3 得分约57是有史以来开源模型在该榜的最高排名。模型智能指数AA v4.1定位Claude Fable 5领先榜首区间闭源旗舰GPT-5.6 Sol领先榜首区间闭源旗舰Kimi K3≈57开源第一全球 3–4Claude Opus 4.8同档闭源GLM-5.2智谱51开源Gemini 3.1 Pro Preview46闭源DeepSeek V4 Pro44开源结论K3 把开源模型的天花板拉到了闭源旗舰的同一档位附近但综合仍落后 Fable 5 / Sol 半个身位。三、强在哪、弱在哪一张表看懂偏科能力真实成绩口径评价前端代码LMArena Frontend Code Arena#1Elo 1679Fable5 1631 / Sol 1618人类盲评 强首个登顶的中国模型长上下文推理AA-LCR75%被测最高独立 强信息检索BrowseComp91.2SOTA独立 强研究生级科学GPQA Diamond94%并列第一独立 强Agentic 长程AA-Briefcase #2≈1527AutomationBench-AA 53% #1Harvey LAB-AA 95% #1混合 偏强通用对话LMArena 文本榜1486 Elo一般人类盲评 中庸终极推理Humanitys Last Exam44%Fable5 53%独立 偏弱研究级物理CritPt23%中游独立 偏弱专家级数学FrontierMath Tier 4≈39%西方顶尖≈90%Epoch AI 弱差距超一倍事实幻觉AA-Omniscience 非幻觉率49%Opus4.8 64% / GLM5.2 72%独立 弱且答得越多错得越多把表竖着读K3 在写代码、读长文、跑流程、做科研级问答上很能打在硬算数学、硬推物理、不胡说上掉队明显。四、我的判断与选型建议适合前端/全栈代码生成、超长文档合同、论文、代码库分析与检索、长程多步骤智能体自动化办公、终端操作、科研级 QA。不适合需要极高数学严谨性的场景定理证明、金融量化建模、复杂数值仿真、对零幻觉有硬要求的合规/医疗问答。成本提醒API 输出 $15/百万 token比 DeepSeek V4 Pro、GLM-5.2 贵数倍。建议重活上 K3杂活上便宜模型的混合路由。 数据来源与实测说明重要本文基准数据来自Moonshot 官方发布、Artificial Analysis、LMArena、Epoch AI等公开渠道为2026 年 7 月下旬快照基准排名每周变动数字仅供参考。⚠️厂商自报的编码分数混合了 KimiCode / Claude Code / Codex / mini-SWE-agent 等不同 harness并非严格同口径不同 harness 可造成 10–26 分波动请谨慎看待。本系列后续文章提供可一键运行的测试脚本读者可自行跑出真实输出验证。投资/选型有风险本文不构成任何商业或投资建议。