DeepSeek V4 Flash 0731 开源,登顶开源模型前三

DeepSeek V4 Flash 0731 开源,登顶开源模型前三
DeepSeek V4 Flash 0731 开源登顶开源模型前三前两天大清早我刚揉着惺忪的睡眼打开手机刷推特的时候突然看到 Artificial Analysis 弹了一条推送。当时我整个人直接就愣住了。DeepSeek 又搞事情了。它们悄无声息地开源了全新的 DeepSeek V4 Flash 0731。这玩意儿在 Artificial Analysis 智能指数上直接考出了 50 分的高分瞬间杀进全球开源模型的前三名。更离谱的是什么呢它采用的是完全自由的 MIT 许可总参数 284B但实际激活参数居然只有 13BFP4/FP8 混合精度跑下来大概也就 167GB 左右。而且架构和定价完全跟之前的 V4 Flash 保持一致官方 API 也已经在第一时间内上线了。说实话看到这个消息的时候我脑子里第一反应不是什么技术突破而是脑补了一幅特别骚的画面。你在硅谷那些高大上的写字楼里几百个顶尖科学家开着百万年薪烧着几亿美金的算力天天加班加点搞模型蒸馏、调参、架构优化。结果远在杭州的几个年轻人喝着茶顺手把代码和权重往 GitHub 上一扔。然后跟全世界说来开源的拿去玩吧性能还跟我们之前收费的昂贵 API 一模一样。这尼玛简直就是对当前整个硅谷 AI 圈子的一场无声嘲讽。我当时就忍不住寻思DeepSeek 这帮人到底是用什么材料做的怎么能做到每次发新东西都像是在玩降维打击。为了彻底搞明白这玩意儿到底是真牛逼还是纯粹在吹牛我当天就直接调用了官方刚刚上线的 API顺便在 Hacker News 和推特上扒了一整天国外大佬们的评测和源代码讨论。今天我就想跟大家好好聊聊这个刚出炉的 DeepSeek V4 Flash 0731以及这背后隐藏着的一些极其有意思、甚至有点背离直觉的技术秘密。一、13B 激活参数的性能奇迹故事得从 Artificial Analysis 那个榜单开始说起。很多人可能对 Artificial Analysis 这个机构不太了解你可以把它理解成 AI 界非常权威的第三方裁判所。它们不看你厂商宣传页上写的那些花里胡哨的指标只用自己的一套基准测试去硬测模型的真实能力、推理速度和性价比。这次 V4 Flash 0731 跑出来的 50 分是什么概念呢就是在所有开源大模型里它已经能够稳稳地跟顶级的开源巨无霸们平起平坐了。但你要知道通常那些能考到这个分数的开源模型动不动就是几百 GB 甚至是上 TB 的体量想要在本地或者私有云上跑起来你没个几张 A100/H100 显卡连看都不敢看。而 DeepSeek 这个 Flash 版本总参数虽然达到了 284B但在实际计算推理的时候依靠极度骚气的 Mixture of Experts 架构真正激活的参数只有 13B。13B 啊朋友们。13B 意味着什么意味着它的计算开销和响应速度其实跟一个轻量级的端侧模型差不多。你用着 13B 参数的算力成本拿到了媲美巨型模型的推理能力。这种感觉就像是你花了一辆飞度车的油钱结果油门踩下去直接推出了保时捷 911 的加速度。而且这次它们还把模型用 FP4 和 FP8 的混合精度给压缩到了 167GB 左右。虽然 167GB 显存对于个人电脑来说依然有点吃力但对于绝大多数企业级服务器或者多卡消费级显卡组合来说部署门槛简直是被直接一脚踹翻到了地狱门槛。更绝的是DeepSeek 依然直接给了 MIT 许可。熟悉开源协议的朋友都知道MIT 协议基本上就是相当于告诉你拿去用吧拿去改吧你想拿去商业化卖钱都无所谓别找我麻烦就行。在这个很多大厂都在搞伪开源、给开源协议加各种商业限制条款的年代DeepSeek 这种直接丢 MIT 协议的做法真就叫真诚是唯一的捷径。二、打不过就加入的受控实验说到这里我就不得不提起前两天在 Hacker News 上看到的一个超级热门的帖子。那个帖子名字叫 Show HN: 将 DeepSeek 整合到 GPT-OSS 中不会带来审查机制。这个帖子是由 CTGT 团队发出来的一篇研究报告他们在 Hacker News 上一挂出来就直接被顶上了首页。研究内容特别骚可以说是精准地戳中了西方科技圈一直以来最敏感、也最纠结的一个痛点。大家也都知道国外很多开发者和机构对中国背景的 AI 模型一直有一种说不清道道不的戒心总觉得中国的模型带有某种天然的审查机制。于是这个 CTGT 团队就做了一个非常有意思的受控实验。他们用 DeepSeek V4 Flash 作为教师模型去蒸馏训练美国本土的开源模型 GPT-OSS-120B。说白了就是让美国的开源模型去天天背诵、学习 DeepSeek 的输出内容看看能不能把 DeepSeek 身上强大的推理能力给学过来。同时他们最核心想观察的一点是在把 DeepSeek 的能力蒸馏过去的过程中那些所谓的审查行为到底会不会跟着一起迁移到美国模型身上。实验结果出来之后所有的研究人员都傻眼了。不仅没有出现他们担心的审查迁移相反GPT-OSS-120B 在吸收了 DeepSeek V4 Flash 的输出之后金融推理能力和复杂逻辑能力出现了暴涨。这说明了什么说明 DeepSeek 模型的底层推理能力和逻辑框架跟表面上的安全过滤机制完全是两码事。模型的智慧是纯粹的逻辑和知识而所谓的过滤层只是外面套的一层壳。当西方开发者拿到了 DeepSeek 的开源权重或者 API 输出来训练自己的模型时他们得到的全是硬核的数学、代码和金融推理干货。看到这个实验结果的时候我真的差点笑出声。这不就是典型的打不过就加入吗。嘴上说着不要身体却非常诚实地拿 DeepSeek 的数据去喂自己的模型结果喂完发现效果好得不行。这也印证了我一直以来的一观技术本身是没有国界的真正能够打动人类的永远是绝对硬核的实力和效率。三、真实调测与极速响应体感说实话我自己也在项目里试着调用了新版 V4 Flash 的 API。我随便扔给了它一段极其繁琐的 Java 后端并发代码里面包含了复杂的 Redis 缓存击穿逻辑和 Lua 脚本原子更新。这种代码如果让一般的模型来看很可能会在上下文解析或者逻辑推演上出现纰漏。但 V4 Flash 0731 的返回速度快得飞起并且不仅精准指出了我代码里关于锁释放的一个隐蔽 Bug还顺手给我优化出了一版性能更高的实现。那种毫秒级响应带来的爽快感真的会让你觉得科技的进步太特么赤鸡了。你可以回想一下在两三年以前我们想要用上这种级别的模型能力需要经历怎样的过程。你需要按月支付高昂的订阅费你需要忍受时不时的网络卡顿你需要看着那个光标像乌龟爬一样一个字一个字地往外吐。而现在DeepSeek 把这一切都给打下来了。它们不仅把 API 价格压到了极致还把最核心的开源权重毫无保留地拱手相让。四、技术浪漫主义与大时代我有时候觉得DeepSeek 正在用一己之力重塑整个全球 AI 的生态格局。它们不是在跟 Open AI 或者 Anthropic 竞争某一款产品的市场份额它们是在用一种接近于公用事业的方式把顶尖 AI 算力和推理能力的获取成本推向无限接近于零。当技术被折叠到人人都可以轻易触及的高度时奇迹才会真正发生。你不再需要是一个拥有千万融资的创业公司你甚至不需要有一间像样的办公室。你只需要一台带显卡的电脑加上一点点对这个世界的好奇心你就可以基于 DeepSeek 开源的模型搭建出属于你自己的超级应用。从最早的 DeepSeek V1 到现在的 V4 Flash 0731我一路看着它们走过来最感动我的从来不是那些跑分榜单上的数字。而是这群人身上那种极具硬核工匠精神的浪漫主义。它们不搞花里律哨的发布会不讲那些动不动就要改变人类命运的宏大叙事。它们只是默默地在每一个节点上把代码写好把架构调优把权重打包然后发个推特说呐我们做出来了表现还不错开源了大家拿去玩吧。这才是真正的技术精神。坦率的讲在这个充满了喧嚣、泡沫和焦虑的时代能看到有这样一家团队始终践行着对技术的好奇与真诚真的让人非常庆幸。大时代啊朋友们。当顶尖的模型能力像空气和水一样变得触手可及接下来最重要的就是看我们这些普通人能用它来玩出什么有意思的花样了。以上既然看到这里了如果觉得不错随手点个赞、在看、转发三连吧如果想第一时间收到推送也可以给我个星标⭐谢谢你看我的文章我们下次再见。/ 作者Ea4on