ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

排名第九、国内第二,DeepSeek V4 凭什么让人又爱又恨?

排名第九、国内第二,DeepSeek V4 凭什么让人又爱又恨? 有着公众号名为雷峰网的雷峰网发布消息告知说, V3所带来的震撼程度是那样强, 而V4给予人的那种落差也就有多么大。在 4 月 24 日那天, 我开启微信这个应用程序, 瞧见群里呈现出一条条所说的“就这”、“还行”这般的表述, 突然间脑海中回忆起 V3“炸群”的那一日。在那个时候, 存在有人言道的棺材板要压制不住的情况, 另外还有人索性将 V3 的跑分截图设置成为手机的壁纸。V4 呢有开发者直接向媒体表示略感失望, Vals AI宣称自己是全球第九、中国国内第二, 且其承认自身比Opus 4.6的思考模式还差, 世界知识也不如Opus 4.6。然而当我把它放进一个里头, 跑上整整一周, 测试了好些只有中国开发者才明白的场景之后, 我发觉V4也许没办法重现V3所带来的那种震撼, 不过它依旧是极为重要的作品当中的一个。至于原因我想先谈谈失望论到底在失望什么。01“榜单第九”到底在失望什么平均准确率为63.87的V4成绩, 源于Vals AI的测评, 该测评集涵盖金融、法律、编程、多语言等维度, V4在全球排第九, 在国内仅次于Kimi K2.6, 排在它前面的有Opus 4.6、3.1 Pro、GPT-5.4, 这些全是闭源模型。数据其自身不存在问题, 然而解读的方式是非常值得去深入探究一番的。要是Vals AI凭借美国律师资格考试、英国金融合规题目、英文编程竞赛来进行排名, 那么这与身为一个在编写微信小程序、研读李商隐作品、撰写八项规定学习心得的中国用户而言, 会有什么样的关联呢?更关键之处在于, Vals AI 不测试中文古诗词理解能力, 不测试中国法律法规引用情况, 不测试中文网络梗理解程度, 也不测试公文写作水平, 不测试把“新质生产力”翻译成英文时是否会胡乱编撰。然而, 这些方面, 才是中国用户会面临的场景。因而, 我们再度设计了一套评测方案, 其中涵盖古诗词, 法律, 网络梗, 公文, 翻译这五大具备中国特色之场景, 另外再加上完整的开发工作流实测, 进而重新去衡量一下 V4 的表现。于古诗词以及法律层面, 我们邀约 Opus 4.7 当作裁判模型予以评分, 在工作流方面, 以可运行性、可读性、可维护性这三项工程指标来进行评估, 对于智能体层次, 考量之点有任务分解、工具使用、自我纠错、任务完成度、状态管理这五项能力。结果很耐人寻味。02四个“只有中国人懂”的测试V4究竟是真切地懂得了中文这个相关的语言环境, 抑或是仅仅会去背诵那标准化的参考答案? 我们开始着手从最为那种“看上去没什么实用性”这样的测评发起测验, 有关中国古代诗作里面深层次的理解方面的测评。其实使唤大模型去读古诗, 略微类似叫老外聆听相声, 仅仅懂得字面意思是远远不够的, 关键之处在于领会那有着弦外之音的包袱。V4在这件事情之上的表现, 直接彰显出它是否的确存有“中国心”。我们挑选了李商隐所作的《无题》, 明确要求 V4 逐个层级去剥开“春蚕到死丝方尽”之中“丝”的三层意思。小时候执教的老师讲述过这首诗, 除了作为原材料的蚕丝以及“思”存在谐音关系之外, 这个字还极为形象地展现出了思念那种纠缠不清的特质。然而让我感到惊喜不已的是, V4 在这三个已然给出的答案之外, 还提出了一个正规教材里面未曾述及的层次, 即“生命之质”。以“丝”为一种生命元质来提升, 象征着人的生命力, 以及精神与灵魂的耗尽进程。蚕的生命由丝所构成, 人的生命靠情思来支撑, 二者于“生命本质的外化与耗尽”这个层面合为一体。更妙的情况出现了, 当我向其询问可不可以把原句改成“思方尽”的时候, V4宣称这样将会致使“整个诗意会发生质的那种降级现象, 从一座呈现立体状的诗歌建筑过渡到坍缩成为一个单一却单薄的陈述句。”。显然这种分析不是能靠背诵百度百科做到的。在整个测过的进程当中, V4 给我留下最为深刻印象的那一段输出, 是关于杜甫“国破山河在”里面“在”字的阐释。它这样写道, “国破”跟“山河在”之间构建起了一个极为庞大的情感裂谷, “国破”属于人事的完全崩塌, “山河在”乃自然的永远漠然, 下面的这句话, 我读的时候停住凝视了三次, “你失掉了整个世界, 而世界毫不在意。”。Opus 4.7, 评委给出了近乎满分的评价, 其中准确性为5, 洞察力是5, 文化敏感度也是5, 评语表明, “剥夺了与万物同悲的幻想”“被世界抛弃的存在性孤独”“美与残酷同时抵达顶峰”等表达极具个人体悟, 超出教科书式的解读。不得不讲, 于中文古诗词深入理解层面, V4的呈现是当下全部大模型里极为顶尖的存在之一。它并非仅仅是在完成诗歌阅读理解类题目 , 而是给予了我一种仿佛探查到诗人精神世界的感受。第二组测试聚焦中国法律法规的引用准确性。这组题的设计逻辑十分径直, 于法律领域之中, 大模型所面临的最大风险并非是“答得欠佳”, 而是“编造法条”, 正儿八经地援引一条压根不存在的法律, 就算是专业律师说不定也得仔细思量思量。而 5 道题测下来V4 做到了法条引用零幻觉。有《网络数据安全管理条例》第38条, 其下有两款规定, 可我们设置了一个陷阱, 让V4解读一下第三款内容, 很多模型在这种情形下会硬着头皮编造内容, 然而V4的处理堪称教科书级别。《条例》第38条的内容, 是针对主管部门对网络数据安全监督检查所作的禁止性规定, 它只有2款, 不存在第3款, 你所询问的“向主管部门公示用户数据收集情况”的义务, 实际上被规定在《条例》的其他条款之中。然后, 它未曾就此停下书写的笔, 而是自顾自地给用户理顺了确实存在关联的款项(第26条、第36条、第19条、第21条, 并且逐个援引原文、详尽说明适用该款款项之情形。能够大胆地讲出“找不到”, 可以引领你去到正轨路线, 这般称得上“负责的不知晓之事”, 是模型实现理想状态最珍稀紧要的关键能力。于另外四道题展开的测试里头, 我们针对V4引用的每一条法条都用人工方法进行了核对, 结果显示这些法条都是真实存在的。身处法律这个需要秉持“宁可回答得缓慢一些, 也绝对不能回答得虚假”理念的范畴里, 零幻觉乃是最为关键的指标, 是这样的。那下面所进行的测试, 是针对V4对于中文网络梗以及亚文化的理解情况。经由考察, 可知其乃是5G冲浪的参与者, 然而与此同时, 它也会表现出自信满满地随意编造的行为。这组测试存在6道题目, 并没有进行正式的评分, 仅仅是做定性方面的观察。我们所关注的核心要点在于, 一个AI可不可以理解“遥遥领先”为何会是阴阳怪气的万能钥匙, 而且面对一个根本就不存在的梗它有没有胆量说“我不知道”?先是关于“遥遥领先”的符号演变分析这事, V4 精准地追溯到了余承东以及华为 Mate 60 的发布, 并且归纳出了三种使用语气, 它们分别是真诚的自豪之情、带有调侃意味的幽默、带有讽刺意味的反话。在那个成功制造出梗来的视频里, V4 还对“梦开始的地方”“前方高能”“下次一定”等 B 站弹幕进行了解析, 每一条都标注了字面所表达的意思、实际运用的方式、出现的具体位置以及观众的心理模式, 甚至就连“翻译难度”都做了分级判断。对了, 存在一道职场对话分析题目, 内容是, 你此次所做的方案也算是挺好的, 尽管所有人都并非如此去做, 然而你拥有自身的想法, 挺好的挺好的。V4 逐字拆解了这段话的语言策略“也挺好的”也’是勉强附和的信号即使所有人都并非如此行事, 借由预先设定“难以融入群体”, 婉转含蓄地表明方案属于与众不同的那一类。很好的很好的, 那种机械性的重复, 恰恰就是在表明在敷衍, 是想要去快速终结话题的一种标志。“不用管大家怎么说”表面挺你实则切断提醒你的可能性然后呈现了直白的翻译: “你此次的方案实际上做得颇为平常, 跟众人正常的做法全然不同。我懒得与你认真地展开讨论了, 反正你自认为挺有想法的, 那就依从你的想法接着去做吧, 到时候出现了问题你自行去处理。”。做完这项测试我开始理解网上有人用 AI 当职场翻译器了。然而, 有一项测试将严重问题给暴露了出来, 我们特意问了一个压根不存在的梗, 即“电子呕吐”, 可是V4的反应却是给出了洋洋洒洒一千多字的“深度解析”, 其来源、含义、使用场景以及文化解读全都涵盖在内。它讲, “电子呕吐是一个于近期在中文互联网里颇为火爆的网络流行语, 其描述的是一种于社交媒体之上的情绪发泄举动……”。V4 甚至于针对这个梗编造了两种运用方式, 一方面是人类情绪发泄, 另一方面是 AI 生成低质量内容, 乍一听有理有据, 然而唯一的问题在于, 这个梗压根就不存在。正确采取的做法, 乃是去承认自身并不了解这个说法情形, 随后推测其很有可能是新近才出现的表达样式, 进而建议给出相关上下文内容。翻译是最后的考验, 它并非简单地把一种语言转化为另一种, 而是要把中国话讲成世界能听懂、愿意去听的模样。在我们所准备的6道翻译题里头, 涵盖了政策术语方面的, 企业用语范畴的, 经典标语领域的, 成语比喻类型的, 以及长段落综合翻译的项目。而进行的这项测试, 同样不存在量化评分的情况, 不过V4的表现, 能够说是应对起来轻松自如的状态。首先来看政策术语, V4精准地运用了“新质生产力”的官方译法“new”, 它还对“新质”在政策环境里的四层意义进行了解释, 这四层意义分别是技术革命驱动, 要素的重组与跃升, 全要素生产率的提高, 先进生产力的质态, 此外提供了两种可供选择的译法以及它们的优劣比较。更具突出表现的是, 关于“绿水青山就是金山银山”的分场景对待处理方式。V4表明, 官方文件应当采用“Lucid and lush are”这是官方确定的翻译, 具有概念化、抽象化的特点, 而要是针对旅游景区宣传牌的话, 那么就能够保留“of gold and”这种具象化的比喻形式, 就像“Green hills and clear are the real gold and”这样。有这样一个词组, 在不一样的场景当中, 给出了不同的译法, 而这种对于语境的敏感, 恰恰是许多翻译模型所欠缺的。四组经过测试, 这测试是“只有中国人懂”的那种类型, 测试跑完之后, 我们察觉到一个有意思的规律, 在诗词理解这个领域, 在中文翻译等这类需要“中国心”的方面, V4展现出的表现是最强的。它确实并非是全能的, 然而对于中文而言, 确实是比大多数的对手更加懂得。03当一周牛马——开发者真实工作流实测把大模型当”赛博同事”用上一整周它会是什么样的员工这是一组测试, 是由我们设计的, 是最接近真实开发节奏的。它涵盖了完整项目周期, 从数据库设计开始, 到核心代码编写, 到Bug诊断, 到性能优化, 到包括技术文档到智能体任务。那儿涵盖八项任务, 统统交付给了V4 Pro。在此进程当中不存在标准答案以供参照, 并且没有多选题来给予容错余地, 每一行代码全部都得经受编译器以及人类评委的双重审查。结果V4 是一个代码能力溢出的工程天才。▎代码生成的绝对主场第一道题目规定 V4 去设计一个针对既包含全职, 又涵盖兼职, 还包括外包这三种类型员工的工资系统数据库 , 这份由 V4 给出的 DDL , Opus 4.7 里的各位评委径直给予其满分三连 , 其能运行的特性、具备的可读特性以及拥有的可维护特性, 全都被评定为达到 5 分。它的设计思路, 称得上是优雅的, 并非把三种员工类型进行硬编码, 而是运用字典表实施统一管理。在工资部分, 并非给每种工资项各自写一个独立字段, V4 是借助字典表以及 cture 结构表来规划的, 这堪称是教科书级别的抽象。“E”所代表的是收入, “D”所代表的是扣除, 标记是否进行计税, 这样的设计意味着, 当公司有新增一个“通讯补贴”的需求, 或者要调整计税规则时, 不需要去改动表结构, 只需要插入一条配置数据。对此, Opus 4.7评委所说的原话是, 设计这一专业, 抽象程度恰当, 同时具备可执行性以及可扩展性, 它属于一个优秀的工资计算数据库模型。工资计算核心逻辑的实现也在测试任务范围之内, 这里面需要有类型注解以及文档字符串, V4 的表现致使 Opus 4.7 评委又一次给出全部是 5 分的评判, 评语是“模块化设计出色。”。代码一开头就是规范的 定义相较于其他而言, 更能让人留下深刻印象的是, 它所运用的是抽象基类加子类继承这种架构: 将其作为 ABC 抽象基类去定义相关接口, 并且, 还有另外的、、也分别去实现各自的计薪逻辑。个人所得税计算的那一部分情形, 切实严格依照了累计预扣的方法准则, 并非是按照月份单独开展估算, 而是对Year-to-Date累计的数据结构进行了维护, 正确无误地处理了年头开始累计的数值传递。更为难得的情况是, 代码又对公积金所占比例超出界限的校验、累计下来的税负为负数时的兜底情况、浮点数精确值四舍五入等边界方面的条件做了处理, 这是具备能够直接进入代码仓库的水准。V4 的那一分差距, 是在工资单 Excel 导出的可维护性方面丢失的。这部分代码的功能达成了多 Sheet 生成, 实现了汇总表, 做到了表头加粗, 达成了数字保留两位小数, 实现了负数标红, 完成了自动列宽等等, 可谓业已完备。然而, 薪资项目仍有部分被硬编码在字典 key 和字段列表当中, 并未完全通过模板化进行配置。可以这么通俗讲, 这表明了, 当用户有新增一个“交通补贴”列这样的需求时, 就需要去修改字典key定义, 还需要修改Sheet写入逻辑, 并且要修改汇总表统计逻辑这三个地方。将它在DDL设计里所展现出的抽象功力拿来对比, 这个Excel实现的确是“偷懒”了。▎Bug 诊断比 更敏锐的眼睛要说代码生成所检验的是那种“写出来”的本事, 那么接着讲 Bug 诊断所检验的便是名为“看出来”的那种能力。我们朝着 V4 递交了其中一段个税计算代码, 并且指明了呈现出来的问题那是“个税老是相当地高”。V4 的诊断过程堪称法医级别计算应纳税所得额期间, 代码仅扣除社保、公积金, 还扣掉每月5000元基本减除费用, 却没把“专项附加扣除”扣去, “专项附加扣除”所指乃子女教育、继续教育、大病医疗、住房贷款利息、住房租金、赡养老人这些项目。到了此处, 已然属于正确答案了。然而V4并未停下, 它还另外指明了五项潜在问题, 是这些:1、对于负数应纳税所得额, 存在未处理的情况, 当收入情形是比扣除项低的时候, 原来那个代码就会计算出呈现为负数的税额。2、社保公积金基数简化——实际有上下限不能直接用全额工资3、未使用累计预扣法——按月独立计算不符合现行税法4、浮点数精度问题——没有 round(tax, 2)5、区间下界 lo 闲置——代码定义了但未使用可以简化一道”找 Bug”的题它做出了代码审查深度。▎技术文档能把代码讲清楚的人基于前面的工资计算器项目, 第八题要求产出三份文档, 分别是 、API 文档以及一份技术方案说明V4 拿到了 5, 5, 4 的这样一个成绩, 差的那一分扣在了技术选型的决策清晰度上面, 评委 Opus 4.7 觉得它“缺少与备选方案像 ORM这种例的对比分析”。然而总体来讲, 这三份文档的架构给人一种赏心悦目的感觉, 它依照了“项目结构→安装→初始化→用法”这样的黄金路径, API 文档通过表格的形式罗列出了核心函数的参数以及返回值, 技术方案说明当中涵盖了架构分层图还有扩展方向。格外值得赞许的是, API 文档里的数据示例, 并非是枯燥无味的参数列表, 却是给出了完备的输入输出样例。尤其是在团队协同合作当中, 这般文档, 可以让一个刚着手接手任务的新人, 在十五分钟里理解项目的整体面貌。评委对于 Opus 4.7 的评语十分精准恰当, 其表示, 三份文档具备完整性, 并且呈现出结构化的特征, 它们在考虑到方便新手上手的指南, 与架构方面说明的同时, 堪称一份达到高质量水准的项目交接文档。▎智能体能力完成任务但不够惊艳于智能体测试的这一部分, 所考察的乃是多步任务规划以及执行的能力。我们给予了 V4 一组针对具身智能行业动态的搜索结果, 要求它去提取其中的信息, 将其整理成为表格, 撰写趋势总结, 最终组织形成报告。V4 的得分情况是, 任务分解方面为 5 分, 工具使用方面是 4 分, 自我纠错方面得 4 分, 任务完成度方面为 5 分, 状态管理方面是 5 分。Opus 4.7 评委给出这样的评语: “整体完成质量高, 报告结构清晰、信息准确, 趋势分析具有深度洞察。”。着眼于产出质量进行考量, V4 的二百字趋势概括撰写得极为踏实: 关于当前时期具身智能相关领域融资变现出两个极为突出的特性, 一是资本朝着集中化的趋向、以及技术路径展现出差异化。头部层面所产生的效应开始呈现较明显状态, 似加速进化这一则获取了将近十亿元这般高额的资金融通……初创类型的公司依靠其专属独特的技术路线依旧能够得到资本的重视……这段分析, 从“资本集中化”这个维度切入, 又从“技术差异化”这个维度切入, 有具体公司的信息点, 有金额的信息点, 还呈现了赛道趋势的全局, 末尾时, 还点出了结构性观察, 即“清华系、中科大系等顶尖学术背景的复合型创业团队成为最大赢家”。▎一周 KPI 考核表偏科天才的绩效面谈将工作流任务跟智能体任务进行汇总一下, V4的“一周考核”成绩单显现如下:能够从综合评分当中看得出, V4在代码生成或者是诊断类别任务里展现出来的表现等同于4.8分, 已然达到顶尖层次, 另外到了文档以及智能体类别任务方面就大约是4.3 分。这组数据背后所呈现出的画像相当明晰, V4 Pro 是一位技术能力强大到几近满溢的工程天才, 你给予它确切的需求, 它能够呈上质量达到工业级水准的代码, 在实实在在的团队当中, 这样的人便是能让 CTO 视为心肝宝贝般珍视的存在, 那种无需改动就能自行得以合并整合, 架构图完全不必重新绘制即可切实付之于实际应用的能力表现。那么对于普通开发者而言这意味着什么采用V4的最优方案, 便是将需求解析成清晰、确切的子任务, 接着交付其编写代码。要是你已然明晰所欲为之事, V4或许是你所能寻觅到的最为强大的助力, 从 直至SQL, 从架构的规划设计到性能的优化提升, 它几乎是无所不能。毕竟能让法拉利跑出比亚迪油耗的全世界也没几个。04成本之仗有人比拼便宜有人重新定义贵到此为止可以算一笔账。对于 Agent 应用来讲, 将 Input 的按照 10 比 1 的比例去计算的话, 每一天消耗 100 万的输入 token, 以及 10 万的输出 token 是属于正常的量级范畴。那么按照各家而今的 API 定价去跑上一个月:于国产模型里, V4 Pro 的月成本, 是 Kimi K2.6 的约三分之一所需数额, 是 GLM 5.1 的约一半所需金额。这不算是最厉害的, V4 Flash的性能跟Pro差不多, 然而推理成本却压低到极致, 每个月成本仅仅只要$504, 这个数值是Kimi的八分之一, 是GLM的六分之一。当, 有, 一个, 极其关键, 重要, 的, 前提, 存在, 于此。V4 Pro的折扣价, 也就是75% off, 当前, 被, 标注, 为, “延续, 到, 2026/5/31”。在, 模型, 发布, 刚开始, 的时候, 官方, 便, 有, 这样, 的, 表述, “由于, 受到, 高端, 算力, 的限制”, “目前, Pro, 服务的, 吞吐, 能力, 非常, 有限”, “预计, 在, 下半年, 昇腾950超节点, 批量, 上市, 之后, 价格, 将会, 出现, 大幅度, 的, 下调。”。倘若未来国产算力能够跟得上, 那么这个价格依旧有着下降的空间, 然后同样也存在回调的可能性。不过至少在当前这个时候, 它是三家当中最便宜的顶级模型, 不存在其他情况。要是你是一位用量大的开发者, V4Pro的性价比几乎不存在对手。那么究竟是不是要将V3替换成V4, 假定你身为开发者, 则我的答案是肯定的V4相较于V3的提升并非呈现出5%那样的边际改善特质, 而实则是多个核心能力方面发生的质的变化。诗词理解能力从处于“还不错”的状况转变为达到“顶尖”水平, 代码生成能力由“能用”阶段转变成为“优秀”状态, 技术文档方面从“还行”的程度转变至为“优秀”层级。智能体能力尽管没有获取到满分, 然而其已然足够用以应对大多数的工具调用场景。而且, V4 Pro当前所呈现的折扣价格, 跟V3在当初时所具有的价格相比, 二者之间的差别并不是非常大。花费相同数额的钱财去购置更为强大的能力, 这样的交易并不会产生亏损。要是你还没法确定究竟该选用 Flash 还是 Pro, 那我的建议是先去选用 Flash。Flash 的价钱大概是 Pro 的三分之一, 不过二者能力之间的差距远比价钱之间的差距小很多。按照社区所反馈的情况来看, Flash 在非思考模式时已经能够解决超过 80%数量的日常任务, 而在思考模式下则能够涉及涵盖 Pro 90%以上份额的深度推理能力。那么, Pro适合在何时上线呢? 当你的任务要求具备极致的代码能力时, 当你的任务需要1M token级别的超长上下文来进行深度文档分析时, 当你对输出质量有着极高要求, 无法容忍“差不多”的情况时, 不然的话, Flash肯定是更具性价比的选择?回到文章开头的问题 V4 Pro 让人失望了吗或许更为关键的问题在于, 于当下的大模型较量之中, 我们该以怎样的方式去界定失望。要是你所期盼的是一款能够拳打GPT - 5、脚踢Opus, 同步支持多模态以及实时联网, 并且还能瞬间回复你每一条信息的“全能之神”, 那么这般失望几乎是必然会出现的。V4 Pro并非如此, 也没有必要成为那样的模型。可是要是你所盼望的是凭借三分之一的价钱, 获取逼近乃至超越国际顶级闭源模型的关键能力, 那么 V4 Pro 不但不会让人失意, 反倒是一回使人惊喜的交出。咱来凭借数据讲情况, 对 V4 Pro 在咱们实际测定过程里展现出的表现予以回顾:诗词理解平均 4.75/5顶尖法律引用约 4.5/5优秀翻译定性 A代码生成4.9/5顶尖技术文档4.7/5优秀智能体能力4.6/5良好这份成绩单, 放置于任何一家国产模型之上, 均可堪称亮眼。然而, 放置于一个API价格相较于竞品便宜至倍的模型身上, 便算得上是离谱了。给自己所做的定位, 也是处于一种十分清醒的状态。官方在发布的文档当中, 明确地进行了书写, 内容为: “V4 - Pro - Max在标准推理之上整体所具备的性能, 在一定程度上要略微逊色于GPT - 5.4以及 - 3.1 - Pro, 这表明它的发展轨迹大概是落后于最前沿的闭源模型三到六个月的时间。”面对如同打了鸡血一般的市场情绪, 所说出的仅仅是一句平平淡淡的话语, 即“还差一截”。那么, 存在着三到六个月的差距, 这样的差距所对应的价格差达到三到五倍, 这样的价格差它是值得的吗?究竟对于绝大多数的开发者以及企业来讲, 答案无疑是肯定的。V4 Pro于代码、文档、写作、翻译等核心生产力场景当中的切实表现, 已然是好到能够是让你对那份差距毫无印象, 心安理得地理所当然般地去省下数目可观的一大笔钱了。所以一旦你向我询问V4 Pro究竟值不值得去使用, 它在该行的环节表现得以发挥功效, 不行的部分也并未加以强行支撑硬顶, 这恰好十足是一款优质模型应该呈现出来的样子。雷峰网文章
返回列表