ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

DeepSeek V4 终于“看见”了:首个视觉实验模型开源,真正看点不只是识图

DeepSeek V4 终于“看见”了:首个视觉实验模型开源,真正看点不只是识图 DeepSeek-V4-Flash-Vision-Exp是 DeepSeek V4 家族的首个视觉实验模型。近日这款模型率先上线 API到了 8 月底模型权重、提示词编码和参考推理实现也一并公开采用 MIT 许可证。从名字看这似乎只是给 V4-Flash 加上一双眼睛。但如果仔细看 DeepSeek 公布的能力和案例就会发现这次更新的重点并不是普通的图片问答。它更想解决的问题是当图片、图表、网页和软件界面进入任务后模型能不能继续推理、调用工具并把事情做完01 不只是看图而是看完之后继续干活过去的 DeepSeek-V4-Flash 已经能处理编程、推理和工具调用任务但它主要生活在文本世界里。遇到网页截图、报错画面、数据图表或者设计稿时往往需要另一个视觉模型先把图片翻译成文字再交给 Agent 继续处理。Vision-Exp 把视觉理解直接接进了模型本身。它支持 JPEG、PNG、GIF 和 WebP可以描述图片、读取截图中的文字、分析图表也能同时接收文字和多张图片。于是一些原本需要多模型配合的任务就有机会在同一个 Agent 工作流里完成。比如它可以先看一张报错截图再去检查相关代码也可以读懂一张数据图表找出异常后继续调用工具分析还可以对照设计稿修改前端页面并通过截图检查最终效果。这正是视觉模型和多模态 Agent之间的区别。前者回答图里有什么后者还要理解这张图在整个任务里意味着什么以及下一步应该做什么。DeepSeek 在发布页中放出了几个网页生成案例长篇旅行主题页面、带动画的产品网站以及包含 3D 元素的交互页面。单看几个演示当然无法证明模型面对所有前端任务都足够稳定但它们清楚地展示了 DeepSeek 的方向——视觉能力要进入 Agent 的行动链而不是停留在聊天框里的看图说话。02 成绩很亮眼接近 Opus 4.8要怎么理解DeepSeek 把这次公布的测试分成了两组文本 Agent 和多模态 Agent。先看文本能力Vision-Exp 在 Terminal Bench 2.1 上拿到 83.9上一版 V4-Flash-0731 是 82.7NL2Repo 从 54.2 提升到 57.7DeepSWE 从 54.4 提升到 59.3Toolathlon-Verified 则从 70.3 提升到 75.9。并不是每一项都上涨。Cybergym 从 76.7 小幅回落到 75.3AutomationBench 也只从 25.1 微升至 25.7。整体看加入视觉模块之后它至少守住了 V4-Flash 原有的文本、编程和工具使用能力没有出现明显的顾此失彼。多模态部分更有意思在 ApexBench Pass1 上Vision-Exp 得到 36.5Opus 4.8 为 39.4Chartography 分别是 64.3 和 65.0两项已经非常接近。在 Agents’ Last Exam 和 ZeroBench 上Vision-Exp 还分别以 27.3 和 35.0略高于表中的 Opus 4.8。DATA · 核心增量速览Terminal Bench 2.182.7 → 83.9NL2Repo54.2 → 57.7DeepSWE54.4 → 59.3Toolathlon-Verified70.3 → 75.9不过如果把整张表一起看就不能简单得出DeepSeek 已经全面追平 Opus 4.8的结论。DeepSeek 公布的 11 项测试中Vision-Exp 在 DeepSWE、Agents’ Last Exam 和 ZeroBench 三项领先其他多数项目仍然落后。尤其是 NL2Repo双方是 57.7 对 69.7DSBench-Hard 则是 63.6 对 71.7差距依然明显。还有一个容易被忽略的细节在 ApexBench 和 Agents’ Last Exam 中纯文本版 V4-Flash 会直接忽略任务里的多模态信息。所以 Vision-Exp 在这两项上的提升部分来自以前看不见、现在看得见并不是完全对等条件下的能力跃升。要点Vision-Exp 已经挤进了前沿多模态 Agent 的竞争区间但它在真实任务里究竟有多稳还得等更多开发者把模型跑起来再看。03 305B 参数视觉能力是怎么加进去的DeepSeek 还没有为 Vision-Exp 模型建立在 DeepSeek-V4-Flash 架构之上增加了视觉编码器和对齐模块并经过持续训练。视觉编码器先从图片中提取信息对齐模块再把视觉特征转换成语言模型能够理解的表示。经过这一步图片就能和文字、推理过程以及工具调用进入同一条生成链路。公开权重的统计规模约为 305B 参数。作为参照此前的纯文本 V4-Flash 为 285B 总参数每个 token 激活约 13B。Vision-Exp 的具体激活参数量并未单独公布所以不能直接把纯文本版本的13B 激活套到它身上。它的语言模型部分继续采用 MoE也就是混合专家架构。模型虽然拥有大量参数但处理每个 token 时只会调动一部分专家。公开配置中共有 256 个路由专家每个 token 选择其中 6 个参与计算。这也是Flash最容易被误解的地方它说的是计算效率不是模型很小。Vision-Exp 还保留了 DFlash 注意力、Hyper-Connections 和 DSpark 推测解码等 V4 架构。简单来说它们分别服务于长上下文效率、深层网络中的信息传递以及生成速度。普通用户不需要记住这些名词只需要知道DeepSeek 正在尝试用更少的实际计算和缓存开销驱动一个总体规模依然庞大的模型。04 100 万上下文一张图最多 384 个 tokenVision-Exp 支持 100 万 token 上下文最大输出长度为 384K并保留思考与非思考模式、工具调用、JSON 输出、Responses API以及兼容 Anthropic 的接口。它处理图片的方式也颇为克制。较大的图片会被等比例缩小到大约 800×800 的总像素规模每张图最多转换成 384 个 token较小的图片则可能被放大。单次请求最多可以提交 600 张图片但仍然会受到文件大小和请求体积的限制。384 个 token 的上限意味着图片输入不会迅速吞掉上下文批量处理截图的成本也更低。代价是极小文字、密集表格和高分辨率细节可能在压缩中丢失。因此它很适合常规网页截图、图表和页面设计但面对复杂工程图、医学影像或者满是小字的超大表格时仍然需要裁剪、分块和人工复核。支持原图输入并不代表模型真的会把原始分辨率里的每一个细节都完整保留下来。API 端没有为视觉能力额外加价费用与 V4-Flash 相同。按当前非高峰价格缓存未命中的输入为每百万 token 0.22 美元输出为 0.66 美元图片转换出的 token 和文字一起计费。对于需要批量处理截图、图表或页面的 Agent 应用这个价格会相当有吸引力。05 Flash很快但不等于普通电脑随便跑开放权重之后开发者可以研究模型也可以尝试私有部署。但约 305B 的体量决定了它仍是一款硬件门槛很高的模型。DeepSeek 给出的 vLLM 方案使用单节点 4 张 GB300并做四路张量并行SGLang 示例同样采用 TP4同时开启 DSpark。即使部分权重已经使用 FP8、FP4 等低精度格式完整模型也不是一张消费级显卡能够轻松承载的。社区量化版本可能继续降低内存要求一些统一内存设备也有机会把模型加载起来。但能够启动和能够以合理速度、长上下文稳定运行完全是两回事。特别是把上下文拉到几十万乃至上百万 token 后缓存和计算压力还会进一步增加。模型名称最后的 Exp 同样不能忽略。它明确告诉使用者这是实验版不是已经经过充分生产验证的稳定版本。推理框架的适配、不同图片类型下的可靠性、长任务中的错误累积以及视觉输入带来的新安全问题都还需要时间检验。06 DeepSeek 补上的不只是一双眼睛DeepSeek-V4-Flash-Vision-Exp 的意义不是让功能列表里多出一个识图而是让 DeepSeek 的 Agent 开始走出纯文本环境。从官方成绩看它基本保住了 V4-Flash 的文本和编程能力又把图片、图表与界面接进了工具工作流在部分多模态 Agent 测试上它已经接近甚至略高于 Opus 4.8。每张图片最多 384 个 token、百万上下文以及和 Flash 相同的 API 价格也让它在批量视觉任务中有了很强的成本吸引力。与其急着给它贴上超越谁的标签不如把这次开源看成一个信号DeepSeek 已经把下一阶段的重点放在了多模态 Agent 上。当模型不再只是读懂文字而是能够看见界面、理解图表、检查结果并继续操作工具时所谓 Agent 才真正开始接触现实世界。Vision-Exp 是 DeepSeek 朝这个方向迈出的第一步。它是不是足够稳、能走多远还要交给接下来的真实使用来回答。模型下载OpenCSG 社区https://opencsg.com/models/deepseek-ai/DeepSeek-V4-Flash-Vision-ExpHugging Face 社区https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-ExpOpenCSG vs 魔搭如何选择维度OpenCSG/CSGHub魔搭/ModelScope平台定位企业级 AI 资产管理中心面向开发者和 AI 社区的 MaaS 平台本地部署一套模型资产管理平台本身偏向模型、SDK 和工具链的本地使用私有化/离线明确支持私有化部署、离线运行支持下载、本地缓存、本地训练/推理开源情况平台型产品本身SDK 和大量工具链项目管理能力模型、数据、代码、应用的统一资产治理管理模型使用链路模型部署和推理使用模型部署和推理使用在魔搭、OpenCSG 等模型社区中均可实现但 OpenCSG/CSGHub 的核心在于它不只是让模型跑起来而是进一步支持企业把模型、数据集、代码和应用等 AI 资产放到本地、内网或离线环境中统一管理。它解决的不只是模型怎么部署、怎么调用的问题更是模型进入企业后如何被安全管理、版本沉淀、权限控制和持续运营的问题。对于企业来说CSGHub 可以帮助构建自己的私有模型资产中心降低对外部平台的依赖对于个人开发者来说也可以用更系统的方式管理模型、实验项目和 AI 应用流程。相比更偏向模型发现、体验和使用入口的魔搭CSGHub 更适合那些希望把 AI 能力真正沉淀下来并长期维护、持续迭代的用户。关于 OpenCSGOpenCSG 是全球领先的开源大模型社区平台致力于打造开放、协同、可持续生态。AgenticOps 是人工智能领域的一种 AI 原生方法论由 OpenCSG开放传神提出是 Agentic AI 的最佳落地实践也是方法论。核心产品 CSGHub 提供模型、数据集、代码与 AI 应用的一站式托管、协作与共享服务具备业界领先的模型资产管理能力支持多角色协同和高效复用。
返回列表