ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

DeepSeek V4.1 Flash 发布,便宜和缓存才是重点

DeepSeek V4.1 Flash 发布,便宜和缓存才是重点 9 月 10 日DeepSeek 上线了 V4.1 Flash。按官方说法这是他们新模型结构系列里尺寸最小的一款但在基准测试里超过了自家的 V4 Pro价格还往下调了一档。对写代码的人来说参数和榜单都不是重点真正要记的就两件事模型名换了计费口径也换了。这次到底改了什么V4.1 Flash 是个 552B 参数的 MoE 模型用的是新的 Causal-Encoder-Decoder 结构输入和输出不对称输入激活 8B输出激活 16B。MoE 本身不新鲜非对称激活才是这次的看点。可以粗略理解成读进来的那部分长上下文、文档、图片走轻一点的通道生成出去的那部分走重一点的通道。参数总量还是 552B但每次调用真正被调动起来的只有一小块成本也就压下来了。参数量大不等于贵这两个账要分开算。另一处改动在缓存。官方称新一代模型把 KV Cache 压得很厉害对 HBM 的需求降到上一代的四分之一对 SSD 的需求降到八分之一相对初代模型整体缩小了 437 倍。这个数字很技术但翻译成开发者的语言就是跑 Agent、长上下文、RAG 这类反复喂同一段前缀的任务账单会明显不一样。没变的东西也得说清楚。还是峰谷定价还是同时给 OpenAI 格式和 Anthropic 格式的接口Tool Calls、JSON Output、对话前缀续写这些照旧上下文 1M、最大输出 384K。换句话说从旧模型迁过来基本就是改个model名的事没什么迁移成本。有一处值得单独拎出来官方公告说 9 月 14 日 12:00 之后访问deepseek-v4-pro的请求会全部路由到 V4.1 Flash但价格页后来更新了一条说明为响应用户需求9 月 14 日之后继续提供 V4 Pro 的 API 服务计费方式不变。两天里口径变了一次。这说明上游的下线计划是会改的别把模型名硬编码进业务逻辑。价格和两个坑按官方文档V4.1 Flash 的价格元 / 百万 tokens大致是这样项目空闲时段高峰时段输入缓存命中0.020.04输入缓存未命中12输出48高峰时段是工作日 9:00–12:00、14:00–18:00其余都算空闲闲时价格是高峰的一半。看懂这张表就抓住了两个能省钱的地方也是两个容易踩的坑。第一个坑是缓存。输入命中缓存 0.02 元没命中 1 元差 50 倍。缓存是按前缀匹配的所以那种每次都把 system prompt、工具定义、大段参考文档塞在最前面的写法只要前缀稳定就一直在命中反过来如果你习惯每次微调一下提示词开头、或者把时间戳拼在最前面缓存就永远命不中钱按 1 元那一栏走。把不变的放前面、变的放后面是这类接口最实际的优化。第二个坑是时段。输出价格闲时 4 元、高峰 8 元一堆不急的任务跑评测、批量标注、离线数据清洗、文档摘要完全可以挪到晚上或周末再跑账单直接对半。官方做峰谷定价本意就是让你错峰那就不用客气。调用本身很简单用 OpenAI 兼容的 SDK 改个模型名就行fromopenaiimportOpenAI clientOpenAI(api_key你的key,base_urlhttps://api.deepseek.com)respclient.chat.completions.create(modeldeepseek-flash,messages[{role:system,content:你是一个日志分析助手。},{role:user,content:把这段日志里的报错按类型分组。},],)print(resp.choices[0].message.content) 旧模型名 deepseek-v4-flash、deepseek-v4-flash-vision-exp 目前还能调但请求会由 V4.1Flash 提供服务并按 Flash 计价。也就是说兼容是暂时的趁早把配置里的名字改掉。 还有一点别被开源两个字带偏。模型权重确实挂出来了但官方自己说大规模部署需要 2k 卡 GPU 加存储集群这个门槛不是普通团队够得着的。对绝大多数人和小团队来说直接用 API 更划算。 顺带一提并发上限从 V4 Pro 的500提到了2500。对做批量任务的人来说这比价格更实在——以前要排队限流的活儿现在能一次推上去。 便宜一半的钱代价是把任务挪到半夜跑这笔账你算不算评论区聊聊。
返回列表