
9 月 2 日周三凌晨谷歌把 Gemini 3.8 Flash 端了上来。这是六周里第三个 Flash 版本——3.6、3.7、3.8 轮流上几乎三周一版。发布当天两个消息在开发者群里传得最凶一是 DeepSWE 1.1 拿了 71%只比 Claude Opus 5 低 3 个百分点二是限时价格跟 3.7 持平输入 0.75 美元、输出 3.75 美元每百万 token大约是 Opus 5 的七分之一。我手上正好有一个跑了两周的长任务 Agent用的还是 3.7 Flash 的接入代码想着换过去能省一笔。结果模型 ID 一换控制台直接抛错thinking_level 的 minimal 档在 3.8 上已经不存在了。翻完文档才意识到这一代不是改个模型 ID 那么简单——接口在变、计费口径在变、连模型的「工作习惯」都变了。这篇把从零接入和从 3.7 迁移的完整路径写清楚最后附 3 个避坑点。发布前一天华尔街日报先放了个料谷歌内部工程师在 Jetski 平台上做编码评测时更愿意选 3.8 Flash 而不是 Anthropic 的 Opus——写代码这事内部人先投了票。发布当天Antigravity 和 Managed Agents 的默认模型也直接换成了它等于官方用行动表态Flash 档就是现在的主推。至于网上「遭全网狂嘲」的热搜嘲的不是跑分而是它「单价没涨、单任务反而更贵」的隐性涨价套路——具体数字在下面的表里。先看数据便宜在哪代价在哪先给结论3.8 Flash 不是 3.7 的简单升级而是谷歌把同一套网络「调教」得更勤快了。官方博客的原话是 works harder——遇到复杂任务时拆更细的推理步骤、反复调用工具、自己检查中间结果。好处是长程任务完成率上去了代价是 token 烧得更多。对比项Gemini 3.8 FlashGemini 3.7 FlashClaude Opus 5输入价$/百万 token0.750.755.0输出价$/百万 token含思考3.753.7525.0DeepSWE 1.1长周期软件工程71%第三方口径到过 73.7%65.3%74.0%Terminal-bench 2.1终端编码89.4%—89.1%上下文窗口1M1M—单任务 token 消耗AA 实测约 4.8 万约 3.7 万—首字延迟AA 实测平均 13.3 秒—同类中位数 2.99 秒这张表读出来的故事有两条。能力侧3.8 把与 Opus 5 在 DeepSWE 上的差距压到了 3 个百分点以内第三方口径 73.7%只差 0.3Terminal-bench 2.1 的 89.4% 甚至反超 Opus 5 的 89.1%而价格只有后者的约七分之一。成本侧Artificial Analysis 用真实任务实测同一个任务 3.8 比 3.7 多烧约 30% 的 token3.7 万 → 4.8 万单任务成本从 0.40 美元涨到 0.58 美元首字延迟平均 13.3 秒——同类模型的中位数只有 2.99 秒。翻译成人话单价没涨但「同样的活」更费 token、开口更慢。这正是网上吵翻天的「隐性涨价」说法的来源。再补一个背景帮你理解 71% 这个数字的含金量DeepSWE 1.1 考的是「给一个真实的 GitHub issue模型能不能自己端到端改完代码、跑通测试」。上一代 3.7 Flash 的成绩是 65.3%3.8 直接跳到 71%单代提升 5.7 个百分点——而 Opus 5 的 74% 是闭源旗舰堆了半年才到的位置。也就是说谷歌靠「更勤快的推理习惯」在 Flash 档上追平了旗舰档约八成的差距。网上流传的 73.7% 是第三方在更高推理档位下测出的口径官方默认口径 71%两个数字指向的结论一致和 Opus 5 只差 3 个百分点以内。价格窗口的来龙去脉也值得单独说3.7 Flash 八月发布时就把限时价砍半到 0.75 / 3.753.8 延续同价但谷歌明确标注 2026 年 12 月 31 日之后翻倍到 1.50 / 7.50。也就是说现在到年底是明牌的锁价窗口——这也是我把迁移清单里的时间点单独拎出来的原因。想了解其他几款的实测数据吗第二部分有完整的对比表格——【关注后查看完整对比】从零接入3 段代码跑通第 1 步拿 Key装 SDK在 AI Studio个人调试或 Vertex AI生产环境里建一个 API Key然后装官方 Python SDKpipinstallgoogle-genai第 2 步发出首次请求fromgoogleimportgenai clientgenai.Client(api_keyYOUR_API_KEY)respclient.models.generate_content(modelgemini-3.8-flash,contents给下面这个函数写 3 个单元测试覆盖边界条件\n\ndef parse_ts(line):\n # 从日志行里解析时间戳\n ...,config{thinking_level:low},)print(resp.text)四个要点模型 ID 是gemini-3.8-flash上下文窗口 1M token适合整仓库塞进去做分析输出上限 64K tokenthinking_level 支持low/medium默认/high三档。除了文本它还吃图片、视频、音频和 PDF 输入输出仍只有文本知识截止到 2026 年 3 月。接入时容易漏的一点模型内置了函数调用、Google 搜索、代码执行、URL 抓取等工具Agent 场景下不用自己再套一层工具层直接在请求里声明 tools 就行。第 3 步多轮对话走新交互接口sessionclient.interactions.create(modelgemini-3.8-flash)r1session.send(分析这个仓库的构建脚本找出最慢的环节)r2session.send(针对刚才的结论给一份优化清单)# 服务端保留上文传统的 generateContent 还能用但谷歌新推的 Interactions API 把多轮状态挪到了服务端靠 previous_interaction_id 续接不用再自己拼历史消息对 Agent 场景友好得多。REST 形态是 POST /v1beta/interactions非 Python 语言直接照这个端点封装即可——多轮会话的状态由服务端保存相当于把 Agent 的对话历史托管了出去。从 3.7 迁移3 步清单如果你和我一样是 3.7 Flash 的老用户迁移不是改一行 model 参数按下面 3 步走。第 1 步改掉 minimal 档3.8 把 thinking_level 的minimal档位移除了文档写得很直白请求里带 minimal 会直接报错最低只能从low起步。# 3.7 的写法3.8 上报错config{thinking_level:minimal}# 改成config{thinking_level:low}更隐蔽的变体是很多 Agent 框架把档位写死在配置模板里框架不升级的话换了模型 ID 会一直撞 400。迁移前先全局搜一遍代码和配置里的 minimal。第 2 步重算 token 预算works harder 的代价是每任务多烧约 30% token。如果你按 3.7 的用量做了成本预估记得整体乘 1.31.4延迟敏感的场景还要把首字延迟的差异算进去——13.3 秒是平均值多轮工具调用链里每一轮都要吃这个延迟。第 3 步12/31 前锁价0.75 / 3.75 是限时价2027 年 1 月 1 日起翻倍成 1.50 / 7.50。要长期跑的长任务、批处理、无人值守 Agent窗口期内迁过去等于锁住三个半月的低价。反过来谷歌明确说 3.7 会继续完整支持官方文档里有一句很实在的话不是每个工作流都需要这种强度的验证——短问答、简单工具调用这类效率型负载留在 3.7 反而更划算。3 个避坑点坑 1minimal 报错不是个例是接口变更信号。我最初以为是参数写错翻 GitHub issues 才发现 3.8 的模型卡直接指向 3.7 的架构文档——这一代是同一套网络的「行为重训」不是新架构。所以除了 thinking_level其他 3.7 专属参数也要逐个核对是否还在支持列表里别只改报错的那一个。坑 2输出价含思考 token长输出任务的账单会出乎意料。3.8 没有单独的 reasoning 计费项思考 token 和输出 token 一起按 3.75 美元计。深度推理任务里思考 token 占比经常过半跑完记得看 usage 字段里 thinking 相关的统计把真实单价算出来再决定要不要长期用。坑 3首字延迟 13.3 秒是均值不是上限。这个数字来自 Artificial Analysis 对真实任务的统计对比同类模型 2.99 秒的中位数差距接近 4 倍。交互式补全、Copilot 类场景基本劝退无人值守的 Agent 任务无所谓——反正不用人盯着等。真实任务长什么样能跑短板也明显公开实测里最有参考价值的一组来自腾讯云开发者社区 9 月 3 日的三项目实录三个全栈项目全程无人干预总花费约 30 元人民币。挑几个有信息量的细节Markdown 写作图床Express Sharp better-sqlite35 分钟开发完并跑通测试87.87 KB 的图片自动转 WebP 压到 12.13 KB压缩率 86.2%还自己实现了 SHA-256 秒传去重——重复上传直接返回原链接不占额外磁盘。3D 烟花仿真系统要求上万颗粒子维持 60 帧压测时把同屏活跃粒子拉到 4 万颗要求的 4 倍依然稳定 120 帧。3D 动画短片遇到 Canvas 导出视频只录画布、丢失 HTML 字幕的问题模型自己搭了一套双层复合录制管线把字幕和协议标签压进视频帧。跑得动、能自主解决问题这是它强的一面。短板同样清楚前端视觉表现偏弱配色和字体「AI 味」重、首字延迟明显、和国产模型比没有价格优势——同样的任务交给 GLM-5.3、Kimi K3效果未必差。另外它 6 周发 3 版迭代快得文档都有点跟不上接入时别只信博客以模型卡和 API 文档为准。还有一组数字值得放进成本语境Artificial Analysis 实测它的输出速度约 305 tokens/s在主流模型里属于快的一档——也就是说它慢在「开口」首字延迟快在「开口之后的输出」。这个特性决定了它的适用形状一次性长输出任务体验尚可多轮短交互会很难受。把「输出快、开口慢、token 烧得多」三个特征叠在一起看3.8 Flash 的画像就很清晰了它是为无人值守的长任务设计的不是为人机对话设计的。什么时候换、什么时候别换按任务类型给结论不按人分。先看一张 Flash 档横向表——把同价位的轻量档模型摆在一起选型逻辑会清楚很多模型厂商定价亮点特点Gemini 3.8 Flash谷歌输入 0.75 美元/百万 token限时价明年翻倍DeepSWE 71%、1M 上下文、长程 Agent 取向Gemini 3.7 Flash谷歌同价效率型负载官方承诺继续支持Qwen3.8-Flash阿里输入 1 元/百万 token125B 只激活 6B多模态 MoEGLM-5.3-Flash智谱定价约为 Opus 4.8 的 1/40原生多模态国产算力横向读这张表谷歌的定价策略是美元计价、全球统一国产这边是人民币计价、贴身肉搏——绝对单价上国产 Flash 档更便宜而且中文场景体验往往更好。但如果你要的是 1M 上下文加长程 Agent 稳定性3.8 Flash 的限时价窗口反而是当下值得先锁的。具体怎么选换长程 Agent 无人值守任务、批量代码审查、高吞吐离线任务。这类任务吃满 1M 上下文和 64K 输出对首字延迟不敏感还能在 12/31 前锁住限时价。先别换低延迟交互场景补全、聊天、IDE 内联前端视觉要求高的任务已经在国产生态里跑得好好的负载——GLM-5.3-Flash 用 1/40 的价格、Qwen3.8-Flash 输入只要 1 元/百万 token性价比不见得输。折中把 3.7 留着跑效率型负载3.8 只切给验证型任务跑两周对比 usage 数据再决定要不要全量迁。最后说点看法。旗舰模型在拼能力上限Flash 档在拼「每分能力花多少钱」——3.8 Flash 最值得注意的信号不是跑分而是谷歌把 Antigravity 和 Managed Agents 的默认模型都换成了它等于官方自己用脚投票。但对开发者来说换模型的正确姿势永远是先算自己的 token 账别只盯着单价表。Artificial Analysis 的智能指数里它排在 636 个模型的 27 位左右是「性价比梯队」的尖子不是「能力天花板」——想清楚你要的是哪个再动手不迟。延伸阅读Claude Code 额度缩水 17%9/14 生效前4 款 AI 编程工具成本横评DeepSeek V4 Pro 正式版上线DeepSWE 7.3→62.7 的 Agent 实测3 步迁移 API 8/17 涨价前省钱清单Grok 4.6 API 接入踩坑实录价格砍半是真的但 5 个坑让我多花了 3 倍钱系列文章Qwen3.8-Flash 实测125B 只激活 6B输入 1 元/M4 个场景验证多模态 MoEGLM-5.3-Flash 正式版迁移踩坑免费窗口今天截止1/40 的价格也有 5 个坑匿名模型 OX Alpha 横评DeepSWE 80% 反超 Fable 5 与 GPT-5.6 Sol免费窗口最后 2 天GLM-5.3 vs Fable 5 vs GPT-5.6 Sol6 项基准横评743B 国产编程模型的正面硬刚看完有收获点个关注 我会持续分享更多AI编程实战教程。