ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

9 月 2 日 AI 格局日报:Harvey 倒戈 Kimi K3、Fable 5.1 缓存读降价 75%、Hy4 极量化压到 214GB、视觉 Apache 2.0 阵营成形

9 月 2 日 AI 格局日报:Harvey 倒戈 Kimi K3、Fable 5.1 缓存读降价 75%、Hy4 极量化压到 214GB、视觉 Apache 2.0 阵营成形 一、今日头条总览时间事件影响力01:00DeepSeek V4-Flash-Vision-Exp 权重上线 Hugging Face★★★★06:00Tencent Hy4 preview 极量化轻量版发布并开源★★★★09:00Anthropic Claude Fable 5.1 / Mythos 5.1 正式发布★★★★★12:00Vals AI 独立评测 Fable 5.1综合 67.87% 第 1★★★14:00Harvey 发布 Tenet以 Kimi K3 为法律 AI 新基座★★★★★18:00Claude Code 2.1.257 切换默认 Fable 模型至 Fable 5.1★★★二、深度展开5 件事的连环意义2.1 Harvey 倒戈 Kimi K3法律 AI 的范式翻转发生了什么估值 110 亿美元、OpenAI/Sequoia/a16z 共同投资的美国法律 AI 独角兽 Harvey发布全新法律专用模型Tenet。它不再深度绑定 OpenAI 或 Anthropic API而是以中国月之暗面 Moonshot AI 的 Kimi K3 为基座2.8T 总参 / 50B 激活。关键数据基准TenetClaude Fable 5GPT-5.6 SolHarvey LAB full task pass rate19.7%11.5%2.5%APEX Agents企业法律74.0%67.4%60.3%Kimi K3 在 LAB-AA Pass rate94.6%第一第二—为什么重要Harvey 通过 1,750 个自建法律任务环境 异步强化学习把 Kimi K3 训练成 Tenet。仅用了 150 张 B300 和 2 个月时间。这是一份可被任何垂直 AI 创业公司复制的剧本。信号解读不是单点事件——CursorK2.5、DevinK2.7、CosineK2.6、Thinking MachinesDeepSeek V3 Kimi K2.5 合成数据、Thomson Reuters中国开源基座……6 个月内不同版本 Kimi 已被海外公司依次采用。Kimi 已成美国 AI 应用的事实工业原料。 详见今日第三篇文章《DeepSeek-V4-Flash-Vision-Exp 开源与 Harvey 选 Kimi K3》。2.2 Anthropic Claude Fable 5.1缓存读降价 75%、Terminal-Bench 4.0 击穿 Opus 5发生了什么Anthropic 发布 Claude Fable 5.1 与同规格受限版 Mythos 5.1。输入输出单价未变仍 $10/$50 每百万 token但缓存读从 $1 美元降到 $0.25 美元-75%。账单降幅负载类型降幅典型负载Claude Enterprise / Claude Code / API~25%高度 Agent 化工作负载context-heavy、tool-heavy~45%核心能力跑分基准Fable 5.1Fable 5Opus 5GPT-5.6 SolTerminal-Bench 4.055.8%42.0%52.3%37.3%Terminal-Bench-Science52.6%24.7%29.0%22.4%CursorBench 3.2.073.4%70.5%70.0%67.2%AutomationBench31.4%17.1%26.9%19.6%编程 Agent 主基准首次超过 Opus 5。科研基准Terminal-Bench-Science一代内翻倍。企业侧同步推出 EFSEnterprise Frontier Safeguards让企业把数据留在自有云Anthropic 仅做安全分类器检查。这是针对 OpenAI 两周前发布的 Private Safety Processing 的直接回应——也是对 Fable 5 强制 30 天留存引发 ZDR 客户流失的修复。科研侧两个工程级用例金星地形重建拿 NASA 麦哲伦号 1990 年代的雷达数据训练神经网络把覆盖范围推至金星 1/3分辨率从 10-20 km 提到 2-3 km蛋白质设计12 靶点命中率接近 50%行业典型 10-15%3 个靶点上亲和力比最佳参赛作品高 10 倍被低估的细节API 调用者有三个破坏性变更需要立即自查——不再支持强制工具调用tool_choiceany会返回 400thinking block 认模型、单向兼容Fable 5.1 之后静默丢弃早期 thinking block改动历史会让 thinking block 失效8 月 31 日后创建账户强制执行 详见今日第一篇文章《Claude Fable 5.1缓存读降价 75%、Terminal-Bench 4.0 击穿 Opus 5》。2.3 腾讯混元 Hy4 preview 极量化1.5TB 压到 214GB、Apache 2.0发生了什么腾讯混元发布 Hy4 preview 极量化轻量版权重从接近 1.5TB 压缩到 214GB。这是 2026 年国产大模型里少有的 Apache 2.0 协议 极量化组合。核心技术Sherry 稀疏三值量化四权重一组用 5 比特编码平均 1.25 bitMIX-STQ1_0 混合精度策略敏感层 IQ2_XXS2.06 bit、不敏感层 STQ1_01.31 bitprima.cpp 异构推理4090 笔记本 4×A4000 服务器跨节点跑 1.02 token/s比单机 offload 快约 6 倍精度损失基准BF16 原版1.25 bit 轻量版损失MCP Atlas83.783.2-0.5SWE-Bench multi82.981.3-1.6长上下文检索100%99%几乎不掉为什么重要把 770B 大模型的本地部署硬件预算从8×B300 数据中心拉到4-5 万 RMB 主机。MoE 模型的极量化范式开始确立。 详见今日第二篇文章《腾讯混元 Hy4 preview 极量化1.5TB 压到 214GB》。2.4 DeepSeek V4-Flash-Vision-Exp305B 多模态 / MIT / 4.6% 激活率发生了什么DeepSeek 把 V4 系列首款多模态模型 V4-Flash-Vision-Exp 以MIT 协议开源。305B 总参 / 13B 激活激活率仅 4.6%业内已知最低之一。核心能力多模态基准V4-Flash-Vision-ExpClaude Opus 4.8ApexBench Pass136.539.4Chartography64.365.0Agents’ Last Exam27.3反超25.7ZeroBench Pass535.0反超34.0关键设计取向模型的眼睛不是给人类看的是给 Agent 用的——主攻让模型读取网页截图、软件界面、图表后调用工具。开源内容模型权重、Tokenizer、Prompt Encoding 参考实现、最小化 PyTorch 推理实现——含视觉编码器、Aligner、DFlash Attention、MoE、Hyper-Connections、DSpark 等核心模块。发布当天 Hugging Face 上已经出现7 个社区量化版本覆盖 llama.cpp、LM Studio、Ollama 等框架。2.5 视觉 Apache 2.0 / MIT 阵营正式成形今天 Hy4 previewApache 2.0与 DeepSeek V4-Flash-Vision-ExpMIT同日开源意味着中国大模型正式成为视觉 多模态 Apache 协议的开源标准制定者Kimi K3自定义协议DeepSeek V4-Flash-Vision-ExpMIT腾讯混元 Hy4 previewApache 2.0阿里 Qwen 3.8Apache 2.08/28 发布智谱 GLM-5.3Z.ai 自定义许可证月之暗面 Moonshot K3自定义许可短期看视觉层开源标准的最终赢家还要靠社区分发与商业生态的反馈。中期看这是中国大模型从也发布开源模型到主导开源生态的转折点。三、政策面与生态面3.1 中国 AI 标识办法 9 月 1 日正式施行生成式 AI 内容必须添加显著标识服务提供者应当按照《互联网信息服务深度合成管理规定》开展预训练、优化训练数据标注文本、图片、音频、视频、虚拟场景等全部覆盖详见 9 月 1 日专栏日报。3.2 韩国 AI for All 全民免费 AI 计划9 月 1 日公布每位国民 1 万韩元额度推动 AI 在公共部门的全面应用3.3 Anthropic 与 OpenAI 同时提交不公开上市申请文件Anthropic 最快有望于今年秋季完成上市。OpenAI 推迟至 2027 年。在上市窗口临近之际Fable 5.1 与 EFS 是 Anthropic 抢占企业市场份额的关键动作。3.4 Claude Code 2.1.257 切换默认 Fable 模型Claude Code 默认 Fable 模型切换至 Claude Fable 5.1不再自动放行 container-escape moves容器逃逸尝试——Fable 5.1 的安全护栏在编程工具侧立刻启用。3.5 Vals AI 独立评测 Fable 5.1综合指数67.87%51 个模型里排第 1单次测试成本 $28.40耗时 72 分 25 秒强项ProofBench v1.1 100%、MMLU Pro 92.38%、MMMU Pro 90.64%弱项Harvey 法律智能体 6.67%55 个模型第 18、SAGE 48.53%第 25——生物/网络安全护栏偏保守主动放弃四、对各类读者的今日建议4.1 企业 CTO / AI 战略负责人短期Anthropic Fable 5.1 已发布立即用 cost calculator 评估自己的 8 月账单确认能否受益 25-45%评估 V4-Flash-Vision-Exp 在自己多模态场景下的可行性——MIT 协议商用零成本中期EFS 与 OpenAI Private Safety Processing 做正面对比决定数据主权路径考虑双基座备份中文 Kimi K3 西方 Claude/GPT降低单一供应商依赖4.2 创业公司 / 独立开发者立即行动下载 DeepSeek-V4-Flash-Vision-ExpMIT7 个量化变体可选下载 Tencent Hy4 preview 214GB 极量化版Apache 2.0跑自己的业务基准1-2 周决定是否替换主力开源模型4.3 垂直 AI 创业者 / SaaS 公司认真考虑基座外包范式Harvey Tenet 模板可复制基座选择权重能力对齐 成本 协议MIT/Apache 2.0 优于自定义 数据合规后训练基础设施≥100 张 B3002 个月 1,000-10,000 任务环境4.4 模型评测与研究者注意 Anthropic 的护栏记 0 分评测口径关注多模态 Agent 基准ApexBench、Agents’ Last Exam、ZeroBench成为新的真实战场Vals AI 等独立评测与厂商自评的差距是研究富矿4.5 普通开发者不要立刻替换主力模型——今天发布的三件事都在快速变化期建议等 2-4 周看社区反馈持续跟进 Anthropic EFS 与 OpenAI Private Safety Processing 的实际落地差异关注 prima.cpp / llama.cpp / AngelSlim 等开源推理框架的异构能力进展五、本周关键时间节点日期事件备注9/2本日日报—9/3明天Sakana Namazu 预计发布日本独角兽新模型9/3明天Qwen 3.8 27B 预计发布阿里中量级更新9/5Ling 3.0 Tiny、Muse Spark 1.2、Muse Spark 1.2 Contributor三家同日9/8Agnes-2.5-Flash、Muse Glimmer 30B、Daybreak Blue—9/11Grok Imagine Image 2.0xAI 多模态新版9/12ByteDance Seed: Seed 2.1 Turbo字节跳动主力六、值得订阅的跟踪源AI/TLDR (ai-tldr.dev)每日 AI 模型/工具更新Hugging Face Daily Papershttps://huggingface.co/papers开源模型与论文GitHub Trending每日看 prima.cpp / llama.cpp / AngelSlim 等工具热度Anthropic / OpenAI / DeepSeek 官方 X 账号原厂信息源Race to AGIracetoagi.org综合分析21 世纪经济报道商业化与监管角度
返回列表