ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

【清华代码熊】DeepSeek V4.1 Flash 后训练详解

【清华代码熊】DeepSeek V4.1 Flash 后训练详解 上期解析了 DeepSeek V4.1 Flash 模型架构改进本期解析 DeepSeek V4.1 Flash 预训练/后训练技术 预训练45T 文本 多模态混合语料、直接训练 sparse attention取消 DeepSeek V4 的 dense 冷启动、DeepSeek-ViT 通过 contrastive pre-training autoregressive fine-tuning 两阶段预训练。 后训练复用 V4 后训练 Pipeline不引入新的后训练算法投入在数据和环境 Scaling。包括大规模 Agent 任务-环境合成、Scaffold Compute 的异步 RL Scaling、40 Teacher full-vocabulary OPD。
返回列表