ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

Ornith-1.5 自我改进范式深度剖析:任务生成、脚手架与 Rollout 联合强化学习如何炼出 397B 旗舰

Ornith-1.5 自我改进范式深度剖析:任务生成、脚手架与 Rollout 联合强化学习如何炼出 397B 旗舰 Ornith-1.5 自我改进范式深度剖析任务生成、脚手架与 Rollout 联合强化学习如何炼出 397B 旗舰【免费下载链接】Ornith-1.5-397B项目地址: https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-397BOrnith-1.5-397B 是 ornith-ai 团队推出的自我改进路线旗舰开源大模型它不再依赖人工设计的固定任务集与脚手架而是让模型自己生成训练任务、搭建解题脚手架Scaffold、推演解法Rollout并用强化学习把这三件事联合优化形成端到端的自我改进闭环。本文面向新手完整解析这套自我改进范式、397B MoE 架构的关键参数、基准测试成绩单以及如何快速部署这个 262K 长上下文推理模型。什么是 Ornith-1.5 的自我改进范式传统大模型后训练的常见做法是人工整理一批高质量任务 → 人工设计一套评测/解题脚手架 → 模型在其中反复做题Rollout并接受强化学习信号。这套流程的天花板受限于人任务库会枯竭脚手架也会过时。Ornith-1.5 的做法是把闭环中的每一环都交给模型自己环节传统做法Ornith-1.5 自我改进做法任务人工策划固定任务集模型持续生成新的训练任务脚手架人工设计 harness/提示框架模型自行构建与演化解题脚手架解法固定环境里做 rollout模型在自搭环境中推演 rollout 并接受奖励三者不是各自独立优化而是联合优化生成的任务决定模型要学什么脚手架决定模型怎么解题rollout 的成败又作为奖励信号反哺策略更新。模型能力越强生成的任务越难、脚手架越巧妙于是形成越练越强的飞轮。这正是 Ornith-1.5 官方论文标题所说的From Self-Scaffolding to Self-Improvement。 值得注意的是Ornith-1.5 并非凭空出现它在 Ornith-1.0基于 Qwen3.5 与 Gemma4经继续预训练、中期训练与后训练构建之上把自我改进闭环从脚手架 Rollout 优化扩展到了任务生成 脚手架构建 解法 Rollout的全链路联合强化学习。对比成绩可见效果DeepSWE 从 1.0 的 8 分跃升到 56 分Terminal-Bench 2.1 从 77.5 提升到 86.1。397B 旗舰的架构要点新手版Ornith-1.5-397B 是一个约 397B 参数的混合专家MoE模型bf16 精度下约 800GB 权重。打开模型配置 config.json 就能看到几个关键数字512 个专家每 token 只激活 10 个num_experts: 512、num_experts_per_tok: 10——总容量大、单步计算小推理性价比是 MoE 的核心优势60 层 Transformer其中每 4 层有 1 层用全注意力、其余 3 层用线性注意力full_attention_interval: 4大幅降低长上下文的显存与计算开销262,144256Ktoken 原生上下文配合 YaRN 缩放最高可延展到约 1M token原生多模态视觉编码器配置vision_config与图像/视频 token 支持可处理图文与视频输入MTP 多 token 预测头独立的 model-mtp.safetensors 文件保存了 1 层 MTP 结构用于推理加速。它同时是一个推理reasoning模型默认会先在think…think块内输出思考链再给出最终答案服务端会将思考链解析为独立的reasoning_content字段tool_call块则解析为 OpenAI 风格的tool_calls。对话行为由 chat_template.jinja 定义默认采样参数写在 generation_config.json 中。成绩单Ornith-1.5-397B 基准测试一览所有结果均取 5 次独立运行的平均值详见 README.md基准类别Ornith-1.5-397BOrnith-1.0-397B同级参照Terminal-Bench 2.1终端编码86.177.5Claude Opus 4.885SWE-bench Verified软件工程8682.4GLM-5.283DeepSWE深度 SWE56.08Claude Opus 4.859HLE无工具高难推理44.630.2GPQA Diamond92.8MCP-Atlas工具调用8076.4Claude Opus 4.882.2Toolathlon-Verified智能体工具71.243.2GLM-5.248.2BrowseComp联网检索86.679.7GLM-5.285.6可以看到两个亮点一是编码与智能体能力对标闭源旗舰Terminal-Bench 2.1 达到 86.1与 Claude Opus 4.8 同档二是相比自家 1.0 版本DeepSWE56 vs 8和 Toolathlon71.2 vs 43.2的跃升幅度正是自我改进范式练得越多越强的直接证据。如何部署 Ornith-1.5-397B 推理服务397B MoE 权重约 800GBbf16需要多卡部署。官方配方以单机 8 路张量并行如 8× H200 141GB为例小显存环境可改用 FP8/INT4 量化版。先获取模型权重git clone https://gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-397B运行时版本要求Transformers ≥ 5.8.1、vLLM ≥ 0.19.1、SGLang ≥ 0.5.9。以最常用的 vLLM 为例vllm serve ornith-ai/Ornith-1.5-397B \ --served-model-name Ornith-1.5-397B \ --host 0.0.0.0 --port 8000 \ --tensor-parallel-size 8 \ --max-model-len 262144 \ --enable-auto-tool-choice --tool-call-parser qwen3_xml \ --reasoning-parser qwen3 \ --trust-remote-code启动后它就是标准的 OpenAI 兼容接口任何OpenAISDK 改一下base_url即可调用工具调用、流式输出开箱即用。推荐采样参数与长上下文配置日常任务temperature0.6、top_p0.95、top_k20复现官方基准temperature1.0超长上下文若单任务输入输出超过 262K可在config.json中加rope_scalingYaRNfactor: 4.0original_max_position_embeddings: 262144把窗口扩到约 1M。注意 YaRN 是静态缩放只对真正需要超长上下文的场景开启且factor按目标窗口折算例如 524K 窗口用factor: 2.0更合适。小结为什么这套范式值得关注Ornith-1.5-397B 证明了一件事大模型的能力上限可以不只靠堆数据和堆算力而是靠一个会自我升级的训练闭环。任务生成、脚手架构建与 Rollout 三者联合强化学习让模型既会出题、又会搭台、还会演戏——这正是从 Ornith-1.0 到 1.5 之间DeepSWE 从 8 分涨到 56 分背后的机制。对于想跟进自我改进大模型方向的开发者这套 397B 旗舰的权重、配置与推理配方都已完整开源值得亲自跑起来感受它的编码与智能体能力。【免费下载链接】Ornith-1.5-397B项目地址: https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-397B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表