ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

NVIDIA Cosmos 版本发布节奏与模型资产演进指南(v0.1 → v1.0)

NVIDIA Cosmos 版本发布节奏与模型资产演进指南(v0.1 → v1.0) NVIDIA Cosmos 版本发布节奏与模型资产演进指南v0.1 → v1.0【免费下载链接】cosmosNVIDIA Cosmos is an open platform of world models, datasets, and tools that enables developers to build Physical AI for robots, autonomous vehicles, smart infrastructure, and more.项目地址: https://gitcode.com/GitHub_Trending/cosmos7/cosmosNVIDIA Cosmos 是一个面向 Physical AI 开发者、以世界基础模型World Foundation Model, WFM为核心的开源平台涵盖预训练模型、推理脚本与基于 NeMo Framework 的后训练脚本。本文以仓库根目录 RELEASE.md 定义的版本发布节奏为主线完整梳理 v0.1 与 v1.0 两个版本各自发布的模型资产、能力定位与仓库内对应的推理/后训练入口并结合 release_notes/v1p0.md、release_notes/v0p1.md 与模型模块源码帮助开发者快速理解哪个版本发布了什么、对应哪个模型、如何在本仓库中跑起来为后续选型与二次开发建立清晰的版本心智地图。版本发布节奏总览RELEASE.md 用一张发布节奏表定义了 Cosmos 平台当前的版本演进本文档是理解整个仓库模型资产组织的版本索引VersionDescriptionDatev1.0Initial diffusion and autoregressive WFMs release2025-01-06v0.1Initial tokenizer release2024-11-06从发布节奏可以看出 Cosmos 平台的两阶段演进路径v0.12024-11-06首发布局底层视觉基础组件即图像/视频神经 Tokenizer 套件为后续 WFM 提供高效的连续/离散视觉表示v1.02025-01-06在 Tokenizer 基础上发布完整的扩散Diffusion与自回归Autoregressive世界基础模型WFM覆盖 Text2World、Video2World 两大生成范式。v1.0 之后仓库仍在持续迭代release_notes/v1p0.md 记录了 2025 年 1 月的三次演进01/06 初始发布、01/09 通过 NeMo 支持通用后训练General Post-Training、01/27 稳定性与安全性改进Stability and safety improvements。需要特别说明的是RELEASE.md 表格中 v1.0 一行的链接实际指向 v0.1 的发布说明release_notes/v0p1.md属于原表格的链接笔误v1.0 的正式发布说明位于 release_notes/v1p0.md下文以仓库实际文件为准展开。v0.1图像/视频 Tokenizer 首发v0.1 是 Cosmos 平台的首次发布核心交付物是Cosmos Tokenizer 套件——一套图像与视频神经 Tokenizer将视觉内容编码为连续潜变量continuous latents或离散 tokendiscrete tokens供大自回归 Transformer 与扩散生成器使用。其实现位于 cosmos1/models/tokenizer/README.md网络定义在 cosmos1/models/tokenizer/networks模块实现在 cosmos1/models/tokenizer/modules。发布的 10 个 Tokenizer 模型v0.1 共发布 10 个 Tokenizer 模型按连续C/离散D与图像I/视频V两个维度正交组合| Item | Model name | Description | |--|------------|----------| | 1 | Cosmos-0.1-Tokenizer-CI8x8 | Continuous image tokenizer8x8 空间压缩比 | | 2 | Cosmos-0.1-Tokenizer-CI16x16 | Continuous image tokenizer16x16 空间压缩比 | | 3 | Cosmos-0.1-Tokenizer-DI8x8 | Discrete image tokenizer8x8 空间压缩比 | | 4 | Cosmos-0.1-Tokenizer-DI16x16 | Discrete image tokenizer16x16 空间压缩比 | | 5 | Cosmos-0.1-Tokenizer-CV4x8x8 | Continuous video tokenizer4x8x8 压缩比 | | 6 | Cosmos-0.1-Tokenizer-CV8x8x8 | Continuous video tokenizer8x8x8 压缩比 | | 7 | Cosmos-0.1-Tokenizer-CV8x16x16 | Continuous video tokenizer8x16x16 压缩比 | | 8 | Cosmos-0.1-Tokenizer-DV4x8x8 | Discrete video tokenizer4x8x8 压缩比 | | 9 | Cosmos-0.1-Tokenizer-DV8x8x8 | Discrete video tokenizer8x8x8 压缩比 | | 10 | Cosmos-0.1-Tokenizer-DV8x16x16 | Discrete video tokenizer8x16x16 压缩比 |从源码结构看Tokenizer 同时支持空间压缩 8x/16x 与时间压缩 4x/8x最高可实现 2048x8x16x16的总压缩比。其中图像 Tokenizer 的网络定义见 cosmos1/models/tokenizer/networks/continuous_image.py 与 discrete_image.py视频 Tokenizer 见 continuous_video.py 与 discrete_video.py。发布说明中 v0.1 表格的Try it out链接存在格式错误嵌套链接实际可用的仓库内推理入口见下文。v0.1 模型的仓库内使用入口v0.1 发布的 Tokenizer 在 cosmos1/models/tokenizer/inference 提供了 CLI 与库两种调用方式CLI 自编码重建图像与视频均可同一命令通过--checkpoint_enc/--checkpoint_dec指定 JIT 权重即可切换连续/离散# 图像自编码CI8x88x8 压缩比 model_nameCosmos-0.1-Tokenizer-CI8x8 python3 -m cosmos1.models.tokenizer.inference.image_cli \ --image_pattern cosmos1/models/tokenizer/test_data/image.png \ --checkpoint_enc checkpoints/${model_name}/encoder.jit \ --checkpoint_dec checkpoints/${model_name}/decoder.jit # 视频自编码DV4x8x84x8x8 压缩比 model_nameCosmos-0.1-Tokenizer-DV4x8x8 python3 -m cosmos1.models.tokenizer.inference.video_cli \ --video_pattern cosmos1/models/tokenizer/test_data/video.mp4 \ --checkpoint_enc checkpoints/${model_name}/encoder.jit \ --checkpoint_dec checkpoints/${model_name}/decoder.jit未指定--output_dir时重建结果默认输出到cosmos1/models/tokenizer/test_data/reconstructions/。Python 库调用以 video_lib.py 的CausalVideoTokenizer为例连续编码输入(1, 3, 9, 512, 512)的张量得到形状(1, 16, 3, 64, 64)的潜变量16 为潜变量通道数离散编码得到形状(1, 3, 64, 64)、取值范围[1..64K]的整数索引以及形状(1, 6, 3, 64, 64)的量化前连续潜变量6 为 FSQ 层数。原生 PyTorch 模式追加--modetorch可从网络定义直接实例化模型例如--tokenizer_typeDI --spatial_compression8对应 DI8x8--tokenizer_typeCV --temporal_compression8 --spatial_compression8对应 CV8x8x8权重仍从 JIT 文件中提取。v0.1 到 v1.0 的 Tokenizer 演进v0.1 发布的 Tokenizer 套件延续到了 v1.0在 v1.0 发布时Cosmos-1.0-Tokenizer-CV8x8x8连续视频 Tokenizer与Cosmos-1.0-Tokenizer-DV8x16x16离散视频 Tokenizer成为 WFM 推理链路的标准组件——扩散 WFM 依赖 CV8x8x8 将视频映射到连续潜空间自回归 WFM 依赖 DV8x16x16 将视频离散化为 token 序列。这一Tokenizer 先行、WFM 随后的发布策略体现了 Cosmos 平台对底层视觉表示基础设施的重视。v1.0扩散与自回归世界基础模型首发v1.0 是 Cosmos 平台的核心版本随 Cosmos paper 一同发布共带来13 个模型覆盖扩散 WFM、自回归 WFM、Tokenizer、Prompt Upsampler、Diffusion Decoder 与安全护栏Guardrail六大类资产并同步在仓库中提供推理脚本。发布的 13 个模型清单| Item | Model name | Description | |--|------------|----------| | 1 | Cosmos-1.0-Diffusion-7B-Text2World | 文本生成视觉世界 | | 2 | Cosmos-1.0-Diffusion-14B-Text2World | 文本生成视觉世界 | | 3 | Cosmos-1.0-Diffusion-7B-Video2World | 视频文本生成未来视觉世界 | | 4 | Cosmos-1.0-Diffusion-14B-Video2World | 视频文本生成未来视觉世界 | | 5 | Cosmos-1.0-Autoregressive-4B | 未来视觉世界生成Base | | 6 | Cosmos-1.0-Autoregressive-12B | 未来视觉世界生成Base | | 7 | Cosmos-1.0-Autoregressive-5B-Video2World | 视频文本生成未来视觉世界 | | 8 | Cosmos-1.0-Autoregressive-13B-Video2World | 视频文本生成未来视觉世界 | | 9 | Cosmos-1.0-Tokenizer-CV8x8x8 | 连续视频 Tokenizer8x8x8 压缩比 | | 10 | Cosmos-1.0-Tokenizer-DV8x16x16 | 离散视频 Tokenizer8x16x16 压缩比 | | 11 | Cosmos-1.0-PromptUpsampler-12B-Text2World | Text2World 提示词上采样器 | | 12 | Cosmos-1.0-Diffusion-7B-Decoder-DV8x16x16ToCV8x8x8 | 扩散解码器用于增强自回归 WFM 输出 | | 13 | Cosmos-1.0-Guardrail | 安全护栏pre-Guard post-Guard内嵌于推理脚本 |扩散 WFMText2World 与 Video2World扩散 WFM 的完整使用文档见 cosmos1/models/diffusion/README.md推理入口为 text2world.py 与 video2world.py网络实现在 cosmos1/models/diffusion/networks。模型均基于 DiTDiffusion Transformer架构7B 与 14B 两个规格共享同一套推理管线仅权重规模不同。模型下载仓库提供了参数化下载脚本 cosmos1/scripts/download_diffusion.py通过--model_sizes7B/14B与--model_typesText2World/Video2World组合选择模型脚本默认额外拉取Cosmos-1.0-Guardrail、Cosmos-1.0-Tokenizer-CV8x8x8若含 Text2World 还会拉取Cosmos-1.0-Prompt-Upsampler-12B-Text2World若含 Video2World 则会调用 convert_pixtral_ckpt.py 转换 Pixtral-12B 作为视频提示词上采样器。例如PYTHONPATH$(pwd) python cosmos1/scripts/download_diffusion.py --model_sizes 7B 14B --model_types Text2World Video2World下载后checkpoints/目录下会按模型名组织model.pt与config.json并附带Cosmos-1.0-Tokenizer-CV8x8x8encoder.jit/decoder.jit/mean_std.pt、Cosmos-1.0-Prompt-Upsampler-12B-Text2World、Pixtral-12B与Cosmos-1.0-Guardrail含 aegis、blocklist、face_blur_filter、video_content_safety_filter 四类护栏。单条生成Text2World 7BPROMPTA sleek, humanoid robot stands in a vast warehouse filled with neatly stacked cardboard boxes on industrial shelves. ... PYTHONPATH$(pwd) python cosmos1/models/diffusion/inference/text2world.py \ --checkpoint_dir checkpoints \ --diffusion_transformer_dir Cosmos-1.0-Diffusion-7B-Text2World \ --prompt $PROMPT \ --offload_prompt_upsampler \ --video_save_name Cosmos-1.0-Diffusion-7B-Text2World批处理生成通过--batch_input_path指向 JSONL 文件。Text2World 每行需含prompt字段Video2World 每行需含visual_input字段若关闭提示词上采样器--disable_prompt_upsampler则每行需同时包含prompt与visual_input。仓库内置示例见 text2world.jsonl、video2world_ps.jsonl 与 video2world_wo_ps.jsonl。核心参数默认值取自 text2world.py 的 argparse 定义参数说明默认值--checkpoint_dir模型权重根目录checkpoints--tokenizer_dirTokenizer 权重目录Cosmos-1.0-Tokenizer-CV8x8x8--num_steps扩散采样步数35--guidanceCFG 引导系数7.0--num_video_frames生成帧数121--height/--width输出分辨率704 / 1280--fps帧率24--seed随机种子1--negative_prompt负向提示词The video captures a series of frames showing ugly scenes...--offload_*依次卸载 prompt upsampler / guardrail / T5 编码器 / tokenizer / DiTFalse扩散 WFM 支持 1:1960x960、4:3960x704、3:4704x960、16:91280x704、9:16704x1280等多分辨率与 1240 fps 的帧率范围当前版本固定生成 121 帧Video2World 额外支持--input_image_or_video_path与--num_input_frames1 或 9。显存受限如 RTX 3090/4090 24GB时推荐全部开启 offload 策略cosmos1/models/diffusion/README.md 中给出了逐级卸载策略对应的峰值显存参考7B 全量卸载约 24.4 GB、14B 约 39.0 GB。自回归 WFMBase 与 Video2World自回归 WFM 的完整使用文档见 cosmos1/models/autoregressive/README.md推理入口为 base.py 与 video2world.py。Base4B/12B支持以图像或视频作为输入生成后续帧Video2World5B/13B额外接收文本提示。两类模型均支持将输入扩展至 33 帧——从单张图像生成 32 帧或从 9 帧视频生成 24 帧。模型下载cosmos1/scripts/download_autoregressive.py 通过--model_sizes4B/5B/12B/13B选择模型并始终附带Cosmos-1.0-Guardrail、Cosmos-1.0-Diffusion-7B-Decoder-DV8x16x16ToCV8x8x8、Cosmos-1.0-Tokenizer-CV8x8x8与Cosmos-1.0-Tokenizer-DV8x16x16PYTHONPATH$(pwd) python cosmos1/scripts/download_autoregressive.py --model_sizes 4B 5B 12B 13B单条生成Base 12B视频输入CUDA_VISIBLE_DEVICES0 PYTHONPATH$(pwd) python cosmos1/models/autoregressive/inference/base.py \ --input_typevideo \ --input_image_or_video_pathcosmos1/models/autoregressive/assets/v1p0/input.mp4 \ --video_save_nameCosmos-1.0-Autoregressive-12B \ --ar_model_dirCosmos-1.0-Autoregressive-12B \ --top_p0.9 \ --temperature1.0关键参数--input_type在 Base 中取video/image在 Video2World 中取text_and_video/text_and_image--top_p与--temperature已针对各模型调优4B 用 top_p0.8、12B 用 0.9、5B 用 0.7、13B 用 0.8temperature 均为 1.0建议直接使用命令示例中的取值--disable_diffusion_decoder可回退到离散 Tokenizer 直接解码默认使用扩散解码器Cosmos-1.0-Diffusion-7B-Decoder-DV8x16x16ToCV8x8x8增强输出画质。注意自回归模型固定工作于 1024x640 分辨率输入不匹配时会被自动缩放与裁剪。发布说明同时给出了自回归模型在 100 条 Physical AI 测试视频上的失败率参考定义为出现严重畸变如突然出现大物体或退化为单色画面Video2World 13B 在视频输入下失败率为 0%Base 4B 在图像输入下为 15%静态帧与轻微物体畸变不计入失败。该数据来自官方发布说明实际表现可能随系统与输入变化。Prompt Upsampler 与 Guardrailv1.0 的 13 个模型中包含两个重要的辅助模型Prompt UpsamplerCosmos-1.0-Prompt-Upsampler-12B-Text2World / Pixtral-12BText2World 场景下基于微调后的 Mistral 模型将简短提示词扩写为详细描述Video2World 场景下基于 Pixtral 模型从输入图像/视频生成详细描述。默认启用可通过--disable_prompt_upsampler关闭Text2World 下提示词超过--word_limit_to_skip_upsampler默认 250 词时会自动跳过上采样以提升鲁棒性。实现见 prompt_upsampler。GuardrailCosmos-1.0-Guardrail内嵌于所有推理脚本且不可关闭包含 pre-Guard 与 post-Guard实现见 cosmos1/models/guardrailaegis 文本护栏、blocklist 词表、face_blur_filter 人脸模糊、video_content_safety_filter 视频内容安全。当前版本不允许生成人脸人脸会被护栏自动模糊。v1.0 之后的演进v1.0 发布说明 记录了三次里程碑提交01/06 随论文发布 13 个模型与推理脚本01/09 通过 NeMo Framework 支持通用后训练对应 POST_TRAINING.md01/27 完成稳定性与安全性改进。这意味着 v1.0 交付的不仅是推理能力还打通了预训练 → 后训练 → 再推理的完整闭环。版本演进对应的实操能力安装、推理与后训练环境安装无论使用哪个版本环境搭建均遵循 INSTALL.md需安装 NVIDIA Container Toolkit然后基于仓库根目录 Dockerfile 构建镜像并运行容器git clone https://gitcode.com/GitHub_Trending/cosmos7/cosmos cd cosmos docker build -t cosmos . docker run -d --name cosmos_container --gpus all --ipchost -it -v $(pwd):/workspace cosmos docker attach cosmos_containerv1.0 后训练能力NeMo Frameworkv1.0 发布说明 表明通用后训练自 01/09 起获得支持。POST_TRAINING.md 规划了六类后训练任务通用后训练General Post-Training、指令控制Instruction Control、动作控制Action Control、相机控制Camera Control、多视角生成Multi-View Generation及其带车辆轨迹控制的变体。当前版本仅开放通用后训练支持矩阵如下Post-training TaskDiffusion WFMAutoregressive WFM通用后训练SupportedSupported指令控制Coming soonComing soon动作控制Coming soonComing soon相机控制Coming soonComing soon多视角生成Coming soonComing soon多视角生成带轨迹控制Coming soonComing soon扩散 WFM 后训练diffusion/nemo/post_training/README.md支持 7B/14B 的 Text2World 与 Video2World推荐 H100/A100-80GB 8 卡。流程为准备 MP4 视频数据集 → prepare_dataset.py 预处理按 121 帧切块、编码 T5 文本嵌入与 3D 视频 token→ torchrun 启动 general.pyText2World或 video2world.pyVideo2World训练采用 FSDP 张量并行14B 额外启用激活检查点。关键配置项包括--factory如cosmos_diffusion_7b_text2world_finetune、data.path、optim.config.lr默认 1e-6、trainer.max_steps默认 1000。自回归 WFM 后训练autoregressive/nemo/post_training/README.md4B/5B 需 24 卡、12B/13B 需 8 卡。Base 模型4B/12B使用 prepare_dataset.py 生成 Megatron CoreIndexedDataset.bin/.idxVideo2World 模型5B/13B使用 video2world_prepare_dataset.py 预计算文本与视频嵌入训练入口分别为 general.py 与 video2world_finetuning.py关键参数包括--data_path、--model_path、--tensor_model_parallel_size、--max_steps、--lr常用起点 5e-5等。版本选型建议结合两份发布说明与仓库实现可按如下思路选型需要通用视觉编码/重建能力选用 v0.1 的 Tokenizer 套件CI/DI/CV/DV 四系 10 个模型CLI 入口见 tokenizer/inference需要文本生成视频选用 v1.0 扩散 WFM7B/14B Text2World入口 text2world.py需要以图像/视频为条件生成未来帧扩散路线用 7B/14B Video2Worldvideo2world.py自回归路线用 Base 4B/12B 或 Video2World 5B/13Bbase.py、video2world.py需要针对特定机器人/工厂等场景定制生成分布以 v1.0 模型为基础按 POST_TRAINING.md 的通用后训练流程基于 NeMo Framework 微调。许可证说明仓库的源码部分遵循 Apache 2.0 许可预训练模型遵循 NVIDIA Open Model License允许商业使用NVIDIA 不主张对模型输出内容的拥有权项目运行时会下载并安装第三方开源软件使用前需审阅相关开源项目的许可条款。此外仓库会要求通过 Hugging Face 登录并申请相应模型访问权限例如 Video2World 的提示词上采样依赖对 Pixtral-12B 的访问授权详见 cosmos1/models/diffusion/README.md 的下载步骤。【免费下载链接】cosmosNVIDIA Cosmos is an open platform of world models, datasets, and tools that enables developers to build Physical AI for robots, autonomous vehicles, smart infrastructure, and more.项目地址: https://gitcode.com/GitHub_Trending/cosmos7/cosmos创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表