ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

Cosmos物理世界视频生成零基础实战:从环境配置到产出第一个AI视频的完整教程

Cosmos物理世界视频生成零基础实战:从环境配置到产出第一个AI视频的完整教程 Cosmos物理世界视频生成零基础实战从环境配置到产出第一个AI视频的完整教程【免费下载链接】cosmosNVIDIA Cosmos is an open platform of world models, datasets, and tools that enables developers to build Physical AI for robots, autonomous vehicles, smart infrastructure, and more.项目地址: https://gitcode.com/GitHub_Trending/cosmos7/cosmos如果你是机器人、自动驾驶或智能基础设施领域的开发者NVIDIA Cosmos 这个开源的世界基础模型平台值得你花一下午时间亲手跑通一遍它能把一句文本描述或者一段普通视频变成一段物理上合理、可自由延展的仿真世界视频。本文以里程碑的方式带你从零开始搭环境、下模型、跑推理、看成果每走完一步都有可量化的进展最终拿到属于你的第一个 AI 生成视频。 先记住三件事Cosmos 需要 Ubuntu 系统 NVIDIA GPU Docker模型权重从 Hugging Face 下载所有推理命令都在 Docker 容器内执行。里程碑 0动手前先花 3 分钟认识 Cosmos 能做什么Cosmos 是 NVIDIA 推出的面向物理 AI 的世界生成平台核心能力是Text2World文本生成世界和Video2World视频/图片生成世界。你可以理解为给它一句话或一段画面它帮你续写一个符合物理规律、可供机器人或自动驾驶模型训练使用的视频世界。平台里还有配套的视频 tokenizer、安全护栏guardrail以及基于 NeMo 的后训练脚本方便你在生成之外继续微调模型。不过第一次上手我们只关心一件事跑通一条最简单的生成链路。环境要求一览项目要求操作系统Ubuntu 20.04 / 22.04 / 24.04官方仅测试了这三个版本GPUNVIDIA GPU建议显存 24GB 以上24GB 需开启全部模型卸载Docker已安装 Docker 及 NVIDIA Container Toolkit存储至少 50GB 可用空间模型权重较大网络可访问 Hugging Face 下载模型✅这一步你完成了什么确认了自己的机器是否满足运行门槛。不满足也别急着走后面的避坑手册里有低显存 GPU 的完整方案。里程碑 13 步搭好运行环境克隆、构建、进容器Cosmos 的依赖较重官方推荐用 Docker 隔离环境这也是最容易踩坑的一步我们一步步来。第 1 步克隆代码仓库git clone https://gitcode.com/GitHub_Trending/cosmos7/cosmos cd cosmos第 2 步构建 Docker 镜像docker build -t cosmos .这一步会拉取基础镜像并安装全部 Python 依赖耗时取决于网络属于正常现象耐心等待即可。第 3 步启动并进入容器docker run -d --name cosmos_container --gpus all --ipchost -it -v $(pwd):/workspace cosmos docker attach cosmos_container命令解释--gpus all让容器使用全部 GPU-v $(pwd):/workspace把当前目录挂载进容器这样你下载的模型和生成的视频都能直接保存在宿主机上。之后所有命令都在容器内执行。 如果docker run报 GPU 相关错误通常是你还没装 NVIDIA Container Toolkit回到里程碑 0 的表格里补上这一步即可。✅这一步你完成了什么拥有了一个可运行 Cosmos 的隔离环境容器内已经装好全部依赖后面不会再为缺包烦恼。里程碑 2拿到模型权重下载 Text2World 与 Video2World模型托管在 Hugging Face 上需要先取得访问权限整个流程只有三个动作。动作 1创建访问令牌并登录在 Hugging Face 官网的 Settings → Access Tokens 页面创建令牌权限选择Read默认是 Fine-grained记得改成 Read然后执行huggingface-cli login按提示粘贴令牌即可完成登录。动作 2申请 Pixtral-12B 模型权限Pixtral-12B 用于 Video2World 的提示上采样自动为输入画面生成文字描述需要你在它的模型页面点击Agree and access repository授权一次。如果跳过这步Video2World 推理会在加载提示上采样器时报权限错误。动作 3运行官方下载脚本PYTHONPATH$(pwd) python cosmos1/scripts/download_diffusion.py --model_sizes 7B 14B --model_types Text2World Video2World这条命令会同时下载 7B/14B 的 Text2World、Video2World 模型以及必备的 tokenizer、安全护栏和提示上采样器。下载完成后checkpoints/目录结构大致如下checkpoints/ ├── Cosmos-1.0-Diffusion-7B-Text2World ├── Cosmos-1.0-Diffusion-14B-Text2World ├── Cosmos-1.0-Diffusion-7B-Video2World ├── Cosmos-1.0-Diffusion-14B-Video2World ├── Cosmos-1.0-Tokenizer-CV8x8x8 ├── Cosmos-1.0-Prompt-Upsampler-12B-Text2World ├── Pixtral-12B └── Cosmos-1.0-Guardrail 磁盘紧张的话可以只下载 7B 模型--model_sizes 7B --model_types Text2World Video2World够完成本文全部演示。✅这一步你完成了什么模型权重就位。从现在起你的机器已经会生成视频了只差最后一条命令。里程碑 3一条命令生成你的第一个物理世界视频先体验门槛最低的Text2World只需要一句文本提示词。官方示例用的是一条仓库中的机器人描述我们直接拿来用。第 1 步定义提示词变量PROMPTA sleek, humanoid robot stands in a vast warehouse filled with neatly stacked cardboard boxes on industrial shelves. The robots metallic body gleams under the bright, even lighting, highlighting its futuristic design and intricate joints. A glowing blue light emanates from its chest, adding a touch of advanced technology. The background is dominated by rows of boxes, suggesting a highly organized storage system. The floor is lined with wooden pallets, enhancing the industrial setting. The camera remains static, capturing the robots poised stance amidst the orderly environment, with a shallow depth of field that keeps the focus on the robot while subtly blurring the background for a cinematic effect.第 2 步运行 7B 模型推理PYTHONPATH$(pwd) python cosmos1/models/diffusion/inference/text2world.py \ --checkpoint_dir checkpoints \ --diffusion_transformer_dir Cosmos-1.0-Diffusion-7B-Text2World \ --prompt $PROMPT \ --offload_prompt_upsampler \ --video_save_name my_first_cosmos_video参数含义--diffusion_transformer_dir指定使用哪个扩散模型--prompt传入文本--offload_prompt_upsampler在生成完描述后把提示上采样器移出显存节省显存--video_save_name是输出视频名。第 3 步等待并查看成果在 H100 上7B 模型单条视频约 380 秒含上采样与安全检测普通消费级显卡配合卸载会慢一些属正常现象。完成后你会在容器工作目录下找到名为my_first_cosmos_video.mp4的视频——这就是你的第一个物理世界生成成果。提示词可以自由替换成中文比如一只机器狗在雨后街道上行走背景是模糊的城市灯光模型同样支持。✅这一步你完成了什么从文本到视频的全流程已跑通你正式上手 Cosmos 了。里程碑 4进阶玩法——用一张图片生成未来的世界Video2World文本生成玩熟后试试更有物理 AI 味道的Video2World输入一段视频或一张图片Cosmos 会预测并生成它接下来会发生什么的画面。仓库里自带一张高速公路的示例输入图运行下面的命令7B 模型单张图片输入PYTHONPATH$(pwd) python cosmos1/models/diffusion/inference/video2world.py \ --checkpoint_dir checkpoints \ --diffusion_transformer_dir Cosmos-1.0-Diffusion-7B-Video2World \ --input_image_or_video_path cosmos1/models/diffusion/assets/v1p0/video2world_input0.jpg \ --num_input_frames 1 \ --video_save_name my_video2world_video \ --offload_prompt_upsampler和 Text2World 的区别在于这次不需要你写提示词默认开启的提示上采样器会先用 Pixtral 模型看图说话自动生成画面描述再据此续写后续帧。--num_input_frames 1表示只输入 1 帧图片如果你有 9 帧的视频片段改成9即可获得更连贯的续写效果。如果你希望完全控制语义可以加--disable_prompt_upsampler关闭自动描述再用--prompt手动指定。想批量生成时把多个输入写进一个 JSONL 文件通过--batch_input_path传入例如仓库自带的cosmos1/models/diffusion/assets/v1p0/batch_inputs/video2world_ps.jsonl。✅这一步你完成了什么掌握了 Cosmos 最核心的两种生成方式Text2World 与 Video2World并学会了单条与批量调用。里程碑 5让它在你的显卡上跑得更舒服不同显存的显卡需要不同的显存卸载策略。官方给出的参考配置如下GPU 类型推荐卸载策略实测显存占用7B Text2WorldH10080GB仅卸载提示上采样器~74GBA10040GB卸载提示上采样器 安全护栏~57GBRTX 3090/409024GB全部卸载~24.4GB24GB 显卡的完整卸载参数PYTHONPATH$(pwd) python cosmos1/models/diffusion/inference/text2world.py \ --checkpoint_dir checkpoints \ --diffusion_transformer_dir Cosmos-1.0-Diffusion-7B-Text2World \ --prompt $PROMPT \ --offload_tokenizer \ --offload_diffusion_transformer \ --offload_text_encoder_model \ --offload_prompt_upsampler \ --offload_guardrail_models除了显存还有几个值得知道的生成参数视频固定输出 121 帧支持 1:1、4:3、16:9、9:16 等多种宽高比通过--height与--width设置帧率可在 12–40fps 间调整--fps--num_steps控制扩散步数默认 35越多通常质量越高但更慢。提示词质量对结果影响巨大记住三条原则描述单一场景避免镜头切换、控制在 120 词左右、别给相机运镜指令该能力仍在开发中。常见坑与避坑手册新手必看⚠️Docker 报 GPU 错误绝大多数是 NVIDIA Container Toolkit 没装好先验证docker run --rm --gpus all nvidia/cuda:11.0-base nvidia-smi能正常输出。⚠️Hugging Face 下载 401 报错令牌权限必须是 ReadPixtral-12B 必须点过Agree and access repository否则 Video2World 必挂。⚠️显存不足OOM别硬扛把里程碑 5 的五个--offload_*参数全部加上用速度换显存。⚠️生成的人脸是模糊的这不是 bug。Cosmos 内置安全护栏不可关闭人脸会被自动模糊内容安全过滤也会拦截不当内容。⚠️视频看起来没动或轻微畸变属于正常现象官方统计的自回归模型失败率也在 1%–15% 之间多换提示词、多试几个种子--seed即可。⚠️下载中断下载脚本基于snapshot_download支持断点续传重跑同一命令即可。更进一步的探索方向跑通 Diffusion 模型后这个平台还有几块值得挖自回归世界模型适合预测未来帧的场景官方测试中失败率更低。入口脚本在cosmos1/models/autoregressive/inference/下载脚本为cosmos1/scripts/download_autoregressive.py。视频 tokenizerCosmos 的招牌组件之一能以最高 2048 倍的压缩率把视频转成连续或离散 token且延迟远低于同类方案。后训练Post-training如果你想针对工厂、家庭、自动驾驶等特定场景微调模型官方提供了基于 NeMo 的通用后训练脚本具体任务支持矩阵见cosmos1/models/POST_TRAINING.md。多 GPU 推理大型模型或大批量场景可参考cosmos1/models/diffusion/nemo/inference/README.md的 NeMo 多卡方案。写在最后你的下一步行动恭喜你完成了从零到第一个物理世界视频的全过程接下来建议按这个顺序继续换自己的素材试一次找一张你手机里的照片用里程碑 4 的命令跑一次 Video2World感受画面会动起来的惊喜玩转提示词写 5 条不同风格的提示词室内/室外、白天/夜晚、静态/动态对比输出差异建立手感深入官方文档扩散模型完整参数说明在cosmos1/models/diffusion/README.md自回归模型在cosmos1/models/autoregressive/README.mdtokenizer 在cosmos1/models/tokenizer/README.md安装细节可回看INSTALL.md关注安全与合规模型遵循 NVIDIA Open Model License可商用源码遵循 Apache 2.0动手前先读一遍LICENSE。物理世界生成是通往具身智能的关键一环而你今天已经亲手敲开了这扇门。剩下的就是用更多实验把这条路走宽。【免费下载链接】cosmosNVIDIA Cosmos is an open platform of world models, datasets, and tools that enables developers to build Physical AI for robots, autonomous vehicles, smart infrastructure, and more.项目地址: https://gitcode.com/GitHub_Trending/cosmos7/cosmos创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表