
NVIDIA Cosmos 世界模型快速上手從安裝到生成第一條物理AI視頻【免費下載鏈接】cosmosNVIDIA Cosmos is an open platform of world models, datasets, and tools that enables developers to build Physical AI for robots, autonomous vehicles, smart infrastructure, and more.項目地址: https://gitcode.com/GitHub_Trending/cosmos7/cosmosNVIDIA Cosmos 是一個面向物理AI的世界模型開源平臺覆蓋機器人、自動駕駛和智能基礎(chǔ)設(shè)施等場景的數(shù)據(jù)生成需求。對使用者的核心能力只有兩條路用一段文字直接生成視頻Text2World或者拿一張圖片、一段已有視頻讓模型把接下來的世界續(xù)出來Video2World。本文按這個思路走一遍完整流程從確認(rèn)機器能否跑到調(diào)出第一條像樣的視頻。? 先確認(rèn)機器能不能跑動手裝之前對一遍這張表。任何一項不滿足后面的步驟都會卡住項目要求操作系統(tǒng)Ubuntu 20.04 / 22.04 / 24.04官方只支持 UbuntuGPUNVIDIA 顯卡建議顯存 24GB 起步容器環(huán)境Docker且已安裝 NVIDIA Container Toolkit磁盤至少預(yù)留 50GB 用于存放模型權(quán)重軟件棧本身不需要你手動裝官方 Docker 鏡像會把 Python 依賴全部帶進(jìn)容器這也是后文所有命令都在容器里執(zhí)行的原因。安裝、拿權(quán)限、拉模型四步出第一條視頻第一步克隆倉庫并構(gòu)建鏡像。git clone https://gitcode.com/GitHub_Trending/cosmos7/cosmos cd cosmos docker build -t cosmos .第二步啟動容器并進(jìn)入。docker run -d --name cosmos_container --gpus all --ipchost -it -v $(pwd):/workspace cosmos docker attach cosmos_container第三步解決模型權(quán)限。Cosmos 的權(quán)重托管在 Hugging Face 上到 Hugging Face 的 Token 頁面創(chuàng)建一個權(quán)限為 Read 的訪問令牌然后執(zhí)行huggingface-cli login登錄。另外去 Mistral AI 的 Pixtral-12B 模型頁面點擊 Agree and access repository 同意授權(quán)——Video2World 的提示上采樣器依賴這個模型不點頭下載腳本會在轉(zhuǎn)換它的權(quán)重這一步失敗。第四步下載預(yù)訓(xùn)練權(quán)重。PYTHONPATH$(pwd) python cosmos1/scripts/download_diffusion.py \ --model_sizes 7B 14B \ --model_types Text2World Video2World下載內(nèi)容落到checkpoints/目錄。這個腳本不止拉 DiT 主干還會一并取回 Guardrail 護欄模型和 CV8x8x8 視頻分詞器如果下載了 Text2World會額外帶上 12B 的提示上采樣器下載了 Video2World則會轉(zhuǎn)換并保存 Pixtral-12B 權(quán)重。顯存或磁盤緊張時把--model_sizes 7B 14B縮成--model_sizes 7B即可后面的示例都用 7B。用法一文字生成視頻Text2WorldPYTHONPATH$(pwd) python cosmos1/models/diffusion/inference/text2world.py \ --checkpoint_dir checkpoints \ --diffusion_transformer_dir Cosmos-1.0-Diffusion-7B-Text2World \ --prompt 一個機器人站在大型倉庫中貨架整齊燈光均勻鏡頭固定 \ --video_save_name my_first_video \ --offload_prompt_upsampler跑完在輸出目錄里找my_first_video命名的視頻文件。需要換 14B 模型時把--diffusion_transformer_dir改成Cosmos-1.0-Diffusion-14B-Text2World步數(shù)、guidance 等參數(shù)默認(rèn)即可想調(diào)優(yōu)見調(diào)質(zhì)量一節(jié)。用法二從圖片 / 已有視頻續(xù)寫世界Video2World這條路的輸入是一張圖片或一段視頻模型基于它生成后續(xù)畫面PYTHONPATH$(pwd) python cosmos1/models/diffusion/inference/video2world.py \ --checkpoint_dir checkpoints \ --diffusion_transformer_dir Cosmos-1.0-Diffusion-7B-Video2World \ --input_image_or_video_path cosmos1/models/diffusion/assets/v1p0/video2world_input0.jpg \ --num_input_frames 1 \ --video_save_name v2w_demo \ --offload_prompt_upsampler--num_input_frames決定取輸入的前幾幀作為條件默認(rèn) 1 幀即單圖也支持 9 幀。倉庫cosmos1/models/diffusion/assets/v1p0/里備有現(xiàn)成的示例圖片和視頻可以直接拿來試。四個模型、兩類結(jié)構(gòu)怎么選模型結(jié)構(gòu)輸入適合場景Cosmos-1.0-Diffusion-7B-Text2World擴散純文本快速迭代、顯存受限約 24GB 可跑Cosmos-1.0-Diffusion-14B-Text2World擴散純文本追求更高畫面質(zhì)量Cosmos-1.0-Diffusion-7B-Video2World擴散圖片/視頻 文本基于真實素材續(xù)寫未來Cosmos-1.0-Diffusion-14B-Video2World擴散圖片/視頻 文本高質(zhì)量視頻續(xù)寫Cosmos-1.0-Autoregressive-4B自回歸圖像 文本世界模型研究方向、NeMo 微調(diào)Cosmos-1.0-Autoregressive-12B自回歸圖像 文本同上質(zhì)量更高選擇邏輯很簡單做生成演示或批量產(chǎn)數(shù)據(jù)選擴散系列要接 NeMo 做后訓(xùn)練、研究世界建模本身再看自回歸系列4B / 12B。擴散系列內(nèi)部 7B 和 14B 的差別只在質(zhì)量與耗時的權(quán)衡接口完全一致。讓輸出更好看提示詞和三個旋鈕提示詞方面四個建議來自官方實踐一段提示只描述一個連續(xù)場景不要寫鏡頭切換長度控制在 120 詞左右太長反而拖慢上采樣且容易跑偏少寫相機運動指令當(dāng)前版本對這類控制的支持有限多用具體名詞和形容詞堆視覺細(xì)節(jié)比如材質(zhì)、光線、空間布局。上采樣器默認(rèn)開啟負(fù)責(zé)把你的短提示擴寫成細(xì)節(jié)更豐富的長提示提示超過 250 詞時腳本會自動跳過它用--disable_prompt_upsampler可以強制關(guān)閉保持原始意圖。三個質(zhì)量旋鈕都是推理腳本的通用參數(shù)默認(rèn)值見括號--num_steps擴散采樣步數(shù)默認(rèn) 35步數(shù)越多質(zhì)量越好、耗時越長--guidanceguidance 尺度默認(rèn) 7控制畫面跟隨提示詞的強度--height/--width輸出分辨率默認(rèn) 704 x 1280可換成 1:1、4:3、16:9 等比例。顯存不夠怎么辦五個組件可以按需逐個從 GPU 挪到 CPU對應(yīng)五個開關(guān)--offload_prompt_upsampler、--offload_text_encoder_model、--offload_diffusion_transformer、--offload_tokenizer、--offload_guardrail_models。官方給出的三檔配置顯卡組合開關(guān)峰值顯存參考RTX 3090 / 409024GB全部五個約 24GBA10040GB--offload_prompt_upsampler --offload_guardrail_models約 57GBH10080GB--offload_prompt_upsampler約 74GB24GB 機器的完整寫法在核心命令后追加四個開關(guān)即可--offload_tokenizer \ --offload_diffusion_transformer \ --offload_text_encoder_model \ --offload_guardrail_models批量生成走 JSONL每行一條提示詞倉庫cosmos1/models/diffusion/assets/v1p0/batch_inputs/text2world.jsonl有現(xiàn)成格式。在 text2world 腳本上加--batch_input_path jsonl路徑 --video_save_folder outputs/結(jié)果會按批次落盤到指定目錄。邊界、時長與下一步先把限制說清楚免得踩坑輸出幀數(shù)固定 121 幀--num_video_frames只有這一個選項采樣幀率默認(rèn) 24fps可用--fps按需調(diào)整單視頻推理耗時參考7B 約 380 秒14B 約 590 秒。安全護欄是強制啟用的沒有關(guān)閉入口生成內(nèi)容會過內(nèi)容安全過濾檢測到的自動模糊處理人臉。做發(fā)布前的內(nèi)容審核時把它算進(jìn)流程而不是當(dāng)作可選項。往深處走的兩條路針對自有數(shù)據(jù)做后訓(xùn)練看 cosmos1/models/POST_TRAINING.md多 GPU 推理看 cosmos1/models/diffusion/nemo/inference/README.md。下一步怎么做先在 24GB 級別的機器上用 7B Text2World 跑通全鏈路卸載開關(guān)全開確認(rèn)流程沒斷再用 14B 或 Video2World 對比同一場景的輸出質(zhì)量決定日常用哪個規(guī)格穩(wěn)定之后切到 JSONL 批量模式把單條 380 秒的耗時攤到批量生產(chǎn)里。參考文檔與源碼后訓(xùn)練指南 cosmos1/models/POST_TRAINING.md、多GPU推理 cosmos1/models/diffusion/nemo/inference/README.md、擴散模型推理源碼目錄 cosmos1/models/diffusion/inference/【免費下載鏈接】cosmosNVIDIA Cosmos is an open platform of world models, datasets, and tools that enables developers to build Physical AI for robots, autonomous vehicles, smart infrastructure, and more.項目地址: https://gitcode.com/GitHub_Trending/cosmos7/cosmos創(chuàng)作聲明:本文部分內(nèi)容由AI輔助生成(AIGC),僅供參考