View a markdown version of this page

使用截止日期雲端上的 MuJoCo 訓練機器人操作政策 - 截止日期雲端

本文為英文版的機器翻譯版本,如內容有任何歧義或不一致之處,概以英文版為準。

使用截止日期雲端上的 MuJoCo 訓練機器人操作政策

mujoco_sim_to_policy 任務套件使用 Strands Robots so100 arms 的 MuJoCo 模擬,在 Deadline Cloud 上訓練和轉譯學到的機器人操作政策。任務會對受管 GPU 工作者執行三個相依步驟:

  1. Datagen:MuJoCo 中立方體的指令碼關節空間挑選,記錄為 LeRobot 資料集。每個片段都會透過立方體高度檢查進行驗證,並在失敗時予以捨棄。

  2. 訓練 — 在產生的資料集 (CUDA) 上微調 LeRobot ACT 政策。

  3. 轉譯 — 使用微調政策驅動 MuJoCo 推展,並將結果記錄為 MP4 影片和 PNG 影格。

套件需要 Linux x86_64 GPU 機群 (透過 EGL 進行無周邊轉譯並在 CUDA 上進行訓練的步驟),以及使用 CondaPackagesCondaChannels任務參數的 conda 佇列環境。預設 conda 套件位於 python=3.12 pip git ffmpegconda-forge

job_bundles目錄中,提交任務:

OUT="$(pwd)/output"; mkdir -p "$OUT" deadline bundle submit mujoco_sim_to_policy -p "OutputDir=$OUT" --yes