View a markdown version of this page

在 Deadline Cloud MuJoCo 上训练机器人操纵策略 - 截止日期云

本文属于机器翻译版本。若本译文内容与英语原文存在差异,则一律以英文原文为准。

在 Deadline Cloud MuJoCo 上训练机器人操纵策略

mujoco_sim_to_policy 工作捆绑包使用对 St rands Robots so100 手臂的模拟,在 Deadline Cloud 上训练和渲染学习过的机器人操纵策略。MuJoCo该作业在托管 GPU 工作线程上运行三个依赖步骤:

  1. Datagen — 脚本化的 joint-space 选取立方体 MuJoCo,记录为数据集。 LeRobot 每集都通过立方体高度检查进行验证,如果失败,则将其丢弃。

  2. 训练 — 对生成的数据集 (CUDA) 微调 LeRobot ACT 策略。

  3. 渲染 — 使用微调策略推动 MuJoCo推出,并将结果记录为 MP4 视频和 PNG 帧。

该捆绑包需要一个 Linux x86_64 GPU 队列(步骤通过 EGL 无头渲染并在 CUDA 上训练)和一个消耗和任务参数的 conda 队列环境。CondaPackages CondaChannels默认的 conda 软件包已python=3.12 pip git ffmpeg开启。conda-forge

job_bundles目录中提交作业:

OUT="$(pwd)/output"; mkdir -p "$OUT" deadline bundle submit mujoco_sim_to_policy -p "OutputDir=$OUT" --yes