View a markdown version of this page

Deadline Cloud에서 MuJoCo를 사용하여 로봇 조작 정책 훈련 - 기한 클라우드

기계 번역으로 제공되는 번역입니다. 제공된 번역과 원본 영어의 내용이 상충하는 경우에는 영어 버전이 우선합니다.

Deadline Cloud에서 MuJoCo를 사용하여 로봇 조작 정책 훈련

mujoco_sim_to_policy 작업 번들은 Strands Robots so100 arm의 MuJoCo 시뮬레이션을 사용하여 Deadline Cloud에서 학습된 로봇 조작 정책을 훈련하고 렌더링합니다. 작업은 관리형 GPU 작업자에 대해 세 가지 종속 단계를 실행합니다.

  1. Datagen - LeRobot 데이터 세트로 기록된 MuJoCo에서 큐브의 스크립팅된 관절 공간 선택입니다. 각 에피소드는 큐브 높이 확인으로 확인되며 실패하면 폐기됩니다.

  2. 훈련 - 생성된 데이터 세트(CUDA)에서 LeRobot ACT 정책을 미세 조정합니다.

  3. 렌더링 - 미세 조정된 정책을 사용하여 MuJoCo 롤아웃을 구동하고 결과를 MP4 비디오 및 PNG 프레임으로 기록합니다.

번들에는 Linux x86_64 GPU 플릿(단계는 EGL을 통해 헤드리스 렌더링되고 CUDA에서 훈련됨)과 CondaPackagesCondaChannels 작업 파라미터를 사용하는 conda 대기열 환경이 필요합니다. 기본 conda 패키지는 python=3.12 pip git ffmpeg에 있습니다conda-forge.

job_bundles 디렉터리에서 작업을 제출합니다.

OUT="$(pwd)/output"; mkdir -p "$OUT" deadline bundle submit mujoco_sim_to_policy -p "OutputDir=$OUT" --yes