本文為英文版的機器翻譯版本,如內容有任何歧義或不一致之處,概以英文版為準。
在截止日期雲端工作者上使用 NVIDIA GPUs 執行 Docker 容器
docker_nvidia_container_toolkitdocker run。許多 GPU 工作負載,例如ComfyUI和穩定擴散推論伺服器,以容器映像形式提供,並需要具有 GPU 傳遞的 Docker。容器也提供簡潔的方式來封裝複雜的相依性堆疊 (CUDA、Python、應用程式特定的程式庫),而不會污染主機或與機群上的其他任務衝突。
指令碼會執行以下操作:
-
透過 安裝 Docker
dnf並啟動服務。 -
將
job-user新增至docker群組,讓任務可以在沒有 sudo 的情況下執行容器。 -
從官方儲存庫安裝 NVIDIA Container Toolkit。
-
將 Docker 協助程式設定為使用 NVIDIA 執行時間。
-
產生用於 GPU 存取的 CDI (容器裝置界面) 規格。
-
重新啟動 Docker 並驗證設定。
機群 AMI 必須已安裝最終雲端 GPU AMIs 提供的 NVIDIA GPU 驅動程式,且機群必須使用 GPU 執行個體類型,例如 g6.xlarge、 g6e.xlarge或 p4d.24xlarge。
主機組態執行後,任務即可啟動 GPU 容器。下列範例會執行容器,其中包含 GPU 存取、主機聯網,以及傳遞通過的標準截止日期雲端用量型授權環境變數:
docker run --rm \ --runtime=nvidia \ --gpus all \ --network host \ -e ADSKFLEX_LICENSE_FILE \ -e FLEXLM_TIMEOUT \ -e foundry_LICENSE \ -e PIXAR_LICENSE_FILE \ -e g_licenseServerRLM \ -e redshift_LICENSE \ -e SESI_LMHOST \ -e VRAY_AUTH_CLIENT_FILE_PATH \ -e VRAY_AUTH_CLIENT_SETTINGS \your-image:latest