本文為英文版的機器翻譯版本,如內容有任何歧義或不一致之處,概以英文版為準。
RUNNABLE 任務因容量而卡在 中
下列案例說明如何 AWS Batch 識別容量不足的情況。
- 執行個體容量不足
-
AWS Batch 將 SageMaker Training 任務收到的兩組回應解譯為執行個體容量不足的情況。每當收到這些項目時, 都會 AWS Batch 設定
statusReason對應的CAPACITY:INSUFFICIENT_INSTANCE_CAPACITY。在這兩種情況下, AWS Batch 任務提交與失敗
SCHEDULED之間所花費的對應任務時間會在任務提交之間累積,以便與 進行比較maxTimeSeconds。案例
TrainingJobStatus指標
訓練任務失敗並出現容量錯誤
FAILEDfailedReason開頭為CapacityError訓練任務等待容量逾時
STOPPEDsecondaryStatus表示待定等待容量中任務逾時如果其中一個案例遭到命中, AWS Batch 會將任務視為遇到容量不足。
-
statusReason當任務停滯時的訊息:CAPACITY:INSUFFICIENT_INSTANCE_CAPACITY - Unable to provision requested compute resources -
reason用於jobStateTimeLimitActions:CAPACITY:INSUFFICIENT_INSTANCE_CAPACITY -
statusReason任務被 終止後的訊息jobStateTimeLimitActions:Terminated by JobStateTimeLimit action due to reason: CAPACITY:INSUFFICIENT_INSTANCE_CAPACITY
-