本文為英文版的機器翻譯版本,如內容有任何歧義或不一致之處,概以英文版為準。
任務停滯在 RUNNABLE 狀態
如果 AWS Batch 偵測到您的RUNNABLE任務封鎖了佇列的前端,您會收到服務任務佇列封鎖事件來自 的 並說明原因。相同的原因也會更新為 statusReason ListServiceJobs和 DescribeServiceJob API 呼叫的一部分。
或者,您可以透過 CreateJobQueue和 UpdateJobQueue API 動作來設定 jobStateTimeLimitActions 參數。jobStateTimeLimitActions 參數會指定一組在特定狀態的任務上執行的動作 AWS Batch 。您可以透過 maxTimeSeconds 欄位以秒為單位設定時間閾值。
對於連接到SAGEMAKER_TRAINING服務環境的任務佇列,您可以搭配 使用的唯一動作jobStateTimeLimitActions.action是 TERMINATE,這會終止任務。
例如,您可以設定 jobStateTimeLimitActions 參數,為 RUNNABLE 狀態中等待足夠容量的任何任務等待最多 4 小時。您可以在終止任務之前reason將 設定為 CAPACITY:INSUFFICIENT_INSTANCE_CAPACITY,並將 maxTimeSeconds設定為 14400,並允許下一個任務進入任務佇列的前端。
以下各節說明 AWS Batch 可推斷的不同封鎖原因類型。每個區段都包含:
-
在
ListServiceJobs和DescribeServiceJobAPI 動作上statusReason設定的 。 -
jobStateTimeLimitActions組態reason的值。 -
如果
jobStateTimeLimitActions觸發終止,則statusReason顯示的 。