View a markdown version of this page

용량으로 인해 작업이 RUNNABLE에 멈춤 - AWS Batch

기계 번역으로 제공되는 번역입니다. 제공된 번역과 원본 영어의 내용이 상충하는 경우에는 영어 버전이 우선합니다.

용량으로 인해 작업이 RUNNABLE에 멈춤

인스턴스 용량 부족

연결된 모든 컴퓨팅 환경에 용량 부족 오류가 있습니다. 요청 시 AWS Batch 는 용량 부족 오류가 발생한 Amazon EC2 인스턴스를 감지합니다. 작업을 수동으로 취소하면 후속 작업이 대기열의 헤드로 이동할 수 있습니다.

  • 작업이 멈춘 동안 statusReason 메시지: CAPACITY:INSUFFICIENT_INSTANCE_CAPACITY - Service cannot fulfill the capacity requested for instance type [instanceTypeName]

  • jobStateTimeLimitActions에 사용되는 reason: CAPACITY:INSUFFICIENT_INSTANCE_CAPACITY

  • statusReason에서 작업을 취소한 후의 메시지jobStateTimeLimitActions: Canceled by JobStateTimeLimit action due to reason: CAPACITY:INSUFFICIENT_INSTANCE_CAPACITY

참고:

  1. 이 감지가 작동하려면 AWS Batch 서비스 역할에 autoscaling:DescribeScalingActivities 권한이 필요합니다. 에 대한 서비스 연결 역할 사용 AWS Batch 서비스 연결 역할(SLR) 또는 AWS 관리형 정책: AWSBatchServiceRole 정책 관리형 정책을 사용하는 경우 권한 정책이 업데이트되므로 다른 조치를 취할 필요가 없습니다.

  2. SLR 또는 관리형 정책을 사용하는 경우 RUNNABLE 상태일 때 차단된 작업 대기열 이벤트와 업데이트된 작업 상태를 수신할 수 있도록 autoscaling:DescribeScalingActivitiesec2:DescribeSpotFleetRequestHistory 권한을 추가해야 합니다. 또한 AWS Batch 는 작업 대기열에 구성된 경우에도 jobStateTimeLimitActions 파라미터를 통해 cancellation 작업을 수행할 수 있도록 이러한 권한이 필요합니다.

  3. 다중 노드 병렬(MNP) 작업의 경우 연결된 우선 순위가 높은 Amazon EC2 컴퓨팅 환경에 insufficient capacity 오류가 발생하면 우선 순위가 낮은 컴퓨팅 환경에 이 오류가 발생하더라도 대기열이 차단됩니다.