View a markdown version of this page

bedrock-runtime 엔드포인트 할당량 - Amazon Bedrock

기계 번역으로 제공되는 번역입니다. 제공된 번역과 원본 영어의 내용이 상충하는 경우에는 영어 버전이 우선합니다.

bedrock-runtime 엔드포인트 할당량

bedrock-runtime.region.amazonaws.com 엔드포인트는 Amazon Bedrock의 기본 추론 엔드포인트입니다. 이 엔드포인트에 대한 추론 트래픽은 모델별 토큰 기반 할당량에 의해 관리됩니다. Service Quotas 콘솔에서 Amazon Bedrock을 서비스로 선택하거나의 Amazon Bedrock 서비스 할당량 테이블에서 이러한 할당량을 볼 수 있습니다 AWS 일반 참조.

할당량 유형

bedrock-runtime 엔드포인트에 대한 추론은 다음과 같은 모델별 할당량에 의해 관리됩니다.

bedrock-runtime 모델당 할당량
할당량 Scope 설명
${model}에 대한 분당 교차 리전 InvokeModel 토큰 모델별, 리전별 교차 리전 추론 프로파일을 통해 호출할 때 계정이 모델에 사용할 수 있는 분당 최대 토큰 수(입력 + 출력, 결합).
${model}에 대한 분당 온디맨드 InvokeModel 토큰 모델별, 리전별 단일 리전에서 온디맨드 방식으로 호출할 때 계정이 모델에 사용할 수 있는 분당 최대 토큰 수(입력 + 출력, 결합).
${model}에 대한 일일 모델 간접 호출 최대 토큰 모델별, 리전별 계정이 모델에 사용할 수 있는 일일 최대 토큰 수(입력 + 출력, 결합)입니다. 기본적으로이 값은 분당 할당량에 24 × 60을 곱한 값입니다. 새는 감소된 할당량을 받을 AWS 계정 수 있습니다.
${model}에 대한 분당 InvokeModel 요청 모델별, 리전별 계정이 모델에 대해 제출할 수 있는 분당 최대 추론 요청 수입니다. RPM은 bedrock-runtime 엔드포인트의 일부 모델에는 적용되지만 다른 모델에는 적용되지 않습니다. 모델에 적용되는 정확한 할당량은 Service Quotas 콘솔을 참조하세요.

bedrock-runtime 엔드포인트 TPM 할당량은 모델당 단일 할당량에 대해 입력 토큰과 출력 토큰을 함께 계산합니다. bedrock-mantle 엔드포인트는 input-tokens-per-minute 및 분당 output-tokens-per-minute 할당량을 적용합니다. 자세한 내용은 섹션을 참조하세요bedrock-mantle 엔드포인트 할당량.

참고

bedrock-runtime 엔드포인트의 RPM 할당량은 모델별로 다릅니다. 예를 들어 Anthropic Claude Opus 4.7 및 Claude Opus 4.8과 같은 일부 모델은 RPM 할당량이 없으며이 섹션에 설명된 토큰 기반 할당량에 의해서만 관리됩니다. RPM 할당량이 있는 모델의 경우 Service Quotas 콘솔에서 정확한 값을 확인합니다.

출력 토큰은 모델별 연소율을 통해 할당량 사용량으로 변환됩니다. 토큰 기반 할당량을 계산하는 방법과 max_tokens 요청 파라미터가 공제에 미치는 영향에 대한 자세한 내용은 섹션을 참조하세요Amazon Bedrock에서 토큰을 계산하는 방법.

관련 런타임 할당량

다음 Amazon Bedrock 기능은 bedrock-runtime 엔드포인트를 통해 제공되며 별도의 할당량이 있습니다.

이러한 할당량은 bedrock-runtime 엔드포인트에만 적용되며 bedrock-mantle 엔드포인트에는 노출되지 않습니다.

할당량 증가 요청

계정에 대한 할당량 증가를 요청하는 단계는 Amazon Bedrock 서비스 할당량에 있는 할당량 테이블의 조정 가능 열에 있는 값에 따라 달라집니다.

중요

할당량 증가를 요청하기 전에 모델이 레거시 또는 더 이상 사용되지 않는 수명 주기 상태가 아닌지 확인합니다. 만료 예정인 모델에는 할당량 증가가 부여되지 않습니다. 모델 수명 주기 페이지에서 모델의 수명 주기 상태를 확인하고 대신 후속 모델로 마이그레이션하는 것이 좋습니다.

  • 할당량이 로 표시된 경우 Service Quotas 사용 설명서의 할당량 증가 요청 단계에 따라 할당량을 조정할 수 있습니다.

  • 모든 모델에 대해 다음 할당량에 대한 증가를 함께 요청할 수 없습니다.

    • ${model}에 대한 분당 교차 리전 InvokeModel 토큰

    • ${model}에 대한 분당 온디맨드 InvokeModel 토큰

    • ${model}에 대한 일일 모델 간접 호출 최대 토큰

    이러한 할당량의 조합에 대한 증가를 요청하려면 Service Quotas 사용 설명서의 할당량 증가 요청의 단계에 따라 ${model} 할당량에 대한 분당 교차 리전 InvokeModel 토큰 증가를 요청하세요. 이렇게 하면 지원 팀이 연락하여 다른 두 할당량을 늘릴 수 있는 옵션도 제공합니다.

    참고

    수요가 압도적인 관계로, 기존에 할당된 할당량을 소비하는 트래픽을 생성하는 고객에게 우선 순위가 부여됩니다. 이 조건을 충족하지 않으면 요청이 거부될 수 있습니다.

할당bedrock-mantle량 증가는 섹션을 참조하세요할당량 증가 요청.