기계 번역으로 제공되는 번역입니다. 제공된 번역과 원본 영어의 내용이 상충하는 경우에는 영어 버전이 우선합니다.
bedrock-mantle 엔드포인트의 응답 API
Amazon Bedrock은 bedrock-runtime 및 bedrock-mantle 엔드포인트 모두에서 OpenAI 응답 API를 제공합니다. API를 사용하면 Amazon Bedrock 모델과 함께 익숙한 OpenAI SDKs 및 도구를 사용할 수 있으므로 코드 변경을 최소화하면서 기존 애플리케이션을 마이그레이션할 수 있습니다. 기본 URL과 API 키를 간단히 업데이트하면 됩니다. 새 애플리케이션의 경우 bedrock-runtime 엔드포인트를 사용하는 것이 좋습니다.
두 엔드포인트에는 동일한 기능 지원이 없습니다. 의 요청은 항상 동기식bedrock-runtime이며 서버 측 도구는 사용할 수 없으며 기본 프로젝트만 지원됩니다. 전체 비교는 섹션을 참조Amazon Bedrock에서 지원하는 엔드포인트하고 각 차이에 대한 자세한 내용은 섹션을 참조하세요bedrock-runtime 엔드포인트에서 응답 API 사용.
중요
OpenAI SDK를 Amazon Bedrock과 함께 사용하는 경우 OpenAI 엔드포인트가 아닌 Amazon Bedrock 엔드포인트를 가리켜야 합니다. 원하는 엔드포인트의 기본 URL을 선택하여 다음 환경 변수를 설정합니다.
# bedrock-runtime (recommended) OPENAI_BASE_URL="https://bedrock-runtime.<your-region>.amazonaws.com/openai/v1" # bedrock-mantle OPENAI_BASE_URL="https://bedrock-mantle.<your-region>.api.aws/v1" OPENAI_API_KEY="<your Bedrock API key>"
OpenAI API 키 또는 OpenAI 기본 URL()을 사용하지 마십시오https://api.openai.com/v1. Amazon Bedrock이 아닌에 OpenAI 직접 연결됩니다. Amazon Bedrock API 키를 생성하려면 섹션을 참조하세요API 키.
주요 이점은 다음과 같습니다.
-
비동기 추론 - 응답 API를 통해 장기 실행 추론 워크로드를 지원합니다.
bedrock-mantle에서만 사용할 수 있습니다. -
상태 저장 대화 관리 - 각 요청과 함께 대화 기록을 수동으로 전달하지 않고 컨텍스트를 자동으로 재구축합니다.
-
간소화된 도구 사용 - 에이전트 워크플로를 위한 간소화된 통합
-
유연한 응답 모드 - 스트리밍 응답과 비스트리밍 응답 모두 지원
-
간편한 마이그레이션 - 기존 OpenAI SDK 코드베이스와 호환
각 엔드포인트에는 자체 할당량 세트가 적용됩니다. 의 응답 트래픽bedrock-runtime의 경우 모델의 tokens-per-minute 및 tokens-per-day 할당량이 적용되며 해당 엔드포인트의 다른 추론 APIs와 공유됩니다. 섹션을 참조하세요bedrock-runtime 엔드포인트 할당량. bedrock-mantle의 경우 bedrock-mantle 엔드포인트 할당량 섹션을 참조하세요.
지원되는 리전 및 엔드포인트
bedrock-runtime 엔드포인트에서 응답 API는 AWS GovCloud(미국) 리전을 포함하여 해당 엔드포인트를 사용할 수 AWS 리전 있는 모든에서 사용할 수 있습니다. 목록은 엔드포인트별 리전별 가용성 단원을 참조하세요. 각 엔드포인트에서 API를 지원하는 모델은에 나열되어 있습니다모델별 엔드포인트 가용성.
bedrock-mantle 엔드포인트는 다음 AWS 리전에서 사용할 수 있습니다.
| 리전 이름 | 리전 | 엔드포인트 |
|---|---|---|
| 미국 동부(오하이오) | us-east-2 | bedrock-mantle.us-east-2.api.aws |
| 미국 동부(버지니아 북부) | us-east-1 | bedrock-mantle.us-east-1.api.aws |
| 미국 서부(오리건) | us-west-2 | bedrock-mantle.us-west-2.api.aws |
| 아시아 태평양(자카르타) | ap-southeast-3 | bedrock-mantle.ap-southeast-3.api.aws |
| 아시아 태평양(뭄바이) | ap-south-1 | bedrock-mantle.ap-south-1.api.aws |
| 아시아 태평양(시드니) | ap-southeast-2 | bedrock-mantle.ap-southeast-2.api.aws |
| 아시아 태평양(도쿄) | ap-northeast-1 | bedrock-mantle.ap-northeast-1.api.aws |
| 유럽(프랑크푸르트) | eu-central-1 | bedrock-mantle.eu-central-1.api.aws |
| 유럽(아일랜드) | eu-west-1 | bedrock-mantle.eu-west-1.api.aws |
| Europe (London) | eu-west-2 | bedrock-mantle.eu-west-2.api.aws |
| Europe (Milan) | eu-south-1 | bedrock-mantle.eu-south-1.api.aws |
| 유럽(스톡홀름) | eu-north-1 | bedrock-mantle.eu-north-1.api.aws |
| 남아메리카(상파울루) | sa-east-1 | bedrock-mantle.sa-east-1.api.aws |
| AWS GovCloud (US-West) | us-gov-west-1 | bedrock-mantle.us-gov-west-1.api.aws |
사전 조건
OpenAI APIs 사용하기 전에 다음이 있는지 확인합니다.
-
인증 - 다음을 사용하여 인증할 수 있습니다.
-
Amazon Bedrock API 키(OpenAISDK에 필요)
-
AWS 자격 증명(HTTP 요청에 지원됨)
-
-
OpenAI SDK(선택 사항) - SDK 기반 요청을 사용하는 경우 OpenAI Python SDK를 설치합니다.
-
환경 변수 - 다음 환경 변수를 설정합니다.
-
OPENAI_API_KEY- Amazon Bedrock API 키로 설정 -
OPENAI_BASE_URL- 해당 리전의 Amazon Bedrock 엔드포인트로 설정(예:https://bedrock-runtime.us-east-1.amazonaws.com/openai/v1또는https://bedrock-mantle.us-east-1.api.aws/v1)
-
-
권한 - 필요한 작업은 엔드포인트에 따라 다릅니다. 에서
bedrock-mantle추론은에 권한을 부여합니다bedrock-mantle:CreateInference. 에서는 추론 대상과 계정의 기본 프로젝트 모두에bedrock:InvokeModel대해bedrock-runtime권한을 부여하고 저장된 응답을 관리하면 해당 프로젝트의bedrock:GetInvoke,bedrock:CancelInvoke및bedrock:DeleteInvoke에 권한이 부여됩니다. 정책 예제는 모델 추론 실행을 위한 사전 조건단원을 참조하세요.
모델 API
모델 API를 사용하면 Mantle로 구동되는 Amazon Bedrock에서 사용 가능한 모델을 검색할 수 있습니다. 이 API를 사용하여 응답 API와 함께 사용할 수 있는 모델 목록을 검색합니다. 전체 API 세부 정보는 OpenAI 모델 설명서를 참조하세요
사용 가능한 모델 나열
사용 가능한 모델을 나열하려면 원하는 방법의 탭을 선택한 다음 다음 단계를 따릅니다.
응답 API
응답 API는 스트리밍, 백그라운드 처리 및 멀티턴 상호 작용을 지원하여 상태 저장 대화 관리를 제공합니다. 전체 API 세부 정보는 OpenAI 응답 설명서를 참조하세요
참고
모든 모델이 응답 API를 지원하는 것은 아닙니다. 응답 API를 지원하는 모델을 확인하려면 섹션을 참조하세요모델별 API 호환성.
응답 API가 대화 상태를 저장하는 방법
응답 API는 저장된 상태를 사용하여 멀티턴 대화를 활성화하고 previous_response_id 파라미터를 통해 이전 턴을 참조할 수 있습니다. 스토리지는 기본적으로 활성화되어 있지만 store 파라미터를 통해 요청당 비활성화할 수 있습니다. 저장된 응답은 프로젝트별로 범위가 지정됩니다. 한 프로젝트의 응답은 이전 응답으로 사용하거나 두 번째 프로젝트에서 읽을 수 없습니다. 프로젝트에 대한 자세한 내용은 섹션을 참조하세요프로젝트(OpenAI 호환).
-
store이true(기본값)인 경우 Amazon Bedrock은 입력 및 출력을 포함한 응답을 30일 동안 유지합니다. 이 기간 동안에서bedrock-mantle또는GET /v1/responses/{id}에서를 사용하여 응답을 전달previous_response_id하고 검색하여 후속 요청을 연결할 수GET /openai/v1/responses/{id}있습니다bedrock-runtime. 30일이 지나면 응답이 자동으로 삭제되고 더 이상 검색할 수 없습니다. -
이
store인 경우falseAmazon Bedrock은 요청 또는 응답의 데이터를 유지하지 않습니다.previous_response_id파라미터를 사용하여 대화를 계속할 수 없습니다.
기본값은 OpenAI 응답 API 사양과 일치true합니다. Amazon Bedrock이 대화 데이터를 보존하지 않도록 하려는 고객은 모든 요청에 false 대해 store를 명시적으로 로 설정하거나 계정의 데이터 보존 모드를 로 설정none하여 명시적store=true인 아웃라이트를 거부해야 합니다. 자세한 내용은 데이터 보존 단원을 참조하십시오.
저장된 데이터는 저장 시 암호화되며 호출 AWS 계정의 프로젝트 리소스로 범위가 지정됩니다. 데이터는 요청을 처리하기 위해서만 저장되며 다른 목적으로 사용되거나 보관되지 않습니다. 에서는 요청이 전송된 AWS 리전 에 보관bedrock-mantle됩니다. 에서 교차 리전 추론bedrock-runtime을 사용하는 요청은 다른에서 처리할 수 AWS 리전있으며 응답은 이를 처리한 리전에 저장되므로 전역 추론 프로파일을 사용하는 요청은가 라우팅하는 모든 상용 리전에 데이터를 저장할 수 있습니다. 데이터 레지던시 요구 사항이 있는 경우 글로벌 추론 프로파일이 아닌 지리적 추론 프로파일을 사용합니다.
기본 요청
응답을 생성하려면 원하는 방법의 탭을 선택한 다음 다음 단계를 따릅니다.
스트림 응답
응답 이벤트를 점진적으로 수신하려면 원하는 방법의 탭을 선택한 다음 다음 단계를 따릅니다.
bedrock-runtime 엔드포인트에서 응답 API 사용
의 응답 API는와 동일한 요청 및 응답 형식을 bedrock-runtime 사용bedrock-mantle하므로 OpenAI SDK는 둘 중 하나에 대해 작동합니다. 변경 사항은 기본 URL, 모델 IDs, 권한 및이 섹션에 설명된 몇 가지 동작입니다.
기본 URL 및 경로
기본 URL을 로 설정합니다https://bedrock-runtime.. API는 다음 경로에서 제공됩니다.region.amazonaws.com/openai/v1
POST /openai/v1/responses- 응답을 생성합니다.GET /openai/v1/responses/{id}- 저장된 응답을 검색합니다.POST /openai/v1/responses/{id}/cancel- 아직 진행 중인 응답을 취소합니다.DELETE /openai/v1/responses/{id}- 저장된 응답을 삭제합니다.
모델 IDs
파운데이션 모델 ID가 아닌 교차 리전 추론 프로파일의 이름을 모델로 지정합니다. OpenAI GPT 모델은 상용 리전의 us. 및 global. 프로파일과 AWS GovCloud(미국) 리전의 us-gov. 프로파일을 사용합니다. 예: us.openai.gpt-5.6-sol. 이 엔드포인트의 이러한 모델에서는 리전 내 추론을 사용할 수 없습니다. 각 모델의 프로필 ID는의 모델 카드를 참조하고 한 눈에 보는 모델라우팅 작동 방식은 섹션을 참조하세요교차 리전 추론을 AWS 리전 사용하여 간에 모델 추론 요청 라우팅.
권한
응답을 생성하면 추론 요청과 마찬가지로 추론 대상 및 계정의 기본 프로젝트에서 bedrock:InvokeModel (또는 bedrock:InvokeModelWithResponseStream)bedrock:InvokeModel의 두 리소스가 승인됩니다. 저장된 응답을 검색, 취소 및 삭제하면 프로젝트에서 각각 bedrock:GetInvoke, bedrock:CancelInvoke및 bedrock:DeleteInvoke가 승인됩니다. 개별 응답 IDs IAM 리소스가 아닙니다.
두 개의 조건 키를 사용하면 두 리소스 중 하나에 대한 정책이 다른 리소스를 제한할 수 있습니다. 추론 대상 권한 부여에는이 포함되며 bedrock:ProjectArn프로젝트 권한 부여에는 요청이 명명된 추론 프로파일 또는 파운데이션 모델에서 bedrock:ModelArn가치가 있는이 포함됩니다. 교차 리전 프로파일이 라우팅하는 대상 모델은 없습니다. 정책 예제는 모델 추론 실행을 위한 사전 조건단원을 참조하세요.
동작 차이
-
요청은 항상 동기식입니다.
background=true는 400 오류와 함께 거부됩니다.store파라미터는 영향을 받지 않으며 기본값인를 유지true하므로 저장된 멀티턴 대화는 정상적으로 작동합니다. -
model는를 제공하는 요청을 포함하여 모든 요청에 필요합니다previous_response_id. 이는 이전 응답에서 모델을 생략하고 상속할 수bedrock-mantle있는 OpenAI 응답 API 사양 및와 다릅니다. 모델은 요청이 승인된 대상의 일부이므로 요청 자체에서 이름이 지정되어야 합니다. -
웹 검색을 포함하여 서버 측 도구 사용 및 사전 구성된 도구는 사용할 수 없습니다. 클라이언트 측 도구 사용은 두 엔드포인트 모두에서 작동합니다.
-
기본 프로젝트만 지원됩니다.
OpenAI-Project헤더는default또는 자체 기본 프로젝트 ARN으로만 수락되며 다른 값은 거부됩니다. 프로젝트(OpenAI 호환)을(를) 참조하세요. -
애플리케이션 추론 프로필은 지원되지 않습니다. 추론 대상으로 이름을 지정하는 요청은 400 오류와 함께 거부됩니다. 시스템, 지리적 및 글로벌 추론 프로필은 정상적으로 작동합니다.
-
가드레일은 응답 API에 적용되지 않습니다. 이 엔드포인트의 GPT 모델에 가드레일을 적용하려면 Converse API를 대신 호출합니다.
-
저장된 응답은 해당 응답을 제공한 AWS 리전 에 속합니다. 검색, 취소 또는 삭제하고와 대화를 계속
previous_response_id하는 작업은 모두 해당 리전에서 처리됩니다. 존재하지 않거나, 다른 계정에 속하거나, 저장되지 않았기 때문에 찾을 수 없는 응답 ID는 모든 경우에 동일한 404 오류를 반환합니다.
모니터링 및 비용
모든 요청은 동기식이므로 CloudWatch 지표 및 모델 호출 로깅은 스트리밍 요청을 포함하여이 엔드포인트의 다른 추론 API에 대해 수행하는 것과 동일한 방식으로 응답 APIs에 대해 작동합니다. 사용량은 Converse 및 InvokeModel과 마찬가지로 추론 대상에 기인합니다. 기본 프로젝트는 결제 앵커가 아닙니다. Amazon Bedrock의 사용량 및 비용 추적을(를) 참조하세요.