기계 번역으로 제공되는 번역입니다. 제공된 번역과 원본 영어의 내용이 상충하는 경우에는 영어 버전이 우선합니다.
Grok 4.3
xAI - Grok 4.3
모델 세부 정보
Grok 4.3은 항상 작동하고 구성 가능한 추론 작업(없음, 낮음, 중간, 높음)을 제공하는 추론 우선 모델입니다. 추론은 선택 사항보다는 항상 활성화되므로 사고를 건너뛸 수 있는 모델보다 다단계 에이전트 루프에서 더 일관되게 작동합니다. 또한 다단계 에이전트를 구축하기 위한 강력한 도구 사용 및 지침 준수 기능과 대용량 추론을 비용 효율적으로 유지하는 데 도움이 되는 토큰 효율성을 제공합니다. Grok 4.3은 계약 검토, 판례 조사, 신용 계약 분석, 금융 문서 Q&A와 같은 엔터프라이즈 워크로드에 특히 적합하며 대화형 AI, 검색, 채팅 및 멀티턴 워크플로 전반에서 일관되고 고품질의 결과를 제공합니다. Grok 4.3은 가격 성능을 위해 설계된 Amazon Bedrock의 새로운 추론 엔진인 Mantle에서 실행되며 도구 호출, 구조화된 출력 및 응답 스트리밍을 지원합니다.
모델 출시 날짜: 2026년 6월 15일
EOL 이전: 2027년 6월 15일
레거시 기간: 최소 6개월
모델 수명 주기 정책: 모델 수명 주기(2026년 9월 7일 이전에 출시된 모델의 경우)
모델 EOL 날짜: 해당 사항 없음
최종 사용자 라이선스 계약 및 이용 약관: 보기
모델 수명 주기: 활성
컨텍스트 창: 1M0만 개의 토큰
추론: 지원됨(구성 가능: 없음, 낮음, 중간, 높음)
| 입력 모달리티 | 출력 모달리티 | 지원되는 APIs | 지원되는 엔드포인트 |
|---|---|---|---|
Chat Completions | bedrock-runtime | ||
Responses | bedrock-mantle | ||
Invoke | |||
Converse | |||
에서 bedrock-mantle이 모델은 기본가 /openai/v1/responses아닌에서 제공됩니다/v1/responses.
기능 및 기능
Bedrock 기능
bedrock-mantle 엔드포인트를 사용하여 지원되는 기능
| 지원됨 | 지원되지 않음 |
|---|---|
|
— |
요금
| 추론 옵션 | 입력 | 출력 | 캐시 읽기 |
|---|---|---|---|
| 리전 내 | 1.25 USD | 2.50 USD | 0.20 USD |
AWS GovCloud(미국 서부)
| 추론 옵션 | 입력 | 출력 | 캐시 읽기 |
|---|---|---|---|
| 리전 내 | 1.50 USD | 3.00 USD | 0.24 USD |
모든 가격은 토큰 1백만 개당입니다. 표시된 요금은 표준 티어에 대한 요금입니다. Grok 4.3은 리전 내 추론만 지원합니다.
Priority 및 Flex 계층 지원: Grok 4.3은 Standard 외에도 Priority 및 Flex 서비스 계층을 지원합니다. 우선 순위는 표준 토큰당 요금(75% 프리미엄)의 1.75배로 청구되고 Flex는 표준 요금(50% 할인)의 0.5배로 청구됩니다. 이러한 승수를 위에 표시된 표준 요금에 적용합니다. 각 서비스 계층에 대한 자세한 내용은 서비스 계층을 참조하세요.
프로그래밍 방식 액세스
다음 모델 IDs 및 엔드포인트 URLs 사용하여이 모델에 프로그래밍 방식으로 액세스합니다. 사용 가능한 APIs 및 엔드포인트에 대한 자세한 내용은 APIs 지원 및 엔드포인트 지원 단원을 참조하십시오.
| Endpoint | 모델 ID | 리전 내 엔드포인트 URL | 지리 추론 ID | 글로벌 추론 ID |
|---|---|---|---|---|
bedrock-mantle |
xai.grok-4.3 |
https://bedrock-mantle.{region}.api.aws/openai/v1 |
지원되지 않음 | 지원되지 않음 |
예를 들어 리전이 us-west-2(오레곤)인 경우 bedrock-mantle 엔드포인트 URL은 "https://bedrock-mantle.us-west-2.api.aws/openai/v1"이 됩니다.
서비스 티어
Amazon Bedrock은 워크로드 요구 사항에 맞는 여러 서비스 티어를 제공합니다. 표준은 약정 없이 pay-per-token 액세스를 제공합니다(필드 설정 "service_tier": "default" 또는 생략). Priority는 가격 프리미엄( 설정)에 가장 빠른 응답 시간을 제공합니다"service_tier": "priority". Flex는 유연하고 non-time-sensitive 워크로드( 세트 )에 대해 저렴한 액세스를 제공합니다"service_tier": "flex". 예약은 예측 가능한 워크로드에 대한 기간 약정과 함께 전용 처리량을 제공하며, 요청당이 아닌 계정 수준에서 설정됩니다(AWS 계정 팀에 문의하여 활성화). 자세한 내용은 서비스 계층을 참조하세요.
| 표준 | 우선 순위 | Flex | 예약됨 |
|---|---|---|---|
리전별 가용성
리전별 가용성 개요
Amazon Bedrock은 세 가지 추론 옵션을 제공합니다. 리전 내는 엄격한 규정 준수를 위해 요청을 단일 리전 내에 유지하고, 리전 내 리전(예: 미국, EU, APAC) 간 지리적 교차 리전 경로는 데이터 레지던시를 준수하면서 라우팅하며, 글로벌 교차 리전 경로는 레지던시 제약 조건이 없는 경우 전 세계 어디서나 라우팅합니다. 자세한 내용은 모델별 리전별 가용성 페이지를 참조하세요.
| 리전 | 리전 내 | 지리 | [Global] |
|---|---|---|---|
us-west-2 (오레곤) | |||
us-east-1 (버지니아 북부) | |||
us-east-2 (오하이오) | |||
us-gov-west-1 (GovCloud 서부) |
할당량과 제한
AWS 계정에는 서비스 성능을 유지하고 Amazon Bedrock을 적절하게 사용할 수 있는 기본 할당량이 있습니다. 계정에 할당된 기본 할당량은 리전 요인, 결제 기록, 사기 사용 및/또는 할당량 증가 요청 승인에 따라 업데이트될 수 있습니다. 자세한 내용은 Amazon Bedrock의 할당량 설명서를 참조하고 모델의 제한을 참조하세요.
bedrock-mantle 엔드포인트에서 온디맨드 처리량을 사용하는 경우 사용 가능한 처리량은 시간이 지남에 따라 확장됩니다. 할당량 내의 모든 요청이 수요가 많은 기간 동안 성공한다는 보장은 없으므로 점진적으로 확장하는 것이 중요합니다. 이 모델의 경우 기본 제한은 Service Quotas를 통해 직접 표시되지 않으므로 가이드로 램프를 따르는 것이 좋습니다.
샘플 코드
1단계 - AWS 계정: AWS 계정이 이미 있는 경우이 단계를 건너뜁니다. 를 처음 사용하는 경우 AWS 계정에
2단계 - API 키: Amazon Bedrock 콘솔
3단계 - SDK 가져오기:이 시작 안내서를 사용하려면 Python이 이미 설치되어 있어야 합니다. 그런 다음 사용 중인 APIs에 따라 관련 소프트웨어를 설치합니다.
4단계 - 환경 변수 설정: 인증에 API 키를 사용하도록 환경을 구성합니다.
5단계 - 첫 번째 추론 요청 실행: 파일을 로 저장 bedrock-first-request.py
사용 고려 사항 및 제한 사항
추론 노력 - 추론은 기본적으로 항상 활성화됩니다. (이론 비활성화),
{"effort": "none"}("low"기본값),"medium"또는reasoning파라미터를 통해 작업을 구성할 수 있습니다"high". 추론 콘텐츠는 암호화되며include: ["reasoning.encrypted_content"]응답 API 요청을 전달하여 반환할 수 있습니다. 암호화된 콘텐츠를 후속 턴으로 다시 전송하여 멀티턴 대화에 대한 추론 컨텍스트를 제공할 수 있습니다. Chat Completions API는 추론 토큰을 반환하지 않습니다.response = client.responses.create( model="xai.grok-4.3", reasoning={"effort": "high"}, include=["reasoning.encrypted_content"], input="Explain quantum entanglement simply." ) print(response.output_text)기본 파라미터 - Grok 4.3은 표준 OpenAI API 사양과 다른 기본값을 사용합니다.
temperature기본값은0.7(가 아님1),top_p기본값은0.95(가 아님1),max_completion_tokens기본값은 입니다131072. 애플리케이션에 다른 동작이 필요한 경우 이러한 값을 명시적으로 조정합니다.