기계 번역으로 제공되는 번역입니다. 제공된 번역과 원본 영어의 내용이 상충하는 경우에는 영어 버전이 우선합니다.
적응형 사고
적응형 사고를 통해 고정된 사고 토큰 예산이 필요한 대신 각 요청의 복잡성에 따라 언제 얼마나 많이 생각할지 Claude 동적으로 결정할 수 있습니다. Claude Fable 5.1, Claude Mythos 5.1, Claude Opus 5, Claude Sonnet 5 및 기타 사고 가능 모델에서 지원됩니다. 적응형 사고는 고정된를 통해 확장된 사고보다 더 나은 성능을 안정적으로 제공합니다budget_tokens. 베타 헤더는 필요하지 않습니다.
지원되는 모델은 다음과 같습니다.
| 모델 | 모델 ID |
|---|---|
Claude Fable 5.1 |
|
Claude Mythos 5.1 |
|
Claude Opus 5 |
|
Claude Sonnet 5 |
|
Claude Mythos 5 |
|
Claude Fable 5 |
|
Claude Opus 4.7 |
|
Claude Mythos 미리 보기 |
|
Claude Opus 4.6 |
|
Claude Sonnet 4.6 |
|
참고
Claude Fable 5.1, Claude Mythos 5.1, Claude Mythos 5, Claude Fable 5 및 Claude Mythos 미리 보기는 적응형 사고만 지원합니다. 수동 확장 사고(thinking.type: "enabled" 포함budget_tokens) 및 비활성화된 사고(thinking.type: "disabled")는 이러한 모델에서 지원되지 않으며 400 오류를 반환합니다. thinking.type: "adaptive"와 함께 output_config.effort를 사용하여 사고 동작을 제어합니다.
Claude Opus 4.7은 적응형 사고와 비활성화된 사고를 지원합니다. 생각을 끄려면를 사용합니다thinking.type: "disabled". 수동 확장 사고(thinking.type: "enabled" 포함budget_tokens)는 지원되지 않으며 400 오류를 반환합니다.
thinking.type: "enabled" 및 budget_tokens는 Claude Opus 4.6 및 Claude Sonnet 4.6에서 더 이상 사용되지 않으며 향후 모델 릴리스에서 제거될 예정입니다. 대신 노력 파라미터와 thinking.type: "adaptive" 함께를 사용합니다.
이전 모델(Claude Sonnet 4.5, Claude Opus 4.5 등)은 적응형 사고를 지원하지 않으며 thinking.type: "enabled"에가 필요합니다budget_tokens.
중요
Claude Sonnet 5 및 Claude Opus 5에서는 적응형 사고가 기본적으로 켜져 있습니다. thinking 필드를 생략하는 요청은 적응형 사고로 실행됩니다. 이는 동일한 요청이 생각하지 않고 실행된 Claude Sonnet 4.6의 변경 사항입니다. 따라서 변경 없이 Claude Sonnet 4.6에서 마이그레이션된 애플리케이션은 요청 본문이 변경되지 않았더라도 사고 출력을 생성하고 이러한 사고 토큰에 대해 출력 토큰으로 요금이 청구됩니다.
이러한 모델에 대한 생각을 완전히 끄려면를 "thinking": {"type": "disabled"} 명시적으로 전달합니다. thinking 필드를 생략해도 생각이 꺼지지 않고 적응형 생각이 선택됩니다. '생각하지 않음'을 0 또는 감소된 사고 토큰 예산으로 표현하는 클라이언트 설정도 꺼지지 않습니다. thinking.type: "enabled"budget_tokens는 Claude Sonnet 5에서 지원되지 않으며를 반환합니다ValidationException. 명시적 disabled 유형만 생각을 끕니다.
max_tokens는 생각과 응답 텍스트 등 총 출력에 대한 엄격한 제한이므로 이전에 생각하지 않고 실행된 워크로드max_tokens에 대해 다시 살펴봅니다. Claude Sonnet 4.6에서 비활성화된 사고를 사용하는 경우 비활성화하는 대신 Claude Sonnet 5에서 낮은 output_config.effort 수준의 적응형 사고를 고려하세요.
적응형 사고의 작동 방식
적응형 모드에서는 각 요청의 복잡성을 Claude 평가하고 생각할지 여부와 정도를 결정합니다. 기본 작업 수준(high)에서는 Claude가 거의 항상 생각하게 됩니다. 낮은 노력 수준에서 Claude는 더 간단한 문제에 대한 생각을 건너뛸 수 있습니다.
적응형 사고는 도 자동으로 활성화합니다인터리브 사고(베타). 즉, 도구 호출 간에 생각할 Claude 수 있으므로 에이전트 워크플로에 특히 효과적입니다.
API 요청"adaptive"에서를 thinking.type로 설정합니다.
노력 파라미터를 사용한 적응형 사고
적응형 사고와 노력 파라미터를 결합하여 사고의 정도를 안내할 수 Claude 있습니다. 노력 수준은 Claude의 사고 할당에 대한 소프트 지침 역할을 합니다.
| 작업 수준 | 사고 동작 |
|---|---|
max |
Claude는 항상 사고 깊이에 제약 없이 사고합니다. Claude Opus 4.6, Claude Sonnet 4.6 및 Claude Opus 5는를 지원합니다max. 지원되지 않는 모델에서 max를 사용하는 요청은 오류를 반환합니다. |
xhigh |
Claude는 항상 깊이를 확장합니다. Claude Opus 5 및 Claude Opus 4.6 전용. |
high(기본값) |
Claude는 항상 생각합니다. 복잡한 작업에 대한 심층 추론을 제공합니다. |
medium |
Claude는 중간 정도의 사고를 사용합니다. 매우 간단한 쿼리에 대한 생각은 건너뛸 수 있습니다. |
low |
Claude는 사고를 최소화합니다. 속도가 가장 중요한 간단한 작업에 대한 생각은 건너뜁니다. |
중요
effort 파라미터는 output_config 객체 내부가 아니라 요청 본문의 별도의 thinking 객체 내에 배치되어야 합니다. effort 내부에를 배치thinking하면가 생성됩니다ValidationException.
중요
사고가 비활성화된 경우 노력 한도(Claude Opus 5): Claude Opus 5는를 지원"thinking": {"type": "disabled"}하지만 사고가 비활성화된 경우 output_config.effort로 제한됩니다high. xhigh 또는 max 노력과 비활성화된 사고가 결합된 요청은를 반환합니다invalid_request_error. 이 한도는 중간 대화 시스템 메시지를 통해 설정된 회전당 노력에도 적용됩니다. xhigh 또는 max 노력을 사용하려면 적응형 사고(기본값)를 활성화하거나 thinking 파라미터를 완전히 생략합니다.
다음 예제에서는 InvokeModel API를 사용할 때 작업 수준을 설정하는 방법을 보여줍니다.
{ "anthropic_version": "bedrock-2023-05-31", "max_tokens": 16000, "thinking": { "type": "adaptive" }, "output_config": { "effort": "high" }, "messages": [{ "role": "user", "content": "Your prompt here" }] }
Converse API에서 적응형 사고 사용
Converse API를 사용하는 경우 내부에서 thinking 및 effort 파라미터를 전달합니다additionalModelRequestFields. 다음 예제에서는 기본 노력 수준의 적응형 사고를 보여줍니다.
import boto3, json bedrock_runtime = boto3.client(service_name='bedrock-runtime', region_name='us-east-2') response = bedrock_runtime.converse( modelId="us.anthropic.claude-opus-4-6-v1", messages=[{ "role": "user", "content": [{"text": "Explain why the sum of two even numbers is always even."}] }], additionalModelRequestFields={ "thinking": { "type": "adaptive" } } ) print(json.dumps(response["output"], indent=2, default=str))
노력 수준을 지정하려면에서 별도의 output_config 객체 내에 effort 필드를 추가합니다additionalModelRequestFields.
response = bedrock_runtime.converse( modelId="us.anthropic.claude-opus-4-6-v1", messages=[{ "role": "user", "content": [{"text": "What is 2 + 2?"}] }], additionalModelRequestFields={ "thinking": { "type": "adaptive" }, "output_config": { "effort": "low" } } )
턴당 작업 설정(베타)
이 기능은 AWS 서비스 약관에 정의된 베타 서비스입니다. Claude Fable 5.1 및 Claude Mythos 5.1에서는 전체 요청에 대해 한 번 설정하는 대신 대화를 통해 노력 수준을 변경할 수 있습니다. messages 배열의 어느 지점에서든 output_config.effort 값을 전달하는 시스템 메시지를 삽입합니다. 새 노력 수준은 그 이후의 턴에 적용됩니다. 요청은 응답 셰이프를 변경하지 않고 200을 반환합니다.
턴당 작업을 사용하려면 , mid-conversation-output-config-2026-07-01, mid-conversation-effort-2026-08-01 per-turn-control-2026-07-01또는 anthropic_beta 값 중 하나를 포함합니다per-message-effort-2026-07-01.
{ "anthropic_version": "bedrock-2023-05-31", "anthropic_beta": ["mid-conversation-effort-2026-08-01"], "max_tokens": 16000, "output_config": {"effort": "high"}, "messages": [ {"role": "user", "content": "First question"}, {"role": "assistant", "content": "First answer"}, {"role": "system", "content": [], "output_config": {"effort": "low"}}, {"role": "user", "content": "A simpler follow-up question"} ] }
참고
나열된 베타 값 중 하나가 없거나 교체당 작업을 지원하지 않는 모델에서는가 시스템 메시지output_config에 포함하는 요청이를 반환합니다400 messages.N.output_config: Extra inputs are not permitted. 턴당 task_budget는 지원되지 않으며 400도 반환합니다.
프롬프트 캐싱
adaptive 사고를 사용한 연속 요청은 프롬프트 캐시 중단점을 보존합니다. 그러나 adaptive 및 enabled/disabled 사고 모드 간에 전환하면 메시지에 대한 캐시 중단점이 끊어집니다. 시스템 프롬프트와 도구 정의는 모드 변경과 관계없이 캐시된 상태로 유지됩니다.
사고 동작 튜닝
Claude가 원하는 것보다 더 자주 생각하거나 덜 자주 생각하면 시스템 프롬프트에 지침을 추가할 수 있습니다.
Extended thinking adds latency and should only be used when it will meaningfully improve answer quality — typically for problems that require multi-step reasoning. When in doubt, respond directly.
주의
자주 생각Claude하지 않도록 조정하면 추론의 이점을 얻는 작업의 품질이 저하될 수 있습니다. 프롬프트 기반 튜닝을 프로덕션에 배포하기 전에 특정 워크로드에 미치는 영향을 측정합니다. 먼저 낮은 노력 수준으로 테스트하는 것이 좋습니다.
커넥터 텍스트 요약(베타)
Claude Fable 5에서는 모델이 도구 호출 간에 내보내는 텍스트(때로는 "connector text"라고도 함. 예: "Let me check that file next...")가 서버 측에서 요약되고 일반 텍스트 콘텐츠 블록이 아닌 사고 블록으로 반환됩니다. 사고 블록은 다른 사고 블록과 동일한 셰이프를 사용합니다(기본 omitted 디스플레이 아래에 서명이 있는 빈 텍스트).
고객에게 미치는 영향:
응답 셰이프: Claude Fable 5의 도구 사용 응답에는 이전 모델이 블록 간에 일반 텍스트를 내보내는 추가 사고
tool_use블록이 포함될 수 있습니다. 새로운 콘텐츠 블록 유형은 없습니다. 최종 어시스턴트 답변(모든 도구 사용이 완료된 후)은 영향을 받지 않으며 일반 텍스트로 유지됩니다.멀티턴 처리: 멀티턴 대화에서 이러한 사고 블록을 변경하지 않고 다시 전달합니다. 이는 보호된 사고와 동일한 처리입니다(패스백에서 서명이 검증됨, 다른 모델로 전송되는 경우 자동으로 제거됨).
범위: 커넥터 요약은 대화에이
tool_result있는 경우에만 적용됩니다. 새로운 대화에서 첫 번째 도구 호출 이전의 내레이션은 일반 텍스트로 유지됩니다. 짧은 텍스트 세그먼트는 요약 없이 일반 텍스트로 전달될 수 있습니다.
이 기능은 Claude Fable 5에 대해 서버 측에서 활성화됩니다. 고객 옵트인 또는 옵트아웃은 없습니다.