翻訳は機械翻訳により提供されています。提供された翻訳内容と英語版の間で齟齬、不一致または矛盾がある場合、英語版が優先します。
レート制限とクォータ
Claude Platform on AWS は、サブスクライブ時に階層 1 のレート制限を割り当てます。Anthropic は、AWS クォータシステムではなく、レート制限を直接管理します。
デフォルトの制限
AWS の Claude Platform は、ファーストパーティ Claude API と同じ Anthropic の標準階層スケジュールを使用します。ワークスペースごとに階層 1 の制限が適用されます。制限はモデルファミリーごとにプールされます。たとえば、すべての Opus モデルは 1 つの結合制限を共有し、すべての Sonnet モデルは別のモデルを共有し、すべての Haiku モデルは 3 番目のモデルを共有します。
現在の階層 1 の値 (RPM、ITPM、OTPM) および上位階層のしきい値については、Anthropic ドキュメントウェブサイトの「レート制限
レート制限ヘッダー
すべてのレスポンスには、現在のレート制限ステータスを報告するヘッダーが含まれます。キーヘッダー:
-
anthropic-ratelimit-requests-limit— 1 分あたりの最大リクエスト数 -
anthropic-ratelimit-requests-remaining— 現在のウィンドウに残っているリクエスト -
anthropic-ratelimit-requests-reset— リクエスト制限がリセットされた時刻 (RFC 3339) -
anthropic-ratelimit-tokens-limit— 1 分あたりの合計トークン (入力 + 出力) の最大数 -
anthropic-ratelimit-tokens-remaining— 現在のウィンドウに残っているトークンの組み合わせ -
anthropic-ratelimit-tokens-reset— 結合トークン制限がリセットされる時間 (RFC 3339) -
anthropic-ratelimit-input-tokens-limit/-remaining/-reset— Input-token-specificヘッダー -
anthropic-ratelimit-output-tokens-limit/-remaining/-reset— Output-token-specificヘッダー -
retry-after— 429 レスポンスで、再試行するまで待機する秒数
完全なセットについては、Anthropic ドキュメントウェブサイトの「レスポンスヘッダー
制限の引き上げをリクエストする
ファーストパーティ Claude API とは異なり、階層の自動昇格は AWS の Claude プラットフォームには適用されません。制限の引き上げをリクエストするには、ワークスペース ID と希望するスループットで Anthropic アカウント担当者にお問い合わせください。階層のしきい値およびその他の詳細については、Anthropic ドキュメントウェブサイトの「レート制限
レート制限エラー
レート制限を超えると、API は rate_limit_error型の HTTP 429 を返します。再試行ロジックにジッターを含むエクスポネンシャルバックオフを実装します。retry-after ヘッダーは、再試行するまでの待機秒数を示します。