View a markdown version of this page

レート制限とクォータ - AWS での Claude プラットフォーム

翻訳は機械翻訳により提供されています。提供された翻訳内容と英語版の間で齟齬、不一致または矛盾がある場合、英語版が優先します。

レート制限とクォータ

Claude Platform on AWS は、サブスクライブ時に階層 1 のレート制限を割り当てます。Anthropic は、AWS クォータシステムではなく、レート制限を直接管理します。

デフォルトの制限

AWS の Claude Platform は、ファーストパーティ Claude API と同じ Anthropic の標準階層スケジュールを使用します。ワークスペースごとに階層 1 の制限が適用されます。制限はモデルファミリーごとにプールされます。たとえば、すべての Opus モデルは 1 つの結合制限を共有し、すべての Sonnet モデルは別のモデルを共有し、すべての Haiku モデルは 3 番目のモデルを共有します。

現在の階層 1 の値 (RPM、ITPM、OTPM) および上位階層のしきい値については、Anthropic ドキュメントウェブサイトの「レート制限」を参照してください。Anthropic ページは信頼できる情報源であり、制限が変更されると更新されます。

レート制限ヘッダー

すべてのレスポンスには、現在のレート制限ステータスを報告するヘッダーが含まれます。キーヘッダー:

  • anthropic-ratelimit-requests-limit — 1 分あたりの最大リクエスト数

  • anthropic-ratelimit-requests-remaining — 現在のウィンドウに残っているリクエスト

  • anthropic-ratelimit-requests-reset — リクエスト制限がリセットされた時刻 (RFC 3339)

  • anthropic-ratelimit-tokens-limit — 1 分あたりの合計トークン (入力 + 出力) の最大数

  • anthropic-ratelimit-tokens-remaining — 現在のウィンドウに残っているトークンの組み合わせ

  • anthropic-ratelimit-tokens-reset — 結合トークン制限がリセットされる時間 (RFC 3339)

  • anthropic-ratelimit-input-tokens-limit / -remaining / -reset — Input-token-specificヘッダー

  • anthropic-ratelimit-output-tokens-limit /-remaining/ -reset — Output-token-specificヘッダー

  • retry-after — 429 レスポンスで、再試行するまで待機する秒数

完全なセットについては、Anthropic ドキュメントウェブサイトの「レスポンスヘッダー」を参照してください。

制限の引き上げをリクエストする

ファーストパーティ Claude API とは異なり、階層の自動昇格は AWS の Claude プラットフォームには適用されません。制限の引き上げをリクエストするには、ワークスペース ID と希望するスループットで Anthropic アカウント担当者にお問い合わせください。階層のしきい値およびその他の詳細については、Anthropic ドキュメントウェブサイトの「レート制限」を参照してください。

レート制限エラー

レート制限を超えると、API は rate_limit_error型の HTTP 429 を返します。再試行ロジックにジッターを含むエクスポネンシャルバックオフを実装します。retry-after ヘッダーは、再試行するまでの待機秒数を示します。