翻訳は機械翻訳により提供されています。提供された翻訳内容と英語版の間で齟齬、不一致または矛盾がある場合、英語版が優先します。
Amazon Bedrock でサポートされているエンドポイント
Amazon Bedrock は、推論オペレーションを実行するためのさまざまなエンドポイントをサポートしています。
推論オペレーション
新しいアプリケーションの場合は、 bedrock-runtimeエンドポイントをお勧めします。Bedrock ネイティブの InvokeModel API と Converse APIs、OpenAI 互換の Responses and Chat Completions APIs、および Anthropic Messages API をサポートしており、ガードレール、インテリジェントプロンプトルーティング、クロスリージョン推論などの Amazon Bedrock 機能を利用できます。Amazon Bedrock は 2 番目のエンドポイントである もサポートしています。これは現在bedrock-mantle、サーバー側および事前設定されたツールの使用 (ウェブ検索を含む)、 を使用した非同期推論background=true、プロジェクトとワークスペースの作成などの追加機能を提供します。各モデルがサポートするエンドポイントを確認するには、「」を参照してくださいモデル別のエンドポイントの可用性。
| Endpoint | サポートされている APIs | 説明 |
|---|---|---|
bedrock-runtime.{region}.amazonaws.com (推奨) |
InvokeModel / Converse / Chat Completions / Responses API / Messages API | InvokeModel/Converse/Chat Completions/Responses/Messages API を使用して Amazon Bedrock でホストされているモデルの推論リクエストを行うためのリージョン固有のエンドポイント。 Completions/Responses/Messages APIs Bedrock ネイティブオペレーションの詳細については、「Amazon Bedrock ランタイム API オペレーション」を参照してください。OpenAI 互換 APIsは、SDK ではなく、このエンドポイントの/openai/v1パスで呼び出されます。 AWS SDKs |
bedrock-mantle.{region}.api.aws |
Responses API / Chat Completions API / Messages API | OpenAI 互換エンドポイントと Anthropic Messages API を使用して Amazon Bedrock でホストされているモデルの推論リクエストを行うためのリージョン固有のエンドポイント。 |
を使用する既存のアプリケーションはbedrock-mantle引き続き完全にサポートされるため、変更する必要はありません。どちらのエンドポイントでも、ベース URL と API キーのみを変更することで、既存の OpenAI SDK コードベースを Amazon Bedrock に持ち込むことができ、どちらも OpenAI 互換の Responses and Chat Completions APIs と Anthropic Messages API をサポートしています。
次の表は、各エンドポイントで使用できるものを比較したものです。
| API | bedrock-runtime |
bedrock-mantle |
|---|---|---|
| InvokeModel | ||
| Converse/ConverseStream | ||
| チャットの完了 (OpenAI 互換) | ||
| Responses API (OpenAI 互換) | ||
| Messages API (Anthropic-native) |
注記
Messages API は両方のエンドポイントで使用できますが、2 つの表面は同じ機能をサポートしていません。特に、構造化出力 ( output_config.formatパラメータ) は ではサポートされていませんbedrock-mantle。 を含むリクエストoutput_config.formatは 400 エラーで拒否されます。Anthropic Claude モデルで構造化出力を使用するには、 で Converse または InvokeModel APIsますbedrock-runtime。
注記
Responses API は、同じ機能をサポートしていない両方のエンドポイントでも使用できます。bedrock-runtime の場合
リクエストは常に同期されます。
background=trueは 400 エラーで拒否されます。storeパラメータは影響を受けず、デフォルトの のままになるためtrue、保存されているマルチターン会話は正常に機能します。サーバー側のツールの使用や、ウェブ検索などの事前設定されたツールは利用できません。 ウェブ検索クライアント側のツールの使用は、両方のエンドポイントで機能します。
デフォルトのプロジェクトのみがサポートされています。「プロジェクト (OpenAI 互換)」を参照してください。
保存されたレスポンスは、それ AWS リージョン に対応した に属します。それを取得、キャンセル、または削除し、 との会話を続行すると
previous_response_id、すべてそのリージョンによって処理されます。
| 機能 | bedrock-runtime |
bedrock-mantle |
|---|---|---|
| クロスリージョン推論 (地理的プロファイルとグローバルプロファイル) | ||
| ステートフルな会話管理 | ||
| 非同期 (長時間実行) 推論 | ||
| クライアント側のツールの使用 | ||
| サーバー側のツールの使用 | ||
| 事前設定されたready-to-useツール | ||
| プロジェクト | デフォルトプロジェクトのみ | |
| WorkSpaces |
| Item | bedrock-runtime |
bedrock-mantle |
|---|---|---|
| AWS SigV4 認証 | ||
| Bedrock API キー (OpenAI SDK でも動作) | ||
| 使用状況属性 | IAM プリンシパル、リクエストごとのメタデータタグ付け、アプリケーション推論プロファイル | プロジェクト、ワークスペース |
注記
ではbedrock-runtime、Responsions API は IAM プリンシパルによる使用のみを属性します。リクエストごとのメタデータタグ付けとアプリケーション推論プロファイルは使用できません。アプリケーション推論プロファイルを推論ターゲットとして指定するリクエストは、400 エラーで拒否されます。これはクロスリージョン推論には影響しません。システム定義の地理的推論プロファイルとグローバル推論プロファイルは正常に機能します。
| 機能 | bedrock-runtime |
bedrock-mantle |
|---|---|---|
| ガードレール | ||
| プロンプトキャッシュ | ||
| インテリジェントなプロンプトルーティング |
注記
のプロンプトキャッシュのサポートbedrock-mantleは、特定のモデルによって異なります。モデルの概要詳細については、「」の各モデルカードを参照してください。
スループットとクォータのアプローチ
各エンドポイントは、スループットを管理するために異なるアプローチを使用します。
-
bedrock-runtime– 従来の多くのマルチテナントサービスでは、このアーキテクチャは、共有リソースへの公平な共有アクセスを管理するためにアカウントごとのクォータを中心に設計されています。これは、 で使用されるアプローチですbedrock-runtime。各モデルには、引き上げをリクエストできる固定スループットクォータ (RPM と TPM) があります。詳細については、「bedrock-runtime エンドポイントのクォータ」を参照してください。 -
bedrock-mantle– このエンドポイントは、より高い初期スループット制限をサポートしながら公平な配分を実現する高度なスケジューリングとワークキューイングメカニズムで設計されています。また、この設計によりbedrock-mantle、 はさまざまなモデルをホストし、モデルカタログ全体で利用できる幅広い機能を提供できます。ほとんどの場合、リクエストはすぐに処理されます。場合によっては、処理中のワークロードが完了し、スループットが利用可能になったときに、リクエストが一時的にキューに入れられることがあります。詳細については、「bedrock-mantle エンドポイントのクォータ」および「スケーリングとスループットのベストプラクティス」を参照してください。
料金
同じモデルのトークンごとの料金は、 bedrock-runtimeと で同じですbedrock-mantle。コストではなく、必要な APIsと機能に基づいてエンドポイントを選択します。現在の料金については、「Amazon Bedrock の料金
各エンドポイントを選択するタイミング
以下を行うbedrock-runtimeときは、 から始めます。
OpenAI 互換の Responses または Chat Completions APIs、または Anthropic Messages API を呼び出します。
Bedrock ネイティブの InvokeModel API または Converse APIs。
ガードレールやインテリジェントなプロンプトルーティングなど、このエンドポイントでのみ使用できる Amazon Bedrock の機能を使用します。
クロスリージョン推論を使用して、リージョン間またはグローバルにリクエストをルーティングします。
次のbedrock-mantle場合に使用します。
サーバー側のツールを使用するか、ウェブ検索などの事前設定されたツールを使用して、エージェントワークフローを構築します。
でレスポンスリクエストを含む、非同期または長時間実行される推論ワークロードを実行します
background=true。プロジェクト (OpenAI 互換) または WorkSpaces (Anthropic 互換)を作成してワークロードを分離し、コストと使用状況をアプリケーションレベルで追跡します。
でのみ使用可能なモデルを使用します
bedrock-mantle。「モデル別のエンドポイントの可用性」を参照してください。
両方のエンドポイントを同じアプリケーションから一緒に使用できます。ユースケースごとに選択します。
VPC インターフェイスエンドポイントを使用してデータ出力コストを削減する
VPC 内から Amazon Bedrock を呼び出す場合は、VPC インターフェイスエンドポイント (AWS PrivateLink) を使用してトラフィックを AWS ネットワーク内に保持し、NAT ゲートウェイまたはインターネットゲートウェイに関連するデータ出力料金を回避することを検討してください。