View a markdown version of this page

Endpoint supportati da Amazon Bedrock - Amazon Bedrock

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

Endpoint supportati da Amazon Bedrock

Amazon Bedrock supporta vari endpoint per l'esecuzione di operazioni di inferenza. Effettuare richieste di inferenza

Operazioni di inferenza

Per le nuove applicazioni, consigliamo l'bedrock-runtimeendpoint. Supporta le API Bedrock-native InvokeModel e Converse, le API OpenAI-compatible Responses e Chat Completions e l'API Anthropic Messages, ed è qui che sono disponibili funzionalità di Amazon Bedrock come Guardrails, intelligent prompt routing e inferenza interregionale. Indirizza le richieste di inferenza del modello Regioni AWS con inferenza interregionale Amazon Bedrock supporta anche un secondo endpointbedrock-mantle, che attualmente offre funzionalità aggiuntive come l'uso di strumenti preconfigurati e lato server (inclusa la ricerca sul Web), l'inferenza asincrona con background=true e la creazione di progetti e spazi di lavoro. Per vedere quale endpoint supporta ciascun modello, consulta. Disponibilità degli endpoint per modelli

Endpoint API supportate Descrizione
bedrock-runtime.{region}.amazonaws.com (consigliato) InvokeModel/Converse/Completamenti delle chat/API delle risposte/API dei messaggi Inferenza tramite l'API Anthropic Messages Region-specific endpoint per effettuare richieste di inferenza per modelli ospitati in Amazon Bedrock utilizzando le API. InvokeModel/Converse/Chat Completions/Responses/Messages Per ulteriori informazioni sulle Bedrock-native operazioni, consulta le operazioni dell'API Amazon Bedrock Runtime. Le OpenAI-compatible API vengono richiamate sui /openai/v1 percorsi di questo endpoint anziché tramite gli SDK. AWS
bedrock-mantle.{region}.api.aws API delle risposte/API di completamento delle chat/API dei messaggi Inferenza tramite l'API Anthropic Messages Region-specific endpoint per effettuare richieste di inferenza per modelli ospitati in Amazon Bedrock utilizzando gli OpenAI-compatible endpoint e l'API Anthropic Messages.

Le applicazioni esistenti che utilizzano bedrock-mantle continuano a essere completamente supportate e non devono essere modificate. Entrambi gli endpoint consentono di importare una base di codice OpenAI SDK esistente in Amazon Bedrock modificando solo l'URL di base e la chiave API ed entrambi supportano le API OpenAI-compatible Responses and Chat Completions e l'API Anthropic Messages.

Le tabelle seguenti confrontano ciò che è disponibile su ciascun endpoint.

Nota

L'API Messages è disponibile su entrambi gli endpoint, ma le due superfici non supportano funzionalità identiche. In particolare, gli output strutturati (il output_config.format parametro) non sono supportatibedrock-mantle: le richieste che includono output_config.format vengono rifiutate con un errore 400. Per utilizzare gli output strutturati con i modelli Anthropic Claude, attiva Converse o le API. InvokeModel bedrock-runtime

Nota

L'API Responses è disponibile anche su entrambi gli endpoint senza il supporto di funzionalità identiche. In bedrock-runtime:

  • Le richieste sono sempre sincrone. background=trueviene rifiutato con un errore 400. Il store parametro è inalterato e mantiene l'impostazione predefinitatrue, pertanto le conversazioni a più turni memorizzate funzionano normalmente.

  • Server-side l'uso degli strumenti e gli strumenti preconfigurati non sono disponibili, inclusa la ricerca sul Web. Client-side l'uso dello strumento funziona su entrambi gli endpoint.

  • È supportato solo il progetto predefinito. Per informazioni, consulta Progetti (OpenAI-compatible).

  • Una risposta memorizzata appartiene a chi Regione AWS l'ha fornita. Il recupero, l'annullamento o l'eliminazione e la continuazione della conversazione conprevious_response_id, sono tutti gestiti da quella Regione.

Nota

bedrock-runtime, l'API Responses attribuisce l'utilizzo solo da parte del responsabile IAM. Per-request La codifica dei metadati e i profili di inferenza delle applicazioni non sono disponibili su di essa: una richiesta che nomina un profilo di inferenza dell'applicazione come destinazione di inferenza viene rifiutata con un errore 400. Ciò non influisce sull'inferenza interregionale: i profili di inferenza geografici e globali definiti dal sistema funzionano normalmente.

Disponibilità delle funzionalità Bedrock
Funzionalità bedrock-runtime bedrock-mantle
Guardrail
Memorizzazione nella cache rapida
Routing rapido intelligente
Nota

Il supporto per la memorizzazione rapida nella cache bedrock-mantle dipende dal modello specifico: I modelli a colpo d'occhio per i dettagli, consulta la scheda di ciascun modello nella sezione sottostante.

Approccio alla produttività e alle quote

Ogni endpoint utilizza un approccio diverso alla gestione del throughput.

  • bedrock-runtime— In molti servizi multi-tenant tradizionali, l'architettura è progettata in base a quote per account per gestire l'accesso equo e condiviso alle risorse condivise. Questo è l'approccio utilizzato con. bedrock-runtime Ogni modello ha quote di throughput fisse (RPM e TPM) per le quali è possibile richiedere aumenti. Per informazioni dettagliate, vedi Quote per l'endpoint bedrock-runtime.

  • bedrock-mantle— Questo endpoint è progettato con meccanismi avanzati di pianificazione e accodamento dei lavori che garantiscono una distribuzione equa supportando al contempo limiti di produttività iniziale più elevati. Questo design consente inoltre di bedrock-mantle ospitare un ampio set di modelli e fornire l'intera gamma di funzionalità disponibili nel catalogo dei modelli. Nella maggior parte dei casi, le richieste vengono evase immediatamente. In alcuni casi, una richiesta può essere messa brevemente in coda mentre i carichi di lavoro in corso vengono completati e la velocità effettiva diventa disponibile. Per informazioni dettagliate, consulta Quote per l'endpoint del substrato roccioso e Migliori pratiche di scalabilità e velocità di trasmissione.

Prezzi

Per-token il prezzo per lo stesso modello è identico per e. bedrock-runtime bedrock-mantle Scegli un endpoint in base alle API e alle funzionalità di cui hai bisogno, non ai costi. Per i prezzi attuali, consulta i prezzi di Amazon Bedrock.

Quando scegliere ciascun endpoint

Inizia con bedrock-runtime quando vuoi:

Usalo bedrock-mantle quando vuoi:

Entrambi gli endpoint possono essere utilizzati insieme dalla stessa applicazione, scegliendo in base al caso d'uso.

Riduci i costi di uscita dei dati con gli endpoint dell'interfaccia VPC

Se chiami Amazon Bedrock da un VPC, valuta la possibilità di utilizzare gli endpoint di interfaccia VPC (AWS PrivateLink) per mantenere il traffico all'interno della rete AWS ed evitare i costi di uscita dei dati associati ai gateway NAT o ai gateway Internet.