Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
Endpoint supportati da Amazon Bedrock
Amazon Bedrock supporta vari endpoint per l'esecuzione di operazioni di inferenza. Effettuare richieste di inferenza
Operazioni di inferenza
Per le nuove applicazioni, consigliamo l'bedrock-runtimeendpoint. Supporta le API Bedrock-native InvokeModel e Converse, le API OpenAI-compatible Responses e Chat Completions e l'API Anthropic Messages, ed è qui che sono disponibili funzionalità di Amazon Bedrock come Guardrails, intelligent prompt routing e inferenza interregionale. Indirizza le richieste di inferenza del modello Regioni AWS con inferenza interregionale Amazon Bedrock supporta anche un secondo endpointbedrock-mantle, che attualmente offre funzionalità aggiuntive come l'uso di strumenti preconfigurati e lato server (inclusa la ricerca sul Web), l'inferenza asincrona con background=true e la creazione di progetti e spazi di lavoro. Per vedere quale endpoint supporta ciascun modello, consulta. Disponibilità degli endpoint per modelli
| Endpoint | API supportate | Descrizione |
|---|---|---|
bedrock-runtime.{region}.amazonaws.com (consigliato) |
InvokeModel/Converse/Completamenti delle chat/API delle risposte/API dei messaggi Inferenza tramite l'API Anthropic Messages | Region-specific endpoint per effettuare richieste di inferenza per modelli ospitati in Amazon Bedrock utilizzando le API. InvokeModel/Converse/Chat Completions/Responses/Messages Per ulteriori informazioni sulle Bedrock-native operazioni, consulta le operazioni dell'API Amazon Bedrock Runtime. Le OpenAI-compatible API vengono richiamate sui /openai/v1 percorsi di questo endpoint anziché tramite gli SDK. AWS |
bedrock-mantle.{region}.api.aws |
API delle risposte/API di completamento delle chat/API dei messaggi Inferenza tramite l'API Anthropic Messages | Region-specific endpoint per effettuare richieste di inferenza per modelli ospitati in Amazon Bedrock utilizzando gli OpenAI-compatible endpoint e l'API Anthropic Messages. |
Le applicazioni esistenti che utilizzano bedrock-mantle continuano a essere completamente supportate e non devono essere modificate. Entrambi gli endpoint consentono di importare una base di codice OpenAI SDK esistente in Amazon Bedrock modificando solo l'URL di base e la chiave API ed entrambi supportano le API OpenAI-compatible Responses and Chat Completions e l'API Anthropic Messages.
Le tabelle seguenti confrontano ciò che è disponibile su ciascun endpoint.
| "Hello, World!" | bedrock-runtime |
bedrock-mantle |
|---|---|---|
| InvokeModel | ||
| Converse/ ConverseStream | ||
| Completamenti delle chat () OpenAI-compatible | ||
| API delle risposte () OpenAI-compatible | ||
| API per i messaggi (Anthropic-native) |
Nota
L'API Messages è disponibile su entrambi gli endpoint, ma le due superfici non supportano funzionalità identiche. In particolare, gli output strutturati (il output_config.format parametro) non sono supportatibedrock-mantle: le richieste che includono output_config.format vengono rifiutate con un errore 400. Per utilizzare gli output strutturati con i modelli Anthropic Claude, attiva Converse o le API. InvokeModel bedrock-runtime
Nota
L'API Responses è disponibile anche su entrambi gli endpoint senza il supporto di funzionalità identiche. In bedrock-runtime:
Le richieste sono sempre sincrone.
background=trueviene rifiutato con un errore 400. Ilstoreparametro è inalterato e mantiene l'impostazione predefinitatrue, pertanto le conversazioni a più turni memorizzate funzionano normalmente.Server-side l'uso degli strumenti e gli strumenti preconfigurati non sono disponibili, inclusa la ricerca sul Web. Client-side l'uso dello strumento funziona su entrambi gli endpoint.
È supportato solo il progetto predefinito. Per informazioni, consulta Progetti (OpenAI-compatible).
Una risposta memorizzata appartiene a chi Regione AWS l'ha fornita. Il recupero, l'annullamento o l'eliminazione e la continuazione della conversazione con
previous_response_id, sono tutti gestiti da quella Regione.
| Funzionalità | bedrock-runtime |
bedrock-mantle |
|---|---|---|
| Cross-region inferenza (profili geografici e globali) | ||
| Gestione stateful delle conversazioni | ||
| Inferenza asincrona (di lunga durata) | ||
| Client-side uso dello strumento | ||
| Server-side uso dello strumento | ||
| Pre-configured strumenti pronti all'uso | ||
| Progetti | Solo progetto predefinito | |
| Spazi di lavoro |
| Elemento | bedrock-runtime |
bedrock-mantle |
|---|---|---|
| Autenticazione AWS Sigv4 | ||
| Chiave API Bedrock (funziona anche con OpenAI SDK) | ||
| Attribuzione dell'uso | Principal IAM, etichettatura dei metadati per richiesta, profili di inferenza delle applicazioni Profili di inferenza delle applicazioni | Progetti (OpenAI-compatible)Progetti, spazi di lavoro |
Nota
Sìbedrock-runtime, l'API Responses attribuisce l'utilizzo solo da parte del responsabile IAM. Per-request La codifica dei metadati e i profili di inferenza delle applicazioni non sono disponibili su di essa: una richiesta che nomina un profilo di inferenza dell'applicazione come destinazione di inferenza viene rifiutata con un errore 400. Ciò non influisce sull'inferenza interregionale: i profili di inferenza geografici e globali definiti dal sistema funzionano normalmente.
| Funzionalità | bedrock-runtime |
bedrock-mantle |
|---|---|---|
| Guardrail | ||
| Memorizzazione nella cache rapida | ||
| Routing rapido intelligente |
Nota
Il supporto per la memorizzazione rapida nella cache bedrock-mantle dipende dal modello specifico: I modelli a colpo d'occhio per i dettagli, consulta la scheda di ciascun modello nella sezione sottostante.
Approccio alla produttività e alle quote
Ogni endpoint utilizza un approccio diverso alla gestione del throughput.
-
bedrock-runtime— In molti servizi multi-tenant tradizionali, l'architettura è progettata in base a quote per account per gestire l'accesso equo e condiviso alle risorse condivise. Questo è l'approccio utilizzato con.bedrock-runtimeOgni modello ha quote di throughput fisse (RPM e TPM) per le quali è possibile richiedere aumenti. Per informazioni dettagliate, vedi Quote per l'endpoint bedrock-runtime. -
bedrock-mantle— Questo endpoint è progettato con meccanismi avanzati di pianificazione e accodamento dei lavori che garantiscono una distribuzione equa supportando al contempo limiti di produttività iniziale più elevati. Questo design consente inoltre dibedrock-mantleospitare un ampio set di modelli e fornire l'intera gamma di funzionalità disponibili nel catalogo dei modelli. Nella maggior parte dei casi, le richieste vengono evase immediatamente. In alcuni casi, una richiesta può essere messa brevemente in coda mentre i carichi di lavoro in corso vengono completati e la velocità effettiva diventa disponibile. Per informazioni dettagliate, consulta Quote per l'endpoint del substrato roccioso e Migliori pratiche di scalabilità e velocità di trasmissione.
Prezzi
Per-token il prezzo per lo stesso modello è identico per e. bedrock-runtime bedrock-mantle Scegli un endpoint in base alle API e alle funzionalità di cui hai bisogno, non ai costi. Per i prezzi attuali, consulta i prezzi di Amazon Bedrock.
Quando scegliere ciascun endpoint
Inizia con bedrock-runtime quando vuoi:
Chiama le API OpenAI-compatible Responses o Chat Completions o l'API Anthropic Messages.
Usa le API Bedrock-native InvokeModel o Converse. Inferenza utilizzando l'API Converse
Usa le funzionalità di Amazon Bedrock disponibili solo su questo endpoint, come Guardrails e Intelligent Prompt Routing. Comprendere il routing di prompt intelligente in Amazon Bedrock
Usa l'inferenza interregionale per indirizzare le richieste su un'area geografica o a livello globale.
Usalo bedrock-mantle quando vuoi:
Crea flussi di lavoro agentici utilizzando strumenti lato server o strumenti preconfigurati, inclusa la ricerca sul Web. Ricerca sul Web
Esegui carichi di lavoro di inferenza asincroni o di lunga durata, comprese le richieste di risposte con.
background=trueCrea Progetti (OpenAI-compatible) o isola Spazi di lavoro () Anthropic-compatible i carichi di lavoro e monitora costi e utilizzo a livello di applicazione.
Utilizza un modello disponibile solo su.
bedrock-mantlePer informazioni, consulta Disponibilità degli endpoint per modelli.
Entrambi gli endpoint possono essere utilizzati insieme dalla stessa applicazione, scegliendo in base al caso d'uso.
Riduci i costi di uscita dei dati con gli endpoint dell'interfaccia VPC
Se chiami Amazon Bedrock da un VPC, valuta la possibilità di utilizzare gli endpoint di interfaccia VPC (AWS PrivateLink) per mantenere il traffico all'interno della rete AWS ed evitare i costi di uscita dei dati associati ai gateway NAT o ai gateway Internet.