Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
Capacità e prestazioni
Amazon Bedrock offre opzioni di capacità flessibili per soddisfare i requisiti di carico di lavoro e il budget. Comprendere le differenze tra i livelli on-demand (Flex, Priority, Standard), il livello riservato, l'elaborazione in batch e l'inferenza interregionale ti aiuta a ottimizzare prestazioni e costi.
Opzioni di capacità
| Tipo di capacità | Caso d'uso | Caratteristiche chiave |
|---|---|---|
| On-Demand: Flex | Carichi di lavoro sporadici e a basso volume |
|
| On-Demand: Standard | Carichi di lavoro di produzione regolari |
|
| On-Demand: Priorità | High-priority, app sensibili alla latenza |
|
| Livello riservato | Carichi di lavoro coerenti e ad alto volume |
|
| Archiviazione | Large-scale, elaborazione non sensibile al fattore tempo |
|
| Cross-Region Inferenza | Carichi di lavoro che possono essere elaborati al di fuori di una singola regione |
|
Limita & le quote
On-Demand Limiti (per livello)
| Livello | Intervallo RPM | Intervallo TPM | Rischio di limitazione |
|---|---|---|---|
| Flettere | 10-100 | 5K-50K | Elevata |
| Standard | 100-500 | 50 K-150K | Media |
| Priorità | 500-1000 e oltre | Più di 150 K-300K | Bassa |
Capacità Burst: disponibile su tutti i livelli per picchi brevi
Limiti flessibili: aumentabili tramite richieste di quote di servizio
Model-specific: I limiti effettivi variano in base al modello di base
Limiti di livello riservati
Impegno minimo: 1 unità modello
Unità massime: specifiche dell'account e della regione
Input/output Limiti dei token: in base alle unità acquistate
Nessuna limitazione degli RPM nell'ambito della capacità acquistata
Limiti di elaborazione in batch
Dimensione del lavoro: fino a 10.000 record per batch
Dimensione del file: massimo 200 MB di file di input
Tempo di elaborazione: finestra di completamento di 24 ore
Lavori simultanei: quote Region-specific
Cross-Region Inferenza
Eredita i limiti dei livelli su richiesta per regione
Nessun costo aggiuntivo relativo alla quota
Routing automatico (nessuna gestione manuale dei limiti)
Scelta di un livello
Quadro decisionale
| Scenario | Opzione consigliata | Perché |
|---|---|---|
| Development/testing | Flettere | Costo più basso, accettabile in caso di mancata produzione |
| Produzione standard | Standard | Il miglior equilibrio tra costi e prestazioni |
| App critiche rivolte agli utenti | Priorità | Affidabilità e prestazioni rispetto ai costi |
| Carico costante ad alto volume | Livello riservato | Risparmio del 30-50% con impegno |
| Elaborazione di dati in blocco | Archiviazione | Sconto del 50% per carichi di lavoro non urgenti |
| Mission-critical operatività | Cross-Region Inferenza | Disponibilità > costo |
Strategie di ottimizzazione
Scegli il On-Demand livello giusto
Inizia con Standard per la maggior parte dei carichi di lavoro
Effettua il downgrade a Flex per ambienti dev/test
Esegui l'upgrade a Priority solo quando la limitazione influisce sugli utenti
Monitora le CloudWatch metriche della limitazione per prendere decisioni informate
Transizione al livello riservato
Quando il carico costante supera il 40% dei costi su richiesta
Calcola il pareggio: (costo mensile su richiesta) rispetto a (impegno riservato)
Utilizza inizialmente un impegno di 1 mese
Il livello riservato può funzionare insieme a qualsiasi livello su richiesta
Usa Batch per
Generazione di dati di formazione
Backlog relativi alla moderazione dei contenuti
Generazione di report
Pipeline di arricchimento dei dati
Combina approcci
Livello riservato per il traffico di base
Standard su richiesta per raffiche moderate
Priorità su richiesta per i periodi di punta critici
Batch per l'elaborazione offline
Usa l' Cross-Region inferenza per i carichi di lavoro che possono essere elaborati al di fuori di una singola regione.
Monitoraggio dei costi
Confronta i costi dei vari livelli: Flex < Standard < Priority
Tieni traccia dei token per richiesta (ottimizza i prompt)
Usa le CloudWatch metriche per l'utilizzo e la limitazione
Imposta allarmi di fatturazione per picchi imprevisti
Controlla mensilmente l'utilizzo del livello riservato
Valuta gli upgrade di livello solo quando si verifica una limitazione