View a markdown version of this page

Capacità e prestazioni - Amazon Bedrock

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

Capacità e prestazioni

Amazon Bedrock offre opzioni di capacità flessibili per soddisfare i requisiti di carico di lavoro e il budget. Comprendere le differenze tra i livelli on-demand (Flex, Priority, Standard), il livello riservato, l'elaborazione in batch e l'inferenza interregionale ti aiuta a ottimizzare prestazioni e costi.

Opzioni di capacità

Tipo di capacità Caso d'uso Caratteristiche chiave
On-Demand: Flex Carichi di lavoro sporadici e a basso volume
  • Costo per token più basso

  • Best-effort disponibilità

  • Potrebbe verificarsi una limitazione

  • Nessun SLA

On-Demand: Standard Carichi di lavoro di produzione regolari
  • Costi e prestazioni bilanciati

  • Garanzie di produttività moderate

  • SLA standard

  • La scelta più comune

On-Demand: Priorità High-priority, app sensibili alla latenza
  • Costo su richiesta più elevato

  • Allocazione del throughput premium

  • SLA migliorato

  • Rischio di limitazione ridotto

Livello riservato Carichi di lavoro coerenti e ad alto volume
  • Unità modello riservate

  • Capacità garantita

  • Impegni di 1 o 3 mesi

  • Prestazioni prevedibili

Archiviazione Large-scale, elaborazione non sensibile al fattore tempo
  • Risparmio sui costi del 50% rispetto a soluzioni on-demand

  • Finestra di elaborazione di 24 ore

  • Ideale per l'inferenza di massa

Cross-Region Inferenza Carichi di lavoro che possono essere elaborati al di fuori di una singola regione
  • Indirizza le richieste tra le regioni nel profilo di inferenza

  • Riduce i costi dei token per alcuni modelli con profili globali

  • Utilizza prezzi su richiesta

Limita & le quote

On-Demand Limiti (per livello)

Livello Intervallo RPM Intervallo TPM Rischio di limitazione
Flettere 10-100 5K-50K Elevata
Standard 100-500 50 K-150K Media
Priorità 500-1000 e oltre Più di 150 K-300K Bassa
  • Capacità Burst: disponibile su tutti i livelli per picchi brevi

  • Limiti flessibili: aumentabili tramite richieste di quote di servizio

  • Model-specific: I limiti effettivi variano in base al modello di base

Limiti di livello riservati

  • Impegno minimo: 1 unità modello

  • Unità massime: specifiche dell'account e della regione

  • Input/output Limiti dei token: in base alle unità acquistate

  • Nessuna limitazione degli RPM nell'ambito della capacità acquistata

Limiti di elaborazione in batch

  • Dimensione del lavoro: fino a 10.000 record per batch

  • Dimensione del file: massimo 200 MB di file di input

  • Tempo di elaborazione: finestra di completamento di 24 ore

  • Lavori simultanei: quote Region-specific

Cross-Region Inferenza

  • Eredita i limiti dei livelli su richiesta per regione

  • Nessun costo aggiuntivo relativo alla quota

  • Routing automatico (nessuna gestione manuale dei limiti)

Scelta di un livello

Quadro decisionale

Scenario Opzione consigliata Perché
Development/testing Flettere Costo più basso, accettabile in caso di mancata produzione
Produzione standard Standard Il miglior equilibrio tra costi e prestazioni
App critiche rivolte agli utenti Priorità Affidabilità e prestazioni rispetto ai costi
Carico costante ad alto volume Livello riservato Risparmio del 30-50% con impegno
Elaborazione di dati in blocco Archiviazione Sconto del 50% per carichi di lavoro non urgenti
Mission-critical operatività Cross-Region Inferenza Disponibilità > costo

Strategie di ottimizzazione

Scegli il On-Demand livello giusto

  • Inizia con Standard per la maggior parte dei carichi di lavoro

  • Effettua il downgrade a Flex per ambienti dev/test

  • Esegui l'upgrade a Priority solo quando la limitazione influisce sugli utenti

  • Monitora le CloudWatch metriche della limitazione per prendere decisioni informate

Transizione al livello riservato

  • Quando il carico costante supera il 40% dei costi su richiesta

  • Calcola il pareggio: (costo mensile su richiesta) rispetto a (impegno riservato)

  • Utilizza inizialmente un impegno di 1 mese

  • Il livello riservato può funzionare insieme a qualsiasi livello su richiesta

Usa Batch per

  • Generazione di dati di formazione

  • Backlog relativi alla moderazione dei contenuti

  • Generazione di report

  • Pipeline di arricchimento dei dati

Combina approcci

  • Livello riservato per il traffico di base

  • Standard su richiesta per raffiche moderate

  • Priorità su richiesta per i periodi di punta critici

  • Batch per l'elaborazione offline

  • Usa l' Cross-Region inferenza per i carichi di lavoro che possono essere elaborati al di fuori di una singola regione.

Monitoraggio dei costi

  • Confronta i costi dei vari livelli: Flex < Standard < Priority

  • Tieni traccia dei token per richiesta (ottimizza i prompt)

  • Usa le CloudWatch metriche per l'utilizzo e la limitazione

  • Imposta allarmi di fatturazione per picchi imprevisti

  • Controlla mensilmente l'utilizzo del livello riservato

  • Valuta gli upgrade di livello solo quando si verifica una limitazione