Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Capacité et performance
Amazon Bedrock propose des options de capacité flexibles adaptées à vos exigences en matière de charge de travail et à votre budget. Comprendre les différences entre les niveaux à la demande (Flex, Priority, Standard), le niveau réservé, le traitement par lots et l'inférence interrégionale vous permet d'optimiser à la fois les performances et les coûts.
Options de capacité
| Type de capacité | Cas d’utilisation | Principales caractéristiques |
|---|---|---|
| On-Demand: Flexibilité | Charges de travail sporadiques à faible volume |
|
| On-Demand: Norme | Charges de travail de production régulières |
|
| On-Demand: Priorité | High-priority, applications sensibles à la latence |
|
| Niveau réservé | Charges de travail cohérentes et à volume élevé |
|
| Par lots | Large-scale, traitement non sensible au facteur temps |
|
| Cross-Region Inférence | Charges de travail pouvant être traitées en dehors d'une seule région |
|
Limites et & quotas
On-Demand Limites (par niveau)
| Tier | Gamme de tours par minute | Gamme TPM | Risque d'étranglement |
|---|---|---|---|
| Flexible | 10 à 100 | 5 K-50K | Élevée |
| Standard | 100 à 500 | 50 K-150K | Moyenne |
| Priority | 500 à 1000 et plus | K-300K150 et plus | Faible |
Capacité de rafale : disponible sur tous les niveaux pour les pointes courtes
Limites souples : augmentables grâce aux demandes de quotas de service
Model-specific: Les limites réelles varient selon le modèle de fondation
Limites de niveaux réservés
Engagement minimum : 1 unité modèle
Nombre maximum d'unités : spécifiques au compte et à la région
Input/output limites de jetons : en fonction des unités achetées
Aucune limitation du nombre de tours par minute dans les limites de la capacité achetée
Limites de traitement par lots
Taille de la tâche : jusqu'à 10 000 enregistrements par lot
Taille du fichier : 200 Mo maximum de fichier d'entrée
Délai de traitement : fenêtre de réalisation de 24 heures
Emplois simultanés : Region-specific quotas
Cross-Region Inférence
Hérite des limites de niveaux à la demande par région
Pas de frais supplémentaires liés aux quotas
Routage automatique (pas de gestion manuelle des limites)
Choix d'un niveau
Cadre de décision
| Scénario | Option recommandée | Pourquoi |
|---|---|---|
| Development/testing | Flexible | Coût le plus bas, acceptable pour la non-production |
| Production standard | Standard | Meilleur équilibre coût-performance |
| Applications critiques destinées aux utilisateurs | Priority | Fiabilité et performances par rapport aux coûts |
| Charge constante à volume élevé | Niveau réservé | 30 à 50 % d'économies avec engagement |
| Traitement de données en masse | Par lots | 50 % de réduction, charges de travail non urgentes |
| Mission-critical temps de disponibilité | Cross-Region Inférence | Disponibilité > coût |
Stratégies d'optimisation
Choisissez le bon On-Demand niveau
Commencez par Standard pour la plupart des charges de travail
Rétrograder vers Flex pour les environnements dev/test
Passez à la priorité uniquement lorsque la limitation affecte les utilisateurs
Surveillez les indicateurs d' CloudWatch accélération pour prendre des décisions éclairées
Transition vers le niveau réservé
Lorsque la charge constante dépasse 40 % des coûts à la demande
Calculez le seuil de rentabilité : (coût mensuel à la demande) par rapport à (engagement réservé)
Utilisez initialement un engagement d'un mois
Le niveau réservé peut fonctionner avec n'importe quel niveau à la demande
Utiliser Batch pour
Génération de données de formation
Retards en matière de modération de contenu
Génération de rapports
Pipelines d'enrichissement des données
Combiner les approches
Niveau réservé pour le trafic de référence
Standard à la demande pour les rafales modérées
Priorité à la demande pour les périodes de pointe critiques
Traitement par lots pour traitement hors ligne
Utilisez l' Cross-Region inférence pour les charges de travail qui peuvent être traitées en dehors d'une seule région.
Surveillance des coûts
Comparez les coûts des différents niveaux : Flex < Standard < Priority
Suivez les jetons par demande (optimisez les invites)
Utilisez CloudWatch des métriques pour l'utilisation et la limitation
Réglez des alarmes de facturation en cas de pics inattendus
Passez en revue l'utilisation du niveau réservé tous les mois
Évaluez les mises à niveau de niveau uniquement en cas de limitation