View a markdown version of this page

Capacité et performance - Amazon Bedrock

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Capacité et performance

Amazon Bedrock propose des options de capacité flexibles adaptées à vos exigences en matière de charge de travail et à votre budget. Comprendre les différences entre les niveaux à la demande (Flex, Priority, Standard), le niveau réservé, le traitement par lots et l'inférence interrégionale vous permet d'optimiser à la fois les performances et les coûts.

Options de capacité

Type de capacité Cas d’utilisation Principales caractéristiques
On-Demand: Flexibilité Charges de travail sporadiques à faible volume
  • Coût par jeton le plus bas

  • Best-effort disponibilité

  • Peut présenter des problèmes d'étranglement

  • Pas de SLA

On-Demand: Norme Charges de travail de production régulières
  • Coûts et performances équilibrés

  • Garanties de débit modéré

  • SLA standard

  • Choix le plus courant

On-Demand: Priorité High-priority, applications sensibles à la latence
  • Coût à la demande le plus élevé

  • Allocation de débit premium

  • SLA amélioré

  • Risque d'étranglement réduit

Niveau réservé Charges de travail cohérentes et à volume élevé
  • Unités modèles réservées

  • Capacité garantie

  • Engagements de 1 ou 3 mois

  • Des performances prévisibles

Par lots Large-scale, traitement non sensible au facteur temps
  • 50 % d'économies par rapport à la demande

  • Fenêtre de traitement de 24 heures

  • Idéal pour les inférences groupées

Cross-Region Inférence Charges de travail pouvant être traitées en dehors d'une seule région
  • Achemine les demandes entre les régions dans le profil d'inférence

  • Réduit les coûts des jetons pour certains modèles dotés de profils mondiaux

  • Utilise la tarification à la demande

Limites et & quotas

On-Demand Limites (par niveau)

Tier Gamme de tours par minute Gamme TPM Risque d'étranglement
Flexible 10 à 100 5 K-50K Élevée
Standard 100 à 500 50 K-150K Moyenne
Priority 500 à 1000 et plus K-300K150 et plus Faible
  • Capacité de rafale : disponible sur tous les niveaux pour les pointes courtes

  • Limites souples : augmentables grâce aux demandes de quotas de service

  • Model-specific: Les limites réelles varient selon le modèle de fondation

Limites de niveaux réservés

  • Engagement minimum : 1 unité modèle

  • Nombre maximum d'unités : spécifiques au compte et à la région

  • Input/output limites de jetons : en fonction des unités achetées

  • Aucune limitation du nombre de tours par minute dans les limites de la capacité achetée

Limites de traitement par lots

  • Taille de la tâche : jusqu'à 10 000 enregistrements par lot

  • Taille du fichier : 200 Mo maximum de fichier d'entrée

  • Délai de traitement : fenêtre de réalisation de 24 heures

  • Emplois simultanés : Region-specific quotas

Cross-Region Inférence

  • Hérite des limites de niveaux à la demande par région

  • Pas de frais supplémentaires liés aux quotas

  • Routage automatique (pas de gestion manuelle des limites)

Choix d'un niveau

Cadre de décision

Scénario Option recommandée Pourquoi
Development/testing Flexible Coût le plus bas, acceptable pour la non-production
Production standard Standard Meilleur équilibre coût-performance
Applications critiques destinées aux utilisateurs Priority Fiabilité et performances par rapport aux coûts
Charge constante à volume élevé Niveau réservé 30 à 50 % d'économies avec engagement
Traitement de données en masse Par lots 50 % de réduction, charges de travail non urgentes
Mission-critical temps de disponibilité Cross-Region Inférence Disponibilité > coût

Stratégies d'optimisation

Choisissez le bon On-Demand niveau

  • Commencez par Standard pour la plupart des charges de travail

  • Rétrograder vers Flex pour les environnements dev/test

  • Passez à la priorité uniquement lorsque la limitation affecte les utilisateurs

  • Surveillez les indicateurs d' CloudWatch accélération pour prendre des décisions éclairées

Transition vers le niveau réservé

  • Lorsque la charge constante dépasse 40 % des coûts à la demande

  • Calculez le seuil de rentabilité : (coût mensuel à la demande) par rapport à (engagement réservé)

  • Utilisez initialement un engagement d'un mois

  • Le niveau réservé peut fonctionner avec n'importe quel niveau à la demande

Utiliser Batch pour

  • Génération de données de formation

  • Retards en matière de modération de contenu

  • Génération de rapports

  • Pipelines d'enrichissement des données

Combiner les approches

  • Niveau réservé pour le trafic de référence

  • Standard à la demande pour les rafales modérées

  • Priorité à la demande pour les périodes de pointe critiques

  • Traitement par lots pour traitement hors ligne

  • Utilisez l' Cross-Region inférence pour les charges de travail qui peuvent être traitées en dehors d'une seule région.

Surveillance des coûts

  • Comparez les coûts des différents niveaux : Flex < Standard < Priority

  • Suivez les jetons par demande (optimisez les invites)

  • Utilisez CloudWatch des métriques pour l'utilisation et la limitation

  • Réglez des alarmes de facturation en cas de pics inattendus

  • Passez en revue l'utilisation du niveau réservé tous les mois

  • Évaluez les mises à niveau de niveau uniquement en cas de limitation