View a markdown version of this page

Kapazität und Leistung - Amazon Bedrock

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Kapazität und Leistung

Amazon Bedrock bietet flexible Kapazitätsoptionen, die Ihren Workload-Anforderungen und Ihrem Budget entsprechen. Wenn Sie die Unterschiede zwischen On-Demand-Stufen (Flex, Priority, Standard), Reserved Tier, Batch-Verarbeitung und regionsübergreifender Inferenz kennen, können Sie sowohl Leistung als auch Kosten optimieren.

Kapazitätsoptionen

Typ der Kapazität Anwendungsfall Wesentliche Merkmale
On-Demand: Flex Sporadische Workloads mit geringem Volumen
  • Niedrigste Kosten pro Token

  • Best-effort Verfügbarkeit

  • Es kann zu Drosselungen kommen

  • Kein SLA

On-Demand: Standard Reguläre Arbeitslasten in der Produktion
  • Ausgewogenes Verhältnis von Kosten und Leistung

  • Garantiert moderater Durchsatz

  • Standard-SLA

  • Die häufigste Wahl

On-Demand: Priorität High-priority, latenzempfindliche Apps
  • Höchste On-Demand-Kosten

  • Zuweisung von erstklassigem Durchsatz

  • Verbessertes SLA

  • Reduziertes Drosselungsrisiko

Reservierte Stufe Konsistente, hochvolumige Workloads
  • Reservierte Modelleinheiten

  • Garantierte Kapazität

  • Verpflichtungen für 1 oder 3 Monate

  • Vorhersagbare Leistung

Batch Large-scale, nicht zeitkritische Verarbeitung
  • 50% Kostenersparnis im Vergleich zu On-Demand-Diensten

  • 24-Stunden-Bearbeitungsfenster

  • Ideal für Masseninferenzen

Cross-Region Inferenz Workloads, die außerhalb einer einzelnen Region verarbeitet werden können
  • Leitet Anfragen über die Regionen im Inferenzprofil weiter

  • Senkt die Token-Kosten für einige Modelle mit globalen Profilen

  • Verwendet On-Demand-Preise

Beschränkt & Kontingente

On-Demand Grenzwerte (nach Stufen)

Stufe Drehzahlbereich TPM-Bereich Drosselungsrisiko
Flex 10-100 5K-50K Hoch
Standard 100-500 50 K-150K Mittel
Priorität 500-1000+ 150 + K-300K Niedrig
  • Burst-Kapazität: Für kurze Spitzen auf allen Stufen verfügbar

  • Weiche Grenzwerte: Erhöhbar durch Anfragen nach Servicekontingenten

  • Model-specific: Die tatsächlichen Grenzwerte variieren je nach Basismodell

Limits für reservierte Stufen

  • Mindestanforderung: 1 Modelleinheit

  • Maximale Anzahl an Einheiten: Konto- und regionsspezifisch

  • Input/output Token-Limits: Basierend auf gekauften Einheiten

  • Keine Drehzahldrosselung innerhalb der gekauften Kapazität

Grenzwerte für die Stapelverarbeitung

  • Auftragsgröße: Bis zu 10.000 Datensätze pro Stapel

  • Dateigröße: Maximal 200 MB Eingabedatei

  • Verarbeitungszeit: 24-Stunden-Abschlussfenster

  • Gleichzeitige Aufträge: Region-specific Kontingente

Cross-Region Inferenz

  • Erbt On-Demand-Stufenlimits pro Region

  • Kein zusätzlicher Kontingentaufwand

  • Automatisches Routing (keine manuelle Limitverwaltung)

Wählen Sie eine Stufe

Entscheidungsrahmen

Szenario Empfohlene Option Warum
Development/testing Flex Niedrigste Kosten, akzeptabel für Nichtproduktionszwecke
Standardproduktion Standard Beste Preis-/Leistungsbilanz
Kritische, benutzerorientierte Apps Priorität Zuverlässigkeit und Leistung übersteigen die Kosten
Gleichbleibende Last bei hohem Ladevolumen Reservierte Stufe Kostenersparnisse von 30-50% bei vollem Engagement
Verarbeitung großer Datenmengen Batch 50% Rabatt, nicht dringende Workloads
Mission-critical Verfügbarkeit Cross-Region Inferenz Verfügbarkeit > Kosten

Strategien zur Optimierung

Wählen Sie die richtige On-Demand Stufe

  • Beginnen Sie für die meisten Workloads mit Standard

  • Downgrade auf Flex für Umgebungen dev/test

  • Führen Sie ein Upgrade auf Priority nur durch, wenn sich die Drosselung auf die Benutzer auswirkt

  • Überwachen Sie die CloudWatch Drosselungskennzahlen, um fundierte Entscheidungen zu treffen

Übergang zur reservierten Stufe

  • Wenn die konstante Auslastung 40% der On-Demand-Kosten übersteigt

  • Berechnen Sie die Gewinnschwelle: (monatliche Kosten auf Abruf) im Vergleich zu (reservierte Verpflichtung)

  • Verwenden Sie zunächst ein einmonatiges Abonnement

  • Die reservierte Stufe kann mit jeder On-Demand-Stufe kombiniert werden

Verwenden Sie Batch für

  • Generierung von Trainingsdaten

  • Rückstände bei der Moderation von Inhalten

  • Berichterstellung

  • Pipelines zur Datenanreicherung

Kombinieren Sie Ansätze

  • Reservierte Stufe für den Basisverkehr

  • Standard auf Abruf für moderate Ausfälle

  • Priorität auf Abruf in kritischen Spitzenzeiten

  • Batch für die Offline-Verarbeitung

  • Verwenden Sie Cross-Region Inferenz für Workloads, die außerhalb einer einzelnen Region verarbeitet werden können.

Überwachung der Kosten

  • Vergleichen Sie die Tarife: Flex < Standard < Priority

  • Tokens pro Anfrage nachverfolgen (Eingabeaufforderungen optimieren)

  • Nutze CloudWatch Metriken für Nutzung und Drosselung

  • Richten Sie Abrechnungsalarme für unerwartete Spitzen ein

  • Überprüfen Sie die Nutzung des reservierten Tarifs monatlich

  • Evaluieren Sie Stufen-Upgrades nur, wenn eine Drosselung erfolgt