View a markdown version of this page

Modelle auf Amazon bereitstellen SageMaker HyperPod - Amazon SageMaker KI

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Modelle auf Amazon bereitstellen SageMaker HyperPod

Amazon geht SageMaker HyperPod nun über Schulungen hinaus und bietet eine umfassende Inferenzplattform, die die Flexibilität von Kubernetes mit der betrieblichen Exzellenz verwalteter Dienste kombiniert. AWS Implementieren, skalieren und optimieren Sie Ihre Modelle für maschinelles Lernen mit Zuverlässigkeit auf Unternehmensebene, indem Sie während des gesamten Modelllebenszyklus dieselbe HyperPod Rechenleistung verwenden.

Amazon SageMaker HyperPod bietet flexible Bereitstellungsschnittstellen, mit denen Sie Modelle mit mehreren Methoden bereitstellen können, darunter kubectl, Python SDK, Amazon SageMaker Studio UI oder CLI. HyperPod Der Service bietet erweiterte Autoscaling-Funktionen mit dynamischer Ressourcenzuweisung, die sich automatisch an den Bedarf anpasst. Darüber hinaus umfasst er umfassende Beobachtungs- und Überwachungsfunktionen, die wichtige Kennzahlen wie Time-to-First-Token, Latenz und GPU-Auslastung verfolgen, um Sie bei der Leistungsoptimierung zu unterstützen.

Anmerkung

Bei der Bereitstellung auf GPU-enabled Instances können Sie die GPU-Partitionierung mit GPU-Technologie (MIG) verwenden, um mehrere Inferenz-Workloads auf einer einzigen Multi-Instance GPU auszuführen. Dies ermöglicht eine bessere GPU-Auslastung und Kostenoptimierung. Weitere Informationen zur Konfiguration der GPU-Partitionierung finden Sie unterVerwendung von GPU-Partitionen in Amazon SageMaker HyperPod.

Einheitliche Infrastruktur für Training und Inferenz

Maximieren Sie Ihre GPU-Auslastung, indem Sie die Rechenressourcen nahtlos zwischen Trainings- und Inferenz-Workloads verlagern. Dies reduziert die Gesamtbetriebskosten und gewährleistet gleichzeitig die Betriebskontinuität.

Enterprise-ready Bereitstellungsoptionen

Stellen Sie Modelle aus mehreren Quellen bereit, darunter Modelle mit offenen Gewichten und Gated von Amazon SageMaker JumpStart sowie benutzerdefinierte Modelle von Amazon S3 und Amazon FSx mit Unterstützung für Inferenzarchitekturen mit einem Knoten und mehreren Knoten.

Verwaltetes Key-value mehrstufiges Caching (KV) und intelligentes Routing

KV-Caching speichert die vorberechneten Schlüssel-Wert-Vektoren nach der Verarbeitung früherer Token. Wenn das nächste Token verarbeitet wird, müssen die Vektoren nicht neu berechnet werden. Mithilfe einer zweistufigen Cache-Architektur können Sie einen L1-Cache konfigurieren, der CPU-Speicher für die lokale Wiederverwendung mit niedriger Latenz verwendet, und einen L2-Cache, der Redis nutzt, um skalierbare Cache-Sharing auf Knotenebene zu ermöglichen.

Intelligentes Routing analysiert eingehende Anfragen und leitet sie an die Inferenzinstanz weiter, die höchstwahrscheinlich über relevante zwischengespeicherte Schlüssel-Wert-Paare verfügt. Das System untersucht die Anfrage und leitet sie dann auf der Grundlage einer der folgenden Routing-Strategien weiter:

  1. prefixaware— Nachfolgende Anfragen mit demselben Prompt-Präfix werden an dieselbe Instanz weitergeleitet

  2. kvaware— Eingehende Anfragen werden an die Instanz mit der höchsten KV-Cache-Trefferrate weitergeleitet.

  3. session— Anfragen aus derselben Benutzersitzung werden an dieselbe Instanz weitergeleitet.

  4. roundrobin— Gleichmäßige Verteilung von Anfragen ohne Berücksichtigung des Status des KV-Cache.

Weitere Informationen zur Aktivierung dieser Funktion finden Sie unterKonfigurieren Sie KV-Caching und intelligentes Routing.

Integrierter L2-Cache, mehrstufige Speicherunterstützung für KV-Caching

Aufbauend auf der bestehenden KV-Cache-Infrastruktur ist HyperPod jetzt neben Redis auch Tiered Storage als zusätzliche L2-Backend-Option integriert. Mit dem integrierten SageMaker verwalteten mehrstufigen Speicher bietet dies eine verbesserte Leistung. Diese Erweiterung bietet Kunden eine skalierbarere und effizientere Option für das Cache-Offloading, was besonders für LLM-Inferenz-Workloads mit hohem Durchsatz von Vorteil ist. Die Integration gewährleistet die Kompatibilität mit bestehenden vLLM-Modellservern und Routing-Funktionen und bietet gleichzeitig eine bessere Leistung.

Anmerkung

Datenverschlüsselung: KV-Cache-Daten (Aufmerksamkeitsschlüssel und Werte) werden im Ruhezustand unverschlüsselt gespeichert, um die Inferenzlatenz zu optimieren und die Leistung zu verbessern. Bei Workloads mit strengen Anforderungen an die Verschlüsselung im Ruhezustand sollten Sie die Verschlüsselung von Eingabeaufforderungen und Antworten auf Anwendungsebene in Betracht ziehen oder das Caching deaktivieren.

Datenisolierung: Wenn Sie verwalteten Tiered Storage als L2-Cache-Backend verwenden, teilen sich mehrere Inferenzbereitstellungen innerhalb eines Clusters den Cache-Speicher ohne Isolierung. L2-KV-Cache-Daten (Aufmerksamkeitsschlüssel und Werte) aus verschiedenen Bereitstellungen werden nicht getrennt. Stellen Sie Workloads, die eine Datenisolierung erfordern (Szenarien mit mehreren Mandanten, unterschiedliche Datenklassifizierungsstufen), in separaten Clustern bereit oder verwenden Sie dedizierte Redis-Instances.

Sie können die Kaltstart-Latenz beim Skalieren von Bereitstellungen reduzieren, indem Sie Modellgewichte auf dem lokalen NVMe-Speicher zwischenspeichern und das Inferenzserver-Container-Image vorab auf die Zielknoten übertragen. Sie können diese Funktionen unabhängig voneinander oder zusammen vor modelCacheConfig Ort aktivieren. Sie funktionieren mit Modellen von Amazon SageMaker JumpStart, Amazon S3 und Amazon FSx. Weitere Informationen finden Sie unter Das Modell gewichtet das Caching und das Caching von Bildern.

Multi-instance geben Sie eine Bereitstellung mit automatischem Failover ein

HyperPod Inference unterstützt die Bereitstellung mehrerer Instanzen, um die Zuverlässigkeit der Bereitstellung und die Ressourcenauslastung zu verbessern. Geben Sie in Ihrer Bereitstellungskonfiguration eine priorisierte Liste von Instance-Typen an, und das System wählt automatisch aus den verfügbaren Alternativen aus, wenn Ihr bevorzugter Instance-Typ nicht genügend Kapazität hat. Der Kubernetes-Scheduler verwendet die preferredDuringSchedulingIgnoredDuringExecution Knotenaffinität, um Instanztypen in Prioritätsreihenfolge zu bewerten und Workloads dem verfügbaren Instanztyp mit der höchsten Priorität zuzuordnen und gleichzeitig die Bereitstellung sicherzustellen, auch wenn bevorzugte Ressourcen nicht verfügbar sind. Diese Funktion verhindert Bereitstellungsausfälle aufgrund von Kapazitätsbeschränkungen und behält gleichzeitig Ihre Kosten- und Leistungspräferenzen bei, sodass eine kontinuierliche Serviceverfügbarkeit auch bei Schwankungen der Clusterkapazität gewährleistet ist.

Benutzerdefinierte Knotenaffinität für eine granulare Planungssteuerung

HyperPod Inference unterstützt die benutzerdefinierte Knotenaffinität, um die Verteilung der Arbeitslast über die Auswahl des Instanztyps hinaus zu steuern. Geben Sie in nodeAffinity diesem Feld Kriterien für die Knotenauswahl an, z. B. die Verteilung der Verfügbarkeitszonen, die Filterung des Kapazitätstyps (On-Demand oder Spot) oder benutzerdefinierte Knotenbezeichnungen. Das System unterstützt obligatorische Platzierungsbeschränkungen requiredDuringSchedulingIgnoredDuringExecution und optionale Voreinstellungen. So haben Sie die volle Kontrolle über die Pod-PlanungpreferredDuringSchedulingIgnoredDuringExecution, während gleichzeitig die Flexibilität bei der Bereitstellung gewahrt bleibt.

Anmerkung

Wir erheben bestimmte routinemäßige Betriebskennzahlen, um die grundlegende Serviceverfügbarkeit sicherzustellen. Die Erstellung dieser Metriken erfolgt vollständig automatisiert und erfordert keine menschliche Überprüfung des zugrunde liegenden Arbeitsaufwands für die Modellinferenz. Diese Metriken beziehen sich auf Bereitstellungsvorgänge, Ressourcenmanagement und Endpunktregistrierung.