Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
Überwachung des Fortschritts bei allen Iterationen
Sie können Metriken über MLflow verfolgen.
Nova Customization — MLFlow-Setup für SageMaker HyperPod
Damit Ihre SageMaker HyperPod Umgebung Metriken an MLflow ausgeben kann, müssen Sie einige zusätzliche Einstellungen vornehmen.
-
Öffnen Sie Amazon AI SageMaker
-
Wählen Sie SageMaker Studio
-
Wenn bereits ein Profil erstellt wurde, wählen Sie „Studio öffnen“.
-
Wenn kein Profil erstellt wurde, wählen Sie „Eine SageMaker Domain erstellen“, um eines einzurichten
-
-
Wählen Sie MLflow. Wenn keine MLflow-App erstellt wurde, wählen Sie „MLflow-App erstellen“
-
Klicken Sie in der ML Flow App auf die copy/paste Schaltfläche oder den Menüpunkt „Details anzeigen“, um den ARN zu erhalten. Sie benötigen dies, wenn Sie Ihren Ausbildungsjob einreichen.
-
Fügen Sie in der HyperPod Cluster-Ausführungsrolle die folgende Richtlinie hinzu. Dadurch kann der HyperPod Cluster die MLflow-API aufrufen, um Metriken zu veröffentlichen.
{ "Version": "2012-10-17", "Statement": [ { "Effect": "Allow", "Action": "sagemaker-mlflow:*", "Resource": [ "arn:aws:sagemaker:us-east-1:372836560492:mlflow-app/*" ] }, { "Effect": "Allow", "Action": [ "sagemaker:ListMlflowTrackingServers", "sagemaker:CallMlflowAppApi" ], "Resource": "*" } ] }
Einen Job über die CLI einreichen
Geben Sie 4 neue Override-Parameter an, entweder in der Befehlszeile oder im Yaml-Rezept.
-
mlflow_tracking_uri: Der ARN der MLFlow-App -
mlflow_experiment_name: Der Name für diesen Versuchsdurchlauf -
mlflow_experiment_name: Der Name des Experiments, in dem die Metriken in MLflow gespeichert werden -
mlflow_run_name: Der Name für dieses Experiment
Befehlszeile
--override-parameters '{"recipes.run.mlflow_tracking_uri": "arn:aws:sagemaker:us-east-1:925548216816:mlflow-app/app-B6XOUNCHQM4W", "recipes.run.mlflow_experiment_name": "myuser-sft-lora-exp1", "recipes.run.mlflow_run_name": "myuser-sft-lora-exp1-202512181940"}'
yaml:
## Run config run: mlflow_tracking_uri: "arn:aws:sagemaker:us-east-1:925548216816:mlflow-app/app-B6XOUNCHQM4W" mlflow_experiment_name: "myuser-sft-lora-exp1" mlflow_run_name: "myuser-sft-lora-exp1-202512181940"
Einen Job über die SageMaker Studio-Benutzeroberfläche einreichen
Die MLFlow-Integration ist bereits in die SageMaker Studio-Benutzeroberfläche integriert. Wenn Sie einen Trainingsjob einreichen, geben Sie einfach an, welche MLflow App-Instanz verwendet werden soll.
-
Navigieren Sie in SageMaker Studio zu Models > Nova 2.0 Lite > Customize > Customize with UI.
-
Erweitern Sie den Abschnitt Erweiterte Konfiguration
-
Wählen Sie die MLflow-App aus, an die Sie die Trainingsmetriken senden möchten. Sie können hier auch den Namen Ihres Experiments und die Durchführung des Experiments festlegen.
Einreichen eines Jobs über die AWS CLI
Wenn Sie den verwenden AWS CLI, müssen Sie eine MLflow-App erstellen und sie als Eingabe an die API-Anfrage für den Schulungsjob übergeben.
mlflow_app_name="<enter your MLflow app name>" role_arn="<enter your role ARN>" bucket_name="<enter your bucket name>" region="<enter your region>" mlflow_app_arn=$(aws sagemaker create-mlflow-app \ --name $mlflow_app_name \ --artifact-store-uri "s3://$bucket_name" \ --role-arn $role_arn \ --region $region)
Erstellen Sie eine MLflow-App
Verwenden der Studio-Benutzeroberfläche: Wenn Sie einen Trainingsjob über die Studio-Benutzeroberfläche erstellen, wird automatisch eine Standard-MLflow-App erstellt und standardmäßig unter Erweiterte Optionen ausgewählt.
CLI verwenden: Wenn Sie die CLI verwenden, müssen Sie eine MLflow-App erstellen und sie als Eingabe an die API-Anfrage für den Schulungsjob übergeben.
mlflow_app_name="<enter your MLflow app name>" role_arn="<enter your role ARN>" bucket_name="<enter your bucket name>" region="<enter your region>" mlflow_app_arn=$(aws sagemaker create-mlflow-app \ --name $mlflow_app_name \ --artifact-store-uri "s3://$bucket_name" \ --role-arn $role_arn \ --region $region)
Greifen Sie auf die MLflow-App zu
Mit CLI: Erstellen Sie eine vorsignierte URL, um auf die Benutzeroberfläche der MLflow-App zuzugreifen:
aws sagemaker create-presigned-mlflow-app-url \ --arn $mlflow_app_arn \ --region $region \ --output text
Verwenden der Studio-Benutzeroberfläche: Die Studio-Benutzeroberfläche zeigt die wichtigsten in MLflow gespeicherten Metriken an und bietet einen Link zur Benutzeroberfläche der MLflow-App.
Wichtige Kennzahlen, die es zu verfolgen gilt
Überwachen Sie diese Kennzahlen iterationsübergreifend, um Verbesserungen zu beurteilen und den Arbeitsfortschritt zu verfolgen:
Für SFT
-
Kurven zum Trainingsverlust
-
Anzahl der verbrauchten Proben und Zeit für die Probenverarbeitung
-
Leistungsgenauigkeit bei ausgehaltenen Testgeräten
-
Einhaltung der Formate (z. B. gültige JSON-Ausgaberate)
-
Verwirrung bei domänenspezifischen Bewertungsdaten
Für RFT
-
Durchschnittliche Belohnungswerte im Vergleich zum Training
-
Verteilung der Belohnungen (Prozentsatz der Antworten mit hoher Belohnung)
-
Überprüfung der Belohnungstrends (achten Sie darauf, ob sie zu stark angepasst werden)
-
Task-specific Erfolgsraten (z. B. Erfolgsquote bei der Codeausführung, Genauigkeit mathematischer Probleme)
General
-
Benchmark-Leistungsdeltas zwischen Iterationen
-
Ergebnisse der menschlichen Bewertung anhand repräsentativer Stichproben
-
Produktionskennzahlen (bei iterativer Bereitstellung)
Ermitteln, wann aufgehört werden soll
Stoppen Sie die Iteration, wenn:
-
Leistungsplateaus: Durch zusätzliches Training werden die Zielkennzahlen nicht mehr wesentlich verbessert
-
Technikwechsel hilft: Wenn eine Technik ein Plateau erreicht, versuche es mit einer anderen Technik (z. B. SFT → RFT → SFT), um Leistungsgrenzen zu durchbrechen
-
Zielkennzahlen erreicht: Ihre Erfolgskriterien sind erfüllt
-
Regression erkannt: Neue Iterationen beeinträchtigen die Leistung (siehe Rollback-Verfahren unten)
Ausführliche Evaluierungsverfahren finden Sie im Abschnitt Evaluierung.