View a markdown version of this page

Überwachung des RFT-Trainings - Amazon Nova

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Überwachung des RFT-Trainings

Überwachen Sie wichtige Kennzahlen während des Trainings, um ein effektives Lernen zu gewährleisten und potenzielle Probleme frühzeitig zu erkennen.

Wichtige Kennzahlen, die es zu verfolgen gilt

Überwachen Sie MlFlow während des Trainings die folgenden Kennzahlen:

Kennzahlen zur Belohnung:

  • Durchschnittlicher Belohnungswert: Gesamtqualität der Modellantworten (sollte im Laufe der Zeit zunehmen)

  • Verteilung der Belohnungen: Prozentsatz der Antworten, für die hohe, mittlere und niedrige Prämien vergeben wurden

  • Belohnungen für Schulung und Validierung: Vergleichen Sie, um eine Überanpassung zu erkennen

Kennzahlen zur Schulung:

  • Aktualisierungen der Richtlinien: Anzahl erfolgreicher Gewichtsaktualisierungen

  • Abschlussrate der Einführung: Prozentsatz der Proben, die erfolgreich ausgewertet wurden

Bezüglich der Muster:

  • Ein Plateau der Belohnungen (deutet auf schlechtes Lernen hin)

  • Die Belohnungen für die Validierung sinken, während die Trainingsbelohnungen steigen (Überanpassung)

  • Die Varianz der Belohnungen nimmt im Laufe der Zeit deutlich zu (Instabilität)

  • Hoher Prozentsatz an Fehlern bei der Belohnungsfunktion (Implementierungsprobleme)

Wann sollte das Training beendet werden:

  • Die angestrebten Leistungskennzahlen werden erreicht

  • Die Belohnungen stagnieren und verbessern sich nicht mehr

  • Die Validierungsleistung verschlechtert sich (Überanpassung erkannt)

  • Das maximale Schulungsbudget ist erreicht

Bewertung nach RFT

Evaluieren Sie nach Abschluss des Trainings Ihr fein abgestimmtes Modell, um Leistungsverbesserungen zu beurteilen:

  • RFT-Evaluierungsauftrag ausführen: Verwenden Sie den Checkpoint aus Ihrem RFT-Training als Modell

  • Mit dem Ausgangswert vergleichen: Evaluieren Sie sowohl das Basismodell als auch das fein abgestimmte Modell anhand desselben Testsatzes

  • Analysieren Sie Metriken: Überprüfen Sie aufgabenspezifische Metriken (Genauigkeit, Belohnungswerte usw.)

  • Qualitative Überprüfung durchführen: Prüfe die Ergebnisse der Stichproben manuell auf ihre Qualität

Ausführliche Bewertungsverfahren finden Sie im Abschnitt Bewertung.

Verwendung fein abgestimmter Modelle

Zugriff auf Checkpoints:

Suchen Sie nach Abschluss des Trainings Ihren Checkpoint:

  1. Navigiere zu deinem output_path in S3

  2. Downloaden und entpacken output.tar.gz

  3. Öffnen Sie manifest.json.

  4. Kopieren Sie den checkpoint_s3_bucket Wert

Bereitstellung zur Inferenz:

Verwenden Sie den Checkpoint S3-Pfad für Inferenz oder weiteres Training:

run: model_type: amazon.nova-2-lite-v1:0:256k model_name_or_path: "s3://customer-escrow-<account-number>-smtj-<unique-identifier>/<job-name>"

Anweisungen zur Bereitstellung und Inferenz finden Sie im Abschnitt Inferenz.

Einschränkungen und bewährte Methoden

Aktuelle Einschränkungen:

Einschränkungen für die Betaversion:

  • Sie müssen eine neue RIG-Gruppe für RFT erstellen. Diese Einschränkung wird von GA behoben.

  • Anforderungen an den Instanztyp: Es werden nur P5-Instances unterstützt (mindestens 8x P5.48xlarge). Demnächst: Unterstützung kleinerer Instanztypen (ETA: Mitte Januar 2025).

Funktionale Einschränkungen:

  • 15-minütiges Lambda-Timeout: Die Belohnungsfunktionen müssen innerhalb von 15 Minuten abgeschlossen sein

  • Single-turn Nur: Multi-turn Konversationen werden nicht unterstützt

  • Validierungsdatensätze: Während des Trainings nicht unterstützt. Verwenden Sie separate Bewertungsaufgaben, um den Trainingsfortschritt zu beurteilen.

Überlegungen zur Ausbildung:

  • Szenarien mit geringer Belohnung: Kann Probleme haben, wenn weniger als 5% der Beispiele eine positive Belohnung erhalten — ziehen Sie zuerst SFT in Betracht

  • Datenanforderungen: Benötigt eine ausreichende Vielfalt, um effektiv lernen zu können

  • Rechenaufwand: Teurer als überwachte Feinabstimmung

Nova Forge beseitigt einige dieser Einschränkungen:

  • Unterstützt Gespräche mit mehreren Runden

  • Ermöglicht Belohnungsfunktionen, die über 15-minütige Timeouts hinausgehen

  • Bietet erweiterte Algorithmen und Tuning-Optionen

  • Konzipiert für komplexe Anwendungsfälle in Unternehmen, speziell abgestimmt auf die Entwicklung neuer Modelle

Bewährte Verfahren:

Fangen Sie klein an und skalieren Sie:

  • Beginnen Sie mit minimalen Datensätzen (100-200 Beispiele) und wenigen Trainingsepochen

  • Validieren Sie Ihren Ansatz, bevor Sie ihn skalieren

  • Erhöhen Sie die Datensatzgröße und die Trainingsschritte auf der Grundlage der Ergebnisse schrittweise

Ausgangswert zuerst mit SFT:

  • Wenn die Belohnungswerte konstant niedrig sind (z. B. immer 0), führen Sie SFT vor RFT durch

  • RFT erfordert eine angemessene Ausgangsleistung, um sich effektiv zu verbessern

Entwerfen Sie effiziente Belohnungsfunktionen:

  • In Sekunden ausführen, nicht in Minuten

  • Minimieren Sie externe API-Aufrufe

  • Verwenden Sie effiziente Algorithmen und Datenstrukturen

  • Implementieren Sie eine angemessene Fehlerbehandlung

  • Vor dem Training gründlich testen

  • Nutzen Sie die parallelen Skalierungsfunktionen von Lambda

Überwachen Sie das Training aktiv:

  • Verfolgen Sie die durchschnittlichen Prämienwerte im Laufe der Zeit

  • Beobachten Sie die Verteilung der Belohnungen auf die Stichproben

  • Vergleichen Sie die Prämien für Schulungen und Validierungen

  • Achte auf besorgniserregende Muster (Plateaus, Überanpassung, Instabilität)

Iteriere anhand der Ergebnisse:

  • Wenn sich die Belohnungen nach mehreren Iterationen nicht verbessern, passen Sie das Design der Belohnungsfunktion an

  • Erhöhen Sie die Vielfalt der Datensätze, um klarere Lernsignale zu liefern

  • Erwägen Sie, auf SFT umzusteigen, wenn die Prämien nahe Null bleiben

  • Experimentieren Sie mit verschiedenen Hyperparametern (Lernrate, Chargengröße)

Optimieren Sie die Datenqualität:

  • Sorgen Sie für vielfältige, repräsentative Beispiele

  • Schließen Sie Randfälle und schwierige Stichproben ein

  • Vergewissern Sie sich, dass die Belohnungsfunktion alle Beispieltypen korrekt bewertet

  • Entferne oder korrigiere Beispiele, die die Belohnungsfunktion verwirren

Fehlerbehebung

Fehler bei der Belohnungsfunktion:

Symptome: Hohe Fehlerrate bei Aufrufen der Belohnungsfunktion während des Trainings

Problem

Symptome

Auflösung

Lambda-Zeitüberschreitung

Häufige Timeouts nach 15 Minuten

Optimieren Sie die Funktionsleistung; ziehen Sie Nova Forge für komplexe Evaluationen in Betracht

Ungenügende Parallelität

Fehler bei der Lambda-Drosselung

Erhöhen Sie lambda_concurrency_limit oder fordern Sie eine Erhöhung des Kontingents an

Ungültiges Rückgabeformat

Das Training schlägt mit Formatfehlern fehl

Stellen Sie sicher, dass die Rückgabestruktur dem erforderlichen Schnittstellenformat entspricht

Unbehandelte Ausnahmen

Zeitweise auftretende Fehler

Fügen Sie eine umfassende Fehlerbehandlung und Protokollierung hinzu

Externe API-Ausfälle

Inkonsistente Bewertung

Implementieren Sie Wiederholungslogik und Fallback-Strategien

Schlechte Trainingsleistung:

Symptome: Die Belohnungen verbessern sich nicht oder stagnieren bei niedrigen Werten

Auflösungen:

  • Überprüfen Sie die Richtigkeit der Belohnungsfunktion: Testen Sie anhand bekannter good/bad Beispiele

  • Überprüfen Sie die Ausgangsleistung: Evaluieren Sie das Basismodell. Wenn die Genauigkeit nahe Null liegt, führen Sie zuerst SFT durch

  • Erhöhen Sie die Datenvielfalt: Fügen Sie vielfältigere Beispiele hinzu, die verschiedene Szenarien abdecken

  • Passen Sie Hyperparameter an: Probieren Sie verschiedene Lernraten oder Chargengrößen aus

  • Überprüfen Sie die Qualität der Belohnungssignale: Stellen Sie sicher, dass bei Belohnungen zwischen guten und schlechten Antworten unterschieden wird

Überanpassung:

Symptome: Die Trainingsbelohnungen steigen, während die Belohnungen für Validierungen abnehmen

Entschließungen:

  • Trainingsschritte reduzieren: Beenden Sie das Training früher

  • Datensatzgröße erhöhen: Füge weitere Trainingsbeispiele hinzu

  • Regularisierung hinzufügen: Passen Sie an oder weight_decay entropy_coeff

  • Erhöhen Sie die Datenvielfalt: Stellen Sie sicher, dass das Schulungspaket vollständig verteilt ist