Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
Monitoraggio della formazione RFT
Monitora le metriche chiave durante la formazione per garantire un apprendimento efficace e identificare precocemente i potenziali problemi.
Argomenti
Metriche chiave da monitorare
Monitora le seguenti metriche utilizzate MlFlow durante l'allenamento:
Metriche dei premi:
-
Punteggio medio di ricompensa: qualità complessiva delle risposte del modello (dovrebbe aumentare nel tempo)
-
Distribuzione dei premi: percentuale di risposte che ricevono ricompense alte, medie e basse
-
Premi per la formazione e per la convalida: confrontali per individuare eventuali sovradimensionamenti
Metriche di formazione:
-
Aggiornamenti delle politiche: numero di aggiornamenti del peso riusciti
-
Percentuale di completamento del rollout: percentuale di campioni valutati con successo
Per quanto riguarda i modelli:
-
Il plateau delle ricompense (indica uno scarso apprendimento)
-
I premi di convalida diminuiscono mentre i premi di formazione aumentano (sovradimensionamento)
-
La varianza delle ricompense aumenta significativamente nel tempo (instabilità)
-
Alta percentuale di errori nella funzione di ricompensa (problemi di implementazione)
Quando interrompere l'allenamento:
-
Le metriche prestazionali prefissate vengono raggiunte
-
I premi si stabilizzano e non migliorano più
-
Le prestazioni di convalida peggiorano (rilevato un sovradattamento)
-
È stato raggiunto il budget massimo per la formazione
Valutazione dopo RFT
Al termine della formazione, valuta il tuo modello ottimizzato per valutare i miglioramenti delle prestazioni:
-
Esegui un lavoro di valutazione RFT: utilizza il checkpoint del tuo corso di formazione RFT come modello
-
Confronta con la linea di base: valuta sia il modello base che il modello ottimizzato sullo stesso set di test
-
Analizza le metriche: rivedi le metriche specifiche dell'attività (precisione, punteggi di ricompensa, ecc.)
-
Esegui una revisione qualitativa: ispeziona manualmente i risultati dei campioni per verificarne la qualità
Per procedure di valutazione dettagliate, vedere la sezione Valutazione.
Utilizzo di modelli ottimizzati
Accesso ai checkpoint:
Al termine dell'allenamento, individua il tuo checkpoint:
-
Accedi al tuo
output_pathin S3 -
Scarica ed estrai
output.tar.gz -
Aprire
manifest.json -
Copia il
checkpoint_s3_bucketvalore
Implementazione per l'inferenza:
Usa il percorso S3 del checkpoint per l'inferenza o l'ulteriore formazione:
run: model_type: amazon.nova-2-lite-v1:0:256k model_name_or_path: "s3://customer-escrow-<account-number>-smtj-<unique-identifier>/<job-name>"
Per le istruzioni di distribuzione e inferenza, consulta la sezione Inferenza.
Limitazioni e best practice
Limitazioni attuali:
Restrizioni beta:
-
È necessario creare un nuovo gruppo RIG per RFT. Questa limitazione verrà risolta da GA.
-
Requisiti per il tipo di istanza: sono supportate solo le istanze P5 (minimo 8 P5.48xlarge volte). Prossimamente: supporto per tipi di istanze più piccoli (ETA: metà gennaio 2025).
Limitazioni funzionali:
-
Timeout Lambda di 15 minuti: le funzioni di ricompensa devono essere completate entro 15 minuti
-
Single-turn solo: Multi-turn conversazioni non supportate
-
Set di dati di convalida: non supportati durante la formazione. Utilizza processi di valutazione separati per valutare i progressi della formazione.
Considerazioni sulla formazione:
-
Scenari a bassa remunerazione: può avere difficoltà quando meno del 5% degli esempi riceve ricompense positive: considera innanzitutto SFT
-
Requisiti in materia di dati: è necessaria una diversità sufficiente per apprendere in modo efficace
-
Costo computazionale: più costoso della messa a punto supervisionata
Nova Forge rimuove alcune di queste limitazioni:
-
Supporta conversazioni a più turni
-
Consente funzioni di ricompensa che superano i timeout di 15 minuti
-
Fornisce algoritmi avanzati e opzioni di ottimizzazione
-
Progettato per casi d'uso aziendali complessi, ottimizzato specificamente per creare modelli di frontiera
Le migliori pratiche:
Inizia in piccolo e scala:
-
Inizia con set di dati minimi (100-200 esempi) e poche epoche di formazione
-
Convalida il tuo approccio prima di espanderlo
-
Aumenta gradualmente le dimensioni del set di dati e le fasi di formazione in base ai risultati
Valore di base con SFT first:
-
Se i punteggi di ricompensa sono costantemente bassi (ad esempio, sempre 0), esegui SFT prima di RFT
-
La RFT richiede prestazioni di base ragionevoli per migliorare efficacemente
Progetta funzioni di ricompensa efficienti:
-
Esegui in pochi secondi, non in minuti
-
Riduci al minimo le chiamate API esterne
-
Utilizza algoritmi e strutture dati efficienti
-
Implementa una corretta gestione degli errori
-
Esegui un test approfondito prima dell'allenamento
-
Sfrutta le funzionalità di scalabilità parallela di Lambda
Monitora attivamente la formazione:
-
Tieni traccia dei punteggi medi dei premi nel tempo
-
Guarda la distribuzione delle ricompense tra i campioni
-
Confronta i premi di formazione e quelli di convalida
-
Cerca i modelli preoccupanti (plateau, overfitting, instabilità)
Iterate in base ai risultati:
-
Se i premi non migliorano dopo diverse iterazioni, modifica il design della funzione di ricompensa
-
Aumenta la diversità dei set di dati per fornire segnali di apprendimento più chiari
-
Valuta la possibilità di passare a SFT se i premi rimangono vicini allo zero
-
Sperimenta con diversi iperparametri (velocità di apprendimento, dimensione del batch)
Ottimizza la qualità dei dati:
-
Garantisci esempi diversi e rappresentativi
-
Includi casi limite e campioni difficili
-
La funzione Verify Reward assegna un punteggio corretto a tutti i tipi di esempi
-
Rimuovi o correggi gli esempi che confondono la funzione di ricompensa
Risoluzione dei problemi
Errori della funzione di ricompensa:
Sintomi: elevato tasso di errore nelle chiamate alla funzione di ricompensa durante l'allenamento
Problema |
Caratteristiche |
Risoluzione |
|---|---|---|
Timeout Lambda |
Timeout frequenti dopo 15 minuti |
Ottimizzate le prestazioni delle funzioni; prendete in considerazione Nova Forge per valutazioni complesse |
Concorrenza insufficiente |
Errori di limitazione Lambda |
Aumenta lambda_concurrency_limit o richiedi un aumento della quota |
Formato di restituzione non valido |
L'addestramento non riesce a causa di errori di formato |
Verifica che la struttura restituita corrisponda al formato di interfaccia richiesto |
Eccezioni non gestite |
Errori intermittenti |
Aggiungete una gestione e una registrazione complete degli errori |
Errori esterni delle API |
Punteggio incoerente |
Implementa la logica di riprova e le strategie di fallback |
Scarse prestazioni di allenamento:
Sintomi: i premi non migliorano o si stabilizzano a valori bassi
Risoluzioni:
-
Verifica la correttezza della funzione di ricompensa: prova con esempi noti good/bad
-
Verifica le prestazioni di base: valuta il modello base; se la precisione è prossima allo zero, esegui prima SFT
-
Aumenta la diversità dei dati: aggiungi esempi più vari che coprono diversi scenari
-
Modifica gli iperparametri: prova diversi tassi di apprendimento o dimensioni dei batch
-
Controlla la qualità del segnale di ricompensa: assicurati che i premi distinguano tra risposte positive e negative
Adattamento eccessivo:
Sintomi: i premi di allenamento aumentano mentre i premi di convalida diminuiscono
Risoluzioni:
-
Ridurre le fasi dell'allenamento: interrompi l'allenamento prima
-
Aumenta le dimensioni del set di dati: aggiungi altri esempi di formazione
-
Aggiungi regolarizzazione: regola o
weight_decayentropy_coeff -
Aumenta la diversità dei dati: assicurati che il set di formazione rappresenti una distribuzione completa