Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
Ottimizzazione fine del rinforzo (RFT)
Il rinforzo Fine-Tuning (RFT) è una tecnica che migliora le prestazioni del modello attraverso segnali di feedback (punteggi o ricompense misurabili che indicano la qualità della risposta) piuttosto che la supervisione diretta con risposte esatte e corrette. A differenza della SFT che apprende dalle coppie input-output, la RFT utilizza funzioni di ricompensa per valutare le risposte del modello e ottimizza in modo iterativo il modello per massimizzare tali ricompense. RFT supporta sia la formazione a turno singolo che quella a più turni:
-
Single-turn RFT: il modello genera una singola risposta a un prompt e una funzione di ricompensa assegna un punteggio a tale risposta. Ideale per attività con metriche di qualità chiare per risposta, come matematica, generazione di codice e ragionamento strutturato.
-
Multi-turn RFT: il modello prevede interazioni in più fasi (ad esempio, flussi di lavoro agentici con utilizzo di strumenti) e una funzione di ricompensa valuta la traiettoria complessiva. Ideale per attività complesse che richiedono un processo decisionale sequenziale, come la risoluzione dei problemi in più fasi, l'orchestrazione degli strumenti e gli agenti conversazionali.
Quando usare RFT
Usa RFT quando puoi definire criteri di successo chiari e misurabili ma hai difficoltà a fornire risultati esatti e corretti per la formazione. La RFT è ideale quando:
-
Hai una funzione di ricompensa affidabile in grado di valutare i risultati del modello a livello di programmazione
-
È necessario allineare il comportamento del modello con preferenze o vincoli specifici
-
La raccolta di esempi etichettati di alta qualità è costosa o poco pratica
-
Esistono diverse soluzioni valide, ma alcune sono chiaramente migliori di altre (scrittura creativa, ottimizzazione del codice, ragionamento complesso)
RFT eccelle nei settori in cui la qualità dell'output può essere misurata oggettivamente: risoluzione di problemi matematici, generazione di codice, ragionamento scientifico, analisi strutturata dei dati, ragionamento in più fasi, utilizzo di strumenti e flussi di lavoro complessi con vincoli specifici.
Modelli supportati
Single-turn e RFT multigiro sono disponibili per i seguenti modelli Amazon Nova:
-
Nova 2.0 (Lite)
Quando usare Single-turn RFT e Multi-turn RFT
Scegliete Single-turn RFT quando il compito è uno scambio istantaneo: il modello riceve un prompt e produce un'unica risposta che può essere valutata da sola, senza chiamate intermedie agli strumenti o allo stato dell'ambiente da monitorare. Si adatta a casi d'uso come classificazione, estrazione, domande e risposte specifiche del dominio, riepilogo, moderazione dei contenuti o qualsiasi attività con una risposta verificabile (corrispondenza esatta, F1, convalida dello schema, controllo basato su regole o LLM-judge controllo sull'output finale). È più semplice, economico e veloce da eseguire, perché ogni implementazione è di una singola generazione e la ricompensa viene calcolata una volta alla fine.
Scegliete Multi-turn RFT quando l'attività richiede che il modello agisca da agente in diverse fasi (richiamo degli strumenti, lettura e modifica dello stato e adattamento a ciò che ritorna) prima di poter giudicare il risultato. Si adatta a flussi di lavoro agentici come sequenze di utilizzo degli strumenti, risoluzione dei problemi in più fasi, assistenti conversazionali o qualsiasi attività in cui il successo dipende dalla traiettoria (l'ordine e la correttezza delle azioni tra le curve), non solo dalla risposta definitiva.
Regola empirica: se il tuo compito può essere valutato da un singolo output del modello senza chiamate di strumenti o stato in evoluzione, usa Single-turn RFT; se il successo dipende da una sequenza di azioni contro gli strumenti o da un ambiente con stato, usa Multi-turn RFT.
Quando usare Nova 1.0 rispetto a Nova 2.0
RFT è disponibile solo su Nova 2.0 Lite. Per i modelli Nova 1.0, utilizzate Direct Preference Optimization (DPO) o Proximal Policy Optimization (PPO) come tecniche di allineamento alternative.
Modalità di ragionamento
Amazon Nova 2.0 supporta la modalità di ragionamento durante l'addestramento RFT. Sono disponibili le seguenti modalità:
-
none: Nessun ragionamento (ometti il campo reasoning_effort)
-
basso: sovraccarico di ragionamento minimo
-
alto: capacità di ragionamento massima (impostazione predefinita quando viene specificato reasoning_effort)
Nota
Non esiste un'opzione media per RFT. Se il campo reasoning_effort è assente dalla configurazione, il ragionamento è disabilitato.