本文為英文版的機器翻譯版本,如內容有任何歧義或不一致之處,概以英文版為準。
強化微調 (RFT)
強化微調 (RFT) 是一種技術,可透過回饋訊號 - 可測量的分數或獎勵指出回應品質 - 而不是直接監督並準確回答,來改善模型效能。與從輸入輸出對中學習的 SFT 不同,RFT 使用獎勵函數來評估模型回應,並反覆最佳化模型以最大化這些獎勵。RFT 同時支援單迴轉和多迴轉訓練:
-
單迴轉 RFT:模型會針對提示產生單一回應,而獎勵函數則會對該回應進行評分。最適合具有清晰每個回應品質指標的任務,例如數學、程式碼產生和結構化推理。
-
多迴轉 RFT:模型參與多步驟互動 (例如,使用工具的代理工作流程),獎勵函數會評估整體軌跡。最適合需要循序決策的複雜任務,例如多步驟問題解決、工具協同運作和對話客服人員。
何時使用 RFT
當您可以定義明確、可衡量的成功條件,但難以提供確切正確的訓練輸出時,請使用 RFT。RFT 的理想時機:
-
您有一個可靠的獎勵函數,可以透過程式設計方式評估模型輸出
-
您需要使模型行為符合特定偏好設定或限制條件
-
收集高品質的標籤範例非常昂貴或不切實際
-
存在多個有效的解決方案,但有些解決方案明顯優於其他解決方案 (創造性寫入、程式碼最佳化、複雜推理)
RFT 在可以客觀測量輸出品質的網域中表現卓越:數學問題解決、程式碼產生、科學推理、結構化資料分析、多步驟推理、工具使用量,以及具有特定限制的複雜工作流程。
支援的模型
單迴轉和多迴轉 RFT 適用於下列 Amazon Nova 模型:
-
Nova 2.0 (精簡型)
何時使用單迴轉 RFT 與多迴轉 RFT
當任務是一次性交換時,選擇單迴轉 RFT:模型會收到提示,並產生可自行評分的單一回應,無需追蹤中繼工具呼叫或環境狀態。這適合使用案例,例如分類、擷取、網域特定問答、摘要、內容管制,或任何具有可驗證答案的任務 (完全相符、F1、結構描述驗證、最終輸出上的規則型或 LLM 判斷檢查)。它更簡單、更便宜且執行速度更快,因為每個推展都是單一世代,並且最終會計算一次獎勵。
當任務需要模型在數個步驟中充當代理程式時,請選擇多迴轉 RFT:呼叫工具、讀取和變更狀態,以及適應傳回的內容,然後才能判斷結果。這適合代理式工作流程,例如工具使用序列、多步驟故障診斷、對話助理或任何成功取決於軌跡的任務 (輪流的動作順序和正確性),而不只是最終答案。
經驗法則:如果任務可以從單一模型輸出進行評分,而沒有工具呼叫或不斷發展的狀態,請使用單迴轉 RFT;如果成功取決於對工具或具狀態環境的一系列動作,請使用多迴轉 RFT。
何時使用 Nova 1.0 與 Nova 2.0
RFT 僅適用於 Nova 2.0 Lite。對於 Nova 1.0 模型,請使用直接偏好最佳化 (DPO) 或近端政策最佳化 (PPO) 作為替代對齊技術。
原因模式
Amazon Nova 2.0 支援 RFT 訓練期間的推理模式。下列模式可供使用:
-
無:無推理 (省略 reasoning_effort 欄位)
-
低:最低推理開銷
-
高:推理功能上限 (指定 reasoning_effort 時預設為預設值)
注意
RFT 沒有媒體選項。如果組態中沒有 reasoning_effort 欄位,則會停用推理。