View a markdown version of this page

強化微調 (RFT) - Amazon Nova

本文為英文版的機器翻譯版本,如內容有任何歧義或不一致之處,概以英文版為準。

強化微調 (RFT)

強化微調 (RFT) 是一種技術,可透過回饋訊號 - 可測量的分數或獎勵指出回應品質 - 而不是直接監督並準確回答,來改善模型效能。與從輸入輸出對中學習的 SFT 不同,RFT 使用獎勵函數來評估模型回應,並反覆最佳化模型以最大化這些獎勵。RFT 同時支援單迴轉和多迴轉訓練:

  • 單迴轉 RFT:模型會針對提示產生單一回應,而獎勵函數則會對該回應進行評分。最適合具有清晰每個回應品質指標的任務,例如數學、程式碼產生和結構化推理。

  • 多迴轉 RFT:模型參與多步驟互動 (例如,使用工具的代理工作流程),獎勵函數會評估整體軌跡。最適合需要循序決策的複雜任務,例如多步驟問題解決、工具協同運作和對話客服人員。

何時使用 RFT

當您可以定義明確、可衡量的成功條件,但難以提供確切正確的訓練輸出時,請使用 RFT。RFT 的理想時機:

  • 您有一個可靠的獎勵函數,可以透過程式設計方式評估模型輸出

  • 您需要使模型行為符合特定偏好設定或限制條件

  • 收集高品質的標籤範例非常昂貴或不切實際

  • 存在多個有效的解決方案,但有些解決方案明顯優於其他解決方案 (創造性寫入、程式碼最佳化、複雜推理)

RFT 在可以客觀測量輸出品質的網域中表現卓越:數學問題解決、程式碼產生、科學推理、結構化資料分析、多步驟推理、工具使用量,以及具有特定限制的複雜工作流程。

支援的模型

單迴轉和多迴轉 RFT 適用於下列 Amazon Nova 模型:

  • Nova 2.0 (精簡型)

何時使用單迴轉 RFT 與多迴轉 RFT

當任務是一次性交換時,選擇單迴轉 RFT:模型會收到提示,並產生可自行評分的單一回應,無需追蹤中繼工具呼叫或環境狀態。這適合使用案例,例如分類、擷取、網域特定問答、摘要、內容管制,或任何具有可驗證答案的任務 (完全相符、F1、結構描述驗證、最終輸出上的規則型或 LLM 判斷檢查)。它更簡單、更便宜且執行速度更快,因為每個推展都是單一世代,並且最終會計算一次獎勵。

當任務需要模型在數個步驟中充當代理程式時,請選擇多迴轉 RFT:呼叫工具、讀取和變更狀態,以及適應傳回的內容,然後才能判斷結果。這適合代理式工作流程,例如工具使用序列、多步驟故障診斷、對話助理或任何成功取決於軌跡的任務 (輪流的動作順序和正確性),而不只是最終答案。

經驗法則:如果任務可以從單一模型輸出進行評分,而沒有工具呼叫或不斷發展的狀態,請使用單迴轉 RFT;如果成功取決於對工具或具狀態環境的一系列動作,請使用多迴轉 RFT。

何時使用 Nova 1.0 與 Nova 2.0

RFT 僅適用於 Nova 2.0 Lite。對於 Nova 1.0 模型,請使用直接偏好最佳化 (DPO) 或近端政策最佳化 (PPO) 作為替代對齊技術。

原因模式

Amazon Nova 2.0 支援 RFT 訓練期間的推理模式。下列模式可供使用:

  • :無推理 (省略 reasoning_effort 欄位)

  • :最低推理開銷

  • :推理功能上限 (指定 reasoning_effort 時預設為預設值)

注意

RFT 沒有媒體選項。如果組態中沒有 reasoning_effort 欄位,則會停用推理。