View a markdown version of this page

強化ファインチューニング (RFT) - Amazon Nova

強化ファインチューニング (RFT)

強化ファインチューニング (RFT) は、正確な回答で直接監視するのではなく、フィードバックシグナル、つまり測定可能なスコアや応答品質を示す報酬を通じてモデルのパフォーマンスを向上させる手法です。入出力ペアから学習する SFT とは異なり、RFT は報酬関数を使用してモデルレスポンスを評価し、モデルを繰り返し最適化してこれらの報酬を最大化します。RFT は、シングルターンとマルチターンの両方のトレーニングをサポートしています。

  • シングルターン RFT: モデルはプロンプトに対して単一のレスポンスを生成し、報酬関数がそのレスポンスをスコアリングします。数学、コード生成、構造化推論など、レスポンスごとに明確な品質メトリクスが存在するタスクに最適です。

  • マルチターン RFT: モデルはマルチステップのインタラクション (ツールを使用したエージェンティックワークフローなど) を実行し、報酬関数が全体的な軌跡を評価します。マルチステップの問題解決、ツールオーケストレーション、会話エージェントなど、逐次的な意思決定を必要とする複雑なタスクに最適です。

RFT はどのような場合に使用するか

明確で測定可能な成功基準を定義できるが、トレーニング用に正確な出力を提供することに苦労している場合は、RFT を使用します。RFT は、次の場合に最適です。

  • プログラムでモデル出力を評価できる信頼性の高い報酬関数がある場合

  • モデルの動作を特定の好みや制約に合わせる必要がある場合

  • 高品質のラベル付き例の収集が高価または実用的でない場合

  • 複数の有効なソリューションが存在するが、一部は他よりも明らかに優れている場合 (創造的な文章作成、コードの最適化、複雑な推論)

RFT は、数学的問題解決、コード生成、科学的推論、構造化データ分析、複数ステップの推論、ツールの使用、特定の制約を伴う複雑なワークフローなど、出力品質を客観的に測定できるドメインに優れています。

サポートされているモデル

シングルターンおよびマルチターン RFT は、次の Amazon Nova モデルで使用できます。

  • Nova 2.0 (Lite)

シングルターン RFT とマルチターン RFT の使い分け

タスクがワンショット交換の場合は、シングルターン RFT を選択します。モデルはプロンプトを受け取り、中間ツール呼び出しや追跡すべき環境状態なしで、単独でスコアリングできる単一のレスポンスを生成します。これは、分類、抽出、ドメイン固有の Q&A、要約、コンテンツモデレーション、検証可能な回答を持つタスク (完全一致、F1、スキーマ検証、最終出力に対するルールベースまたは LLM 判定チェック) などのユースケースに適しています。各ロールアウトは単一の生成であり、報酬は最後に 1 回計算されるため、実行がより簡単で、低コストかつ高速です。

結果が判断される前に、ツールの呼び出し、状態の読み取りと変更、返された内容への適応など、複数の手順にわたってモデルがエージェントとして機能する必要がある場合は、マルチターン RFT を選択します。これは、ツール使用シーケンス、マルチステップのトラブルシューティング、会話型アシスタント、または最終的な回答だけでなく、成功が軌跡 (ターン間のアクションの順序と正確性) に依存するタスクなど、エージェンティックワークフローに適しています。

経験則: ツール呼び出しや変化する状態なしでタスクを単一のモデル出力からスコアリングできる場合は、シングルターン RFT を使用します。成功がツールやステートフル環境に対する一連のアクションに依存する場合は、マルチターン RFT を使用します。

Nova 1.0 または Nova 2.0 を使用する場合

RFT は Nova 2.0 Lite でのみ使用できます。Nova 1.0 モデルでは、代替アライメント手法として 直接選好最適化 (DPO) または 近似ポリシー最適化 (PPO) を使用します。

推論モード

Amazon Nova 2.0 は、RFT トレーニング中の推論モードをサポートしています。次の方法を使用できます。

  • none: 推論なし (reasoning_effort フィールドを省略)

  • low: 最小限の推論オーバーヘッド

  • high: 最大限の推論機能 (reasoning_effort が指定されている場合のデフォルト)

注記

RFT には中程度のオプションはありません。reasoning_effort フィールドが設定にない場合、推論は無効になります。