View a markdown version of this page

强化微调(RFT) - Amazon Nova

强化微调(RFT)

强化微调(RFT)是一种技术,它通过反馈信号(即可衡量响应质量的分数或奖励)提升模型性能,而非借助精确标准答案进行直接监督。与从输入-输出对中学习的 SFT 不同,RFT 使用奖励函数来评测模型响应,并迭代优化模型以获得最高奖励。RFT 同时支持单轮和多轮训练:

  • 单轮 RFT:模型针对提示生成单个响应,奖励函数对该响应进行评分。最适合具有明确的单次响应质量指标的任务,例如数学、代码生成和结构化推理。

  • 多轮 RFT:模型进行多步交互(例如,使用工具的代理式工作流),奖励函数对整体轨迹进行评估。最适合需要序列化决策的复杂任务,例如多步骤问题解决方法、工具编排和对话代理。

何时使用 RFT

当您能够定义清晰、可衡量的成功标准,但难以提供精确的正确输出用于训练时,便可使用 RFT。RFT 非常适合以下情况:

  • 具备可通过程序评测模型输出的可靠奖励函数

  • 需要使模型行为与特定偏好或约束保持一致

  • 收集高质量标注样本成本过高或不切实际的情况

  • 存在多种有效的解决方案,但部分方案明显优于其他(创造性写作,代码优化,复杂推理)

RFT 在可以客观衡量输出质量的领域表现出色:数学问题解决、代码生成、科学推理、结构化数据分析、多步骤推理、工具使用,以及具有特定约束的复杂工作流。

支持的模型

单轮和多轮 RFT 适用于以下 Amazon Nova 模型:

  • Nova 2.0(Lite)

何时使用单轮 RFT 以及何时使用多轮 RFT

当任务为单次交互时,请选择单轮 RFT:模型接收提示并产生单个响应,该响应可以自行评分,不需要跟踪中间工具调用或环境状态。这适用于分类、提取、特定领域问答、摘要、内容审核,或任何具有可验证答案的任务(精确匹配、F1、架构验证、基于规则的检查,或对最终输出进行 LLM Judge 检查)等应用场景。它的运行更简单、成本更低、速度也更快,因为每次 rollout 只产生一次生成结果,奖励仅在最后计算一次。

当任务要求模型在几个步骤中充当代理时(调用工具,读取和改变状态,并适应返回的内容),在可以判断结果之前,选择多轮 RFT。这适用于代理工作流,例如工具使用序列、多步骤故障排查、对话助手,或任何成功与否取决于轨迹(跨轮次操作的顺序与正确性)而非仅凭最终答案的任务。

经验法则:如果任务可以在没有工具调用或演化状态的情况下从单个模型输出进行评分,则使用单轮 RFT;如果成功取决于对工具或有状态环境的一系列操作,则使用多轮 RFT。

何时选用 Nova 1.0 与 Nova 2.0

RFT 仅适用于 Nova 2.0 Lite。对于 Nova 1.0 模型,请使用直接偏好优化(DPO)或近端策略优化(PPO)作为替代对齐技术。

推理模式

Amazon Nova 2.0 支持在 RFT 训练期间使用推理模式。可用模式如下:

  • none:无推理(省略 reasoning_effort 字段)

  • low:最小推理开销

  • high:最大推理能力(指定了 reasoning_effort 时,此为默认值)

注意

RFT 无中等选项。如果配置中不含 reasoning_effort 字段,则禁用推理。