View a markdown version of this page

Refinamiento por refuerzo (RFT) - Amazon Nova

Refinamiento por refuerzo (RFT)

El refinamiento por refuerzo (RFT) es una técnica que mejora el rendimiento del modelo mediante señales de comentarios (puntuaciones medibles o recompensas que indican la calidad de la respuesta) en lugar de una supervisión directa con respuestas exactas y correctas. A diferencia del SFT, que aprende a partir de pares de entrada y salida, RFT utiliza funciones de recompensa para evaluar las respuestas del modelo y optimiza el modelo de forma iterativa para maximizar esas recompensas. El RFT admite el entrenamiento de un solo turno y de varios turnos:

  • RFT de un solo turno: el modelo genera una respuesta única a una petición y una función de recompensa otorga una puntuación a esa respuesta. Ideal para tareas con métricas de calidad claras por respuesta, como matemáticas, generación de código y razonamiento estructurado.

  • RFT de varios turnos: el modelo interactúa en varios pasos (por ejemplo, flujos de trabajo de agentes con el uso de herramientas) y una función de recompensa realiza evaluaciones de la trayectoria general. Ideal para tareas complejas que requieren una toma de decisiones secuencial, como la resolución de problemas en varios pasos, la orquestación de herramientas y los agentes conversacionales.

Cuándo se debe usar el RFT

Utilice el RFT cuando pueda definir requisitos de éxito claros y medibles, pero tenga dificultades para proporcionar resultados exactos y correctos para el entrenamiento. RFT es ideal cuando:

  • Tiene una función de recompensa fiable que pueda evaluar los resultados del modelo mediante programación

  • Necesita alinear el comportamiento del modelo con preferencias o restricciones específicas

  • La recopilación de ejemplos etiquetados de alta calidad es caro o poco práctico

  • Existen varias soluciones válidas, pero algunas son claramente mejores que otras (escritura creativa, optimización del código, razonamiento complejo)

RFT destaca en ámbitos en los que la calidad de los resultados se puede medir objetivamente: resolución de problemas matemáticos, generación de código, razonamiento científico, análisis de datos estructurados, razonamiento en varios pasos, uso de herramientas y flujos de trabajo complejos con restricciones específicas.

Modelos compatibles

El RFT de uno o varios turnos está disponible para los siguientes modelos de Amazon Nova:

  • Nova 2.0 (Lite)

Cuándo usar el RFT de un solo turno o el RFT de varios turnos

Elija el RFT de un solo turno cuando la tarea sea un intercambio de una sola vez: el modelo recibe un mensaje y produce una respuesta única que se puede puntuar por sí sola, sin necesidad de utilizar herramientas intermedias ni hacer un seguimiento del estado del entorno. Esto se adapta a casos de uso como la clasificación, la extracción, las preguntas y respuestas específicas de un dominio, el resumen, la moderación de contenido o cualquier tarea con una respuesta verificable (coincidencia exacta, F1, validación de esquemas, verificación del resultado final basada en reglas o mediante un juez de LLM). Es más simple, económico y rápido de ejecutar, ya que cada implementación es de una sola generación y la recompensa se calcula una vez al final.

Elija el RFT de varios turnos cuando la tarea requiera que el modelo actúe como agente en varios pasos (utilizar herramientas, leer y mutar el estado y adaptarse a lo que vuelva) antes de poder evaluar el resultado. Esto se adapta a los flujos de trabajo agéntico, como las secuencias de uso de herramientas, la solución de problemas en varios pasos, los asistentes conversacionales o cualquier tarea en la que el éxito dependa de la trayectoria (el orden y la corrección de las acciones en los turnos) y no solo de la respuesta final.

Regla general: si su tarea se puede puntuar a partir de un resultado de un solo modelo sin llamadas a herramientas ni estado en evolución, utilice el RFT de un solo turno; si el éxito depende de una secuencia de acciones contra herramientas o de un entorno con estado, utilice el RFT de varios turnos.

Cuándo se debe usar Nova 1.0 en lugar de Nova 2.0

El RFT solo está disponible en Nova 2.0 Lite. Para los modelos Nova 1.0, utilice la optimización de preferencias directas (DPO) o la optimización de políticas proximales (PPO) como técnicas de alineación alternativas.

Modo de razonamiento

Amazon Nova 2.0 admite el modo razonamiento durante el entrenamiento con el RFT. Están disponibles los siguientes modos:

  • ninguno: sin razonamiento (omita el campo reasoning_effort)

  • bajo: sobrecarga de razonamiento mínima

  • alto: capacidad de razonamiento máxima (opción predeterminada cuando se especifica reasoning_effort)

nota

No hay una opción media para el RFT. Si el campo reasoning_effort no está en la configuración, el razonamiento está desactivado.