View a markdown version of this page

Ajuste fino por reforço (RFT) - Amazon Nova

Ajuste fino por reforço (RFT)

O ajuste fino por reforço (RFT) é uma técnica que melhora a performance do modelo por meio de sinais de feedback — pontuações mensuráveis ou recompensas indicando a qualidade da resposta — em vez de supervisão direta com respostas corretas exatas. Ao contrário do SFT que aprende com pares de entrada e saída, o RFT usa funções de recompensa para avaliar as respostas do modelo e otimiza iterativamente o modelo para maximizar essas recompensas. O RFT é compatível com o treinamento de turno único e de vários turnos:

  • RFT de turno único: o modelo gera uma única resposta a uma solicitação, e uma função de recompensa pontua essa resposta. Ideal para tarefas com métricas claras de qualidade por resposta, como matemática, geração de código e raciocínio estruturado.

  • RFT de vários turnos: o modelo realiza interações em várias etapas (por exemplo, fluxos de trabalho agênticos com o uso de ferramentas) e uma função de recompensa avalia a trajetória geral. Ideal para tarefas complexas que exigem tomada de decisão sequencial, como solução de problemas em várias etapas, orquestração de ferramentas e agentes conversacionais.

Quando usar o RFT

Use o RFT quando você puder definir critérios de sucesso claros e mensuráveis, mas tiver dificuldade em fornecer resultados exatos e corretos para o treinamento. O RFT é ideal quando:

  • Você tem uma função de recompensa confiável que pode avaliar as saídas do modelo de forma programática

  • É necessário alinhar o comportamento do modelo com preferências ou restrições específicas

  • Casos em que coletar exemplos rotulados de alta qualidade é caro ou impraticável

  • Existem várias soluções válidas, mas algumas são claramente melhores do que outras (escrita criativa, otimização de código, raciocínio complexo)

O RFT se destaca em domínios em que a qualidade da saída pode ser medida objetivamente: resolução de problemas matemáticos, geração de código, raciocínio científico, análise estruturada de dados, raciocínio em várias etapas, uso de ferramentas e fluxos de trabalho complexos com restrições específicas.

Modelos compatíveis

O RFT de um único turno e de vários turnos está disponível para os seguintes modelos Amazon Nova:

  • Nova 2.0 (Lite)

Quando usar o RFT de um único turno versus o RFT de vários turnos

Escolha o RFT de turno único quando a tarefa for uma troca única: o modelo recebe uma solicitação e produz uma única resposta que pode ser pontuada sozinha, sem chamadas de ferramentas intermediárias ou estado do ambiente para rastrear. Isso se encaixa em casos de uso como classificação, extração, perguntas e respostas específicas do domínio, resumo, moderação de conteúdo ou qualquer tarefa com uma resposta verificável (correspondência exata, F1, validação de esquema, verificação baseada em regras ou LLM-Judge na saída final). É mais simples, barato e rápido de executar, porque cada implementação é de uma única geração e a recompensa é calculada uma vez no final.

Escolha o RFT de vários turnos quando a tarefa exigir que o modelo atue como agente em várias etapas — chamando ferramentas, lendo e alterando o estado e adaptando-se ao que é retornado — antes que o resultado possa ser julgado. Isso se encaixa em fluxos de trabalho agênticos, como sequências de uso de ferramentas, solução de problemas em várias etapas, assistentes de conversação ou qualquer tarefa em que o sucesso dependa da trajetória (a ordem e a exatidão das ações nos turnos), e não apenas da resposta final.

Regra prática: se sua tarefa puder ser pontuada a partir de uma única saída de modelo sem chamadas de ferramentas ou estado em evolução, use o RFT de turno único; se o sucesso depender de uma sequência de ações contra ferramentas ou de um ambiente com estado, use o RFT de vários turnos.

Quando usar o Nova 1.0 versus o Nova 2.0

O RFT está disponível apenas no Nova 2.0 Lite. Para modelos Nova 1.0, use Direct Preference Optimization (DPO) ou Proximal Policy Optimization (PPO) como técnicas alternativas de alinhamento.

Modo de raciocínio

O Amazon Nova 2.0 é compatível com o modo de raciocínio durante o treinamento via RFT. Os seguintes modos estão disponíveis:

  • none: sem raciocínio (omita o campo reasoning_effort)

  • low: sobrecarga mínima de raciocínio

  • high: capacidade máxima de raciocínio (padrão quando reasoning_effort é especificado)

nota

Não há a opção medium para o RFT. Se o campo reasoning_effort estiver ausente da sua configuração, o raciocínio será desabilitado.