View a markdown version of this page

Multi-turn aprendizagem por reforço - SageMaker IA da Amazon

As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.

Multi-turn aprendizagem por reforço

Multi-turn o aprendizado por reforço (RL) treina um agente para tomar boas decisões em uma sequência de etapas, não apenas em um único momento. O agente observa seu ambiente, realiza uma ação, recebe uma recompensa e se move para um novo estado, repetindo esse processo em várias etapas de tempo. O objetivo é aprender uma política (modelo de comportamento) que maximize a recompensa cumulativa em toda a sequência, em vez de otimizar para qualquer etapa isoladamente. Essa abordagem é cada vez mais usada para treinar modelos de linguagem em raciocínio de várias etapas e tarefas agentes, nas quais o modelo executa ações como chamadas de ferramentas, execução de código ou pesquisa na web em vários turnos e é recompensado com base em toda a sequência. Isso é diferente de um único turno RLHF/RLAIF, em que uma recompensa é atribuída a uma saída por vez.

Uma analogia simples

Imagine que você é um agente de atendimento ao cliente que administra um ticket de suporte. Você não resolve isso em uma mensagem. Você faz perguntas esclarecedoras, consulta a conta do cliente, tenta uma solução, verifica se funcionou e acompanha se não funcionou. No final, o cliente sai satisfeito ou não. Com o tempo, você fica melhor em reconhecer qual sequência de etapas tende a levar a uma boa resolução.

Multi-turn O RL treina o modelo da mesma maneira. Em vez de classificar o modelo em uma única resposta, ele permite que o modelo execute uma tarefa em várias etapas e o recompensa com base em toda a sequência. O modelo aprende quais decisões anteriores na conversa realmente importaram.

Terminologia básica

  • Agente: a entidade de tomada de decisão no sistema. Ele observa a situação atual, decide qual ação tomar e aprende com o tempo a melhorar sua estratégia. Na prática, o agente é alimentado por um modelo de IA, mas os dois não são a mesma coisa. O modelo é a rede neural subjacente; o agente é o sistema mais amplo que o usa para perceber, decidir e agir. Em termos simples: o representante de atendimento ao cliente responsável pelo ticket.

  • Environment/Agentic Aplicação: tudo com o qual o agente interage, incluindo o histórico de conversas, os detalhes da conta do cliente e todas as ferramentas que o agente possa usar. Em termos simples: a plataforma de suporte, o cliente e todas as informações disponíveis para o representante.

  • Estado: um instantâneo da situação atual que o agente observa antes de decidir o que fazer a seguir. Em termos simples: o que o representante sabe no momento, como o problema do cliente, o que já foi testado e a resposta mais recente.

  • Ação: o que o agente faz em cada etapa, como fazer uma pergunta esclarecedora, ligar para uma ferramenta ou enviar uma resposta. Em termos simples: o próximo passo do representante, seja fazer uma pergunta, pesquisar algo ou enviar uma correção.

  • Recompensa: o sinal de feedback que o agente recebe, em cada etapa ou no final da tarefa, indicando o quão bem as coisas correram. Em termos simples: o cliente saiu satisfeito? Esse resultado é a recompensa.

  • Política: a estratégia que o agente aprendeu. Ele mapeia um determinado estado para a ação com maior probabilidade de levar a um bom resultado. Em termos simples: o conhecimento do representante construído a partir da experiência, sabendo o que tende a funcionar em uma determinada situação.

  • Episódio: uma execução completa de uma tarefa do início ao fim. Em termos simples: uma conversa de suporte completa, desde a primeira mensagem do cliente até a resolução.

  • Turno: uma única troca dentro de um episódio, normalmente uma ação tomada pelo agente e a resposta que ele recebe do ambiente. Em uma conversa, essa é uma mensagem e sua resposta. Em termos simples: uma etapa na conversa de suporte, como o agente fazendo uma pergunta e o cliente respondendo.

  • Trajetória: a sequência completa de estados, ações e recompensas registradas em um episódio inteiro. É o registro completo do que o agente fez e do que aconteceu como resultado, usado para calcular a recompensa e atualizar a política. Em termos simples: toda a transcrição da conversa de suporte do início ao fim, incluindo todas as decisões tomadas pelo agente e como as coisas aconteceram.

  • Recompensa cumulativa: a recompensa total acumulada em todas as etapas de um episódio, que é o que o agente está tentando maximizar. Em termos simples: não apenas se uma etapa correu bem, mas se toda a conversa correu bem no geral.

Casos de uso para aprendizado por reforço em vários turnos

Multi-turn A RL é a abordagem correta quando uma única resposta não é suficiente para concluir bem uma tarefa. Se seu caso de uso envolver uma sequência de etapas, decisões que dependem das anteriores, vale a pena considerar o RL de várias voltas.

Aqui estão alguns sinais que apontam para isso:

  • Sua tarefa exige interação de ida e volta: o modelo precisa fazer perguntas, coletar informações e se adaptar com base no que aprende ao longo do caminho. Um único ciclo de resposta rápida não é suficiente. Exemplo: um agente de suporte que diagnostica um problema fazendo perguntas complementares antes de sugerir uma solução.

  • A qualidade do resultado depende de uma sequência de ações: obter a resposta certa no final exige fazer os movimentos certos por toda parte. Recompensar apenas o resultado final não é suficiente se o caminho para chegar lá for importante. Exemplo: um assistente de codificação que planeja, grava, executa e depura código em várias etapas.

  • O modelo precisa usar ferramentas em várias etapas: o modelo chama ferramentas externas, como pesquisa, APIs ou execução de código, e os resultados de uma chamada de ferramenta influenciam o que ele faz a seguir. Exemplo: um assistente de pesquisa que pesquisa informações, avalia os resultados e refina sua consulta antes de produzir um resumo.

  • Os erros no meio da tarefa devem ser recuperáveis: você quer que o modelo reconheça quando algo não está funcionando e corrija o curso, em vez de se comprometer com um caminho ruim desde o início. Exemplo: um agente que tenta uma solução, verifica se ela funcionou e tenta uma abordagem diferente se não funcionou.

  • Você está obtendo um bom desempenho em um único turno, mas uma conclusão ruim de tarefas de ponta a ponta: se seu modelo lida bem com etapas individuais, mas tem dificuldade em uni-las em um resultado coerente e bem-sucedido, o RL de vários turnos pode ajudar a preencher essa lacuna.

Modelos, preços e regiões compatíveis

Modelos compatíveis

Modelo Região
Nova Lite 2.0 IAD (EUA-Leste-1), PDX (EUA-OESTE-2)
GPT-OSS-20B IAD (EUA-Leste-1), PDX (EUA-OESTE-2)
Gemma-4-31B-it PDX (nós-oeste-2)
Qwen 3.6 27B PDX (nós-oeste-2)

Preços

Para obter detalhes completos sobre preços, consulte a página pública de preços. As cobranças são baseadas em três dimensões:

  • Preenchimento prévio: o custo do processamento dos tokens de entrada inseridos no modelo no início de cada etapa de treinamento. Isso inclui a solicitação, o histórico da conversa e qualquer contexto que o modelo receba antes de gerar uma resposta.

  • Exemplo: o custo dos tokens que o modelo gera durante o lançamento do treinamento. É aqui que o modelo produz suas respostas, que são então avaliadas e usadas para calcular o sinal de recompensa.

  • Trem: o custo da passagem para trás, em que os pesos do modelo são atualizados com base no sinal de recompensa. Essa é a principal etapa de aprendizado no processo de RL.

Tópicos