As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.
Multi-turn aprendizagem por reforço
Multi-turn o aprendizado por reforço (RL) treina um agente para tomar boas decisões em uma sequência de etapas, não apenas em um único momento. O agente observa seu ambiente, realiza uma ação, recebe uma recompensa e se move para um novo estado, repetindo esse processo em várias etapas de tempo. O objetivo é aprender uma política (modelo de comportamento) que maximize a recompensa cumulativa em toda a sequência, em vez de otimizar para qualquer etapa isoladamente. Essa abordagem é cada vez mais usada para treinar modelos de linguagem em raciocínio de várias etapas e tarefas agentes, nas quais o modelo executa ações como chamadas de ferramentas, execução de código ou pesquisa na web em vários turnos e é recompensado com base em toda a sequência. Isso é diferente de um único turno RLHF/RLAIF, em que uma recompensa é atribuída a uma saída por vez.
Uma analogia simples
Imagine que você é um agente de atendimento ao cliente que administra um ticket de suporte. Você não resolve isso em uma mensagem. Você faz perguntas esclarecedoras, consulta a conta do cliente, tenta uma solução, verifica se funcionou e acompanha se não funcionou. No final, o cliente sai satisfeito ou não. Com o tempo, você fica melhor em reconhecer qual sequência de etapas tende a levar a uma boa resolução.
Multi-turn O RL treina o modelo da mesma maneira. Em vez de classificar o modelo em uma única resposta, ele permite que o modelo execute uma tarefa em várias etapas e o recompensa com base em toda a sequência. O modelo aprende quais decisões anteriores na conversa realmente importaram.
Terminologia básica
-
Agente: a entidade de tomada de decisão no sistema. Ele observa a situação atual, decide qual ação tomar e aprende com o tempo a melhorar sua estratégia. Na prática, o agente é alimentado por um modelo de IA, mas os dois não são a mesma coisa. O modelo é a rede neural subjacente; o agente é o sistema mais amplo que o usa para perceber, decidir e agir. Em termos simples: o representante de atendimento ao cliente responsável pelo ticket.
-
Environment/Agentic Aplicação: tudo com o qual o agente interage, incluindo o histórico de conversas, os detalhes da conta do cliente e todas as ferramentas que o agente possa usar. Em termos simples: a plataforma de suporte, o cliente e todas as informações disponíveis para o representante.
-
Estado: um instantâneo da situação atual que o agente observa antes de decidir o que fazer a seguir. Em termos simples: o que o representante sabe no momento, como o problema do cliente, o que já foi testado e a resposta mais recente.
-
Ação: o que o agente faz em cada etapa, como fazer uma pergunta esclarecedora, ligar para uma ferramenta ou enviar uma resposta. Em termos simples: o próximo passo do representante, seja fazer uma pergunta, pesquisar algo ou enviar uma correção.
-
Recompensa: o sinal de feedback que o agente recebe, em cada etapa ou no final da tarefa, indicando o quão bem as coisas correram. Em termos simples: o cliente saiu satisfeito? Esse resultado é a recompensa.
-
Política: a estratégia que o agente aprendeu. Ele mapeia um determinado estado para a ação com maior probabilidade de levar a um bom resultado. Em termos simples: o conhecimento do representante construído a partir da experiência, sabendo o que tende a funcionar em uma determinada situação.
-
Episódio: uma execução completa de uma tarefa do início ao fim. Em termos simples: uma conversa de suporte completa, desde a primeira mensagem do cliente até a resolução.
-
Turno: uma única troca dentro de um episódio, normalmente uma ação tomada pelo agente e a resposta que ele recebe do ambiente. Em uma conversa, essa é uma mensagem e sua resposta. Em termos simples: uma etapa na conversa de suporte, como o agente fazendo uma pergunta e o cliente respondendo.
-
Trajetória: a sequência completa de estados, ações e recompensas registradas em um episódio inteiro. É o registro completo do que o agente fez e do que aconteceu como resultado, usado para calcular a recompensa e atualizar a política. Em termos simples: toda a transcrição da conversa de suporte do início ao fim, incluindo todas as decisões tomadas pelo agente e como as coisas aconteceram.
-
Recompensa cumulativa: a recompensa total acumulada em todas as etapas de um episódio, que é o que o agente está tentando maximizar. Em termos simples: não apenas se uma etapa correu bem, mas se toda a conversa correu bem no geral.
Casos de uso para aprendizado por reforço em vários turnos
Multi-turn A RL é a abordagem correta quando uma única resposta não é suficiente para concluir bem uma tarefa. Se seu caso de uso envolver uma sequência de etapas, decisões que dependem das anteriores, vale a pena considerar o RL de várias voltas.
Aqui estão alguns sinais que apontam para isso:
-
Sua tarefa exige interação de ida e volta: o modelo precisa fazer perguntas, coletar informações e se adaptar com base no que aprende ao longo do caminho. Um único ciclo de resposta rápida não é suficiente. Exemplo: um agente de suporte que diagnostica um problema fazendo perguntas complementares antes de sugerir uma solução.
-
A qualidade do resultado depende de uma sequência de ações: obter a resposta certa no final exige fazer os movimentos certos por toda parte. Recompensar apenas o resultado final não é suficiente se o caminho para chegar lá for importante. Exemplo: um assistente de codificação que planeja, grava, executa e depura código em várias etapas.
-
O modelo precisa usar ferramentas em várias etapas: o modelo chama ferramentas externas, como pesquisa, APIs ou execução de código, e os resultados de uma chamada de ferramenta influenciam o que ele faz a seguir. Exemplo: um assistente de pesquisa que pesquisa informações, avalia os resultados e refina sua consulta antes de produzir um resumo.
-
Os erros no meio da tarefa devem ser recuperáveis: você quer que o modelo reconheça quando algo não está funcionando e corrija o curso, em vez de se comprometer com um caminho ruim desde o início. Exemplo: um agente que tenta uma solução, verifica se ela funcionou e tenta uma abordagem diferente se não funcionou.
-
Você está obtendo um bom desempenho em um único turno, mas uma conclusão ruim de tarefas de ponta a ponta: se seu modelo lida bem com etapas individuais, mas tem dificuldade em uni-las em um resultado coerente e bem-sucedido, o RL de vários turnos pode ajudar a preencher essa lacuna.
Modelos, preços e regiões compatíveis
Modelos compatíveis
| Modelo | Região |
|---|---|
| Nova Lite 2.0 | IAD (EUA-Leste-1), PDX (EUA-OESTE-2) |
| GPT-OSS-20B | IAD (EUA-Leste-1), PDX (EUA-OESTE-2) |
| Gemma-4-31B-it | PDX (nós-oeste-2) |
| Qwen 3.6 27B | PDX (nós-oeste-2) |
Preços
Para obter detalhes completos sobre preços, consulte a página pública de preços
-
Preenchimento prévio: o custo do processamento dos tokens de entrada inseridos no modelo no início de cada etapa de treinamento. Isso inclui a solicitação, o histórico da conversa e qualquer contexto que o modelo receba antes de gerar uma resposta.
-
Exemplo: o custo dos tokens que o modelo gera durante o lançamento do treinamento. É aqui que o modelo produz suas respostas, que são então avaliadas e usadas para calcular o sinal de recompensa.
-
Trem: o custo da passagem para trás, em que os pesos do modelo são atualizados com base no sinal de recompensa. Essa é a principal etapa de aprendizado no processo de RL.