Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Multi-turn apprentissage par renforcement
Multi-turn L'apprentissage par renforcement (RL) forme un agent à prendre de bonnes décisions en plusieurs étapes, et pas seulement en un instant. L'agent observe son environnement, entreprend une action, reçoit une récompense et passe à un nouvel état, en répétant ce processus sur plusieurs pas de temps. L'objectif est d'apprendre une politique (comportement modèle) qui maximise la récompense cumulée sur l'ensemble de la séquence plutôt que d'optimiser une étape de manière isolée. Cette approche est de plus en plus utilisée pour entraîner des modèles de langage sur le raisonnement en plusieurs étapes et des tâches agentiques, dans le cadre desquelles le modèle effectue des actions telles que des appels d'outils, l'exécution de code ou des recherches sur le Web en plusieurs étapes et est récompensé en fonction de la séquence complète. Ceci est différent du tour unique RLHF/RLAIF, où une récompense est attribuée à une sortie à la fois.
Une simple analogie
Imaginez que vous êtes un agent du service client qui gère un ticket d'assistance. Vous ne pouvez pas le résoudre en un seul message. Vous posez des questions de clarification, vous recherchez le compte du client, vous essayez une solution, vous vérifiez si cela a fonctionné et vous effectuez un suivi si ce n'est pas le cas. Au final, soit le client repart satisfait, soit il ne l'est pas. Au fil du temps, vous apprenez à mieux reconnaître la séquence d'étapes qui a tendance à mener à une bonne résolution.
Multi-turn RL entraîne le modèle de la même manière. Au lieu d'évaluer le modèle en fonction d'une seule réponse, il permet au modèle d'exécuter une tâche en plusieurs étapes et de le récompenser en fonction de la séquence complète. Le modèle apprend quelles décisions prises plus tôt dans la conversation étaient réellement importantes.
Terminologie clé
-
Agent : l'entité décisionnelle du système. Il observe la situation actuelle, décide des mesures à prendre et apprend au fil du temps à améliorer sa stratégie. Dans la pratique, l'agent est alimenté par un modèle d'IA, mais les deux ne sont pas identiques. Le modèle est le réseau neuronal sous-jacent ; l'agent est le système plus large qui l'utilise pour percevoir, décider et agir. En termes simples : le représentant du service client qui gère le ticket.
-
Environment/Agentic Application : tout ce avec quoi l'agent interagit, y compris l'historique des conversations, les détails du compte du client et tous les outils que l'agent peut utiliser. En termes simples : la plateforme d'assistance, le client et toutes les informations mises à la disposition du représentant.
-
État : un aperçu de la situation actuelle que l'agent observe avant de décider de la marche à suivre. En termes simples : ce que le représentant sait actuellement, comme le problème du client, ce qui a déjà été essayé et la dernière réponse.
-
Action : ce que fait l'agent à chaque étape, comme poser une question de clarification, appeler un outil ou envoyer une réponse. En termes simples : la prochaine étape du représentant, qu'il s'agisse de poser une question, de rechercher quelque chose ou d'envoyer un correctif.
-
Récompense : le signal de feedback que l'agent reçoit, soit à chaque étape, soit à la fin de la tâche, indiquant dans quelle mesure les choses se sont bien passées. En termes simples : le client est-il reparti satisfait ? Ce résultat est la récompense.
-
Politique : stratégie apprise par l'agent. Il associe un état donné à l'action la plus susceptible de mener à un bon résultat. En termes simples : les connaissances que le représentant a acquises grâce à son expérience, en sachant ce qui a tendance à fonctionner dans une situation donnée.
-
Épisode : exécution complète d'une tâche du début à la fin. En termes simples : une conversation d'assistance complète, du premier message du client à la résolution.
-
Tour : un échange unique au cours d'un épisode, généralement une action entreprise par l'agent et la réponse qu'il reçoit de l'environnement. Dans une conversation, il s'agit d'un message et de sa réponse. En termes simples : une étape dans la conversation d'assistance, par exemple si l'agent pose une question et le client y répond.
-
Trajectoire : la séquence complète des états, des actions et des récompenses enregistrés au cours d'un épisode entier. Il s'agit de l'enregistrement complet de ce que l'agent a fait et de ce qui s'est passé en conséquence, utilisé pour calculer la récompense et mettre à jour la politique. En termes simples : la transcription complète de la conversation d'assistance du début à la fin, y compris toutes les décisions prises par l'agent et la façon dont les choses se sont déroulées.
-
Récompense cumulée : récompense totale cumulée à toutes les étapes d'un épisode, que l'agent essaie finalement de maximiser. En termes simples : il ne s'agit pas seulement de savoir si une étape s'est bien passée, mais aussi si l'ensemble de la conversation s'est bien passé dans l'ensemble.
Cas d'utilisation pour l'apprentissage par renforcement multi-tours
Multi-turn La RL est la bonne approche lorsqu'une seule réponse ne suffit pas pour bien accomplir une tâche. Si votre cas d'utilisation implique une séquence d'étapes, des décisions qui dépendent des décisions précédentes, la RL multi-tours vaut la peine d'être envisagée.
Voici quelques signaux qui vont dans ce sens :
-
Votre tâche nécessite une interaction réciproque : le modèle doit poser des questions, recueillir des informations et s'adapter en fonction de ce qu'il apprend en cours de route. Un seul cycle de réponse rapide ne suffit pas. Exemple : un agent de support qui diagnostique un problème en posant des questions complémentaires avant de proposer une solution.
-
La qualité du résultat dépend d'une séquence d'actions : pour obtenir la bonne réponse à la fin, il faut prendre les bonnes mesures tout au long. Récompenser uniquement le résultat final ne suffit pas si le chemin pour y parvenir est important. Exemple : un assistant de codage qui planifie, écrit, exécute et débogue le code en plusieurs étapes.
-
Le modèle doit utiliser des outils répartis en plusieurs étapes : le modèle fait appel à des outils externes tels que la recherche, les API ou l'exécution de code, et les résultats d'un appel d'outil influencent la suite. Exemple : un assistant de recherche qui recherche des informations, évalue les résultats et affine sa requête avant de produire un résumé.
-
Les erreurs commises en cours de tâche devraient être réparables : vous voulez que le modèle reconnaisse les erreurs et corrige le problème, plutôt que de s'engager dans une mauvaise voie dès le départ. Exemple : un agent qui essaie une solution, vérifie si elle a fonctionné et essaie une autre approche si ce n'est pas le cas.
-
Vous constatez de bonnes performances en un tour mais une mauvaise exécution des tâches de bout en bout : si votre modèle gère bien les différentes étapes mais peine à les enchaîner pour obtenir un résultat cohérent et réussi, le RL multitour peut vous aider à combler cet écart.
Modèles, prix et régions pris en charge
Modèles pris en charge
| Modèle | Région |
|---|---|
| Nouveau Lite 2.0 | IAD (États-Unis-Est-1), PDX (États-Unis-Ouest-2) |
| GPT-OSS-20B | IAD (États-Unis-Est-1), PDX (États-Unis-Ouest-2) |
| Gemma-4-31B-it | PDX (États-Unis-Ouest-2) |
| Qwen 3.6 27V | PDX (États-Unis-Ouest-2) |
Tarification
Pour plus de détails sur les prix, consultez la page des tarifs publics
-
Préremplissage : coût du traitement des jetons d'entrée introduits dans le modèle au début de chaque étape de formation. Cela inclut l'invite, l'historique des conversations et tout contexte reçu par le modèle avant de générer une réponse.
-
Exemple : le coût des jetons générés par le modèle lors du déploiement de la formation. C'est là que le modèle produit ses réponses, qui sont ensuite évaluées et utilisées pour calculer le signal de récompense.
-
Train : coût de la passe en arrière, où les poids du modèle sont mis à jour en fonction du signal de récompense. Il s'agit de la principale étape d'apprentissage du processus RL.