View a markdown version of this page

Multi-turn verstärkendes Lernen - Amazon SageMaker KI

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Multi-turn verstärkendes Lernen

Multi-turn Reinforcement Learning (RL) trainiert einen Agenten darin, in einer Abfolge von Schritten gute Entscheidungen zu treffen, nicht nur in einem einzigen Moment. Der Agent beobachtet seine Umgebung, ergreift eine Aktion, erhält eine Belohnung und wechselt in einen neuen Zustand, wobei er diesen Prozess in vielen Zeitschritten wiederholt. Das Ziel besteht darin, eine Richtlinie (Modellverhalten) zu erlernen, die die kumulative Belohnung über die gesamte Sequenz hinweg maximiert, anstatt die Optimierung für einen einzelnen Schritt isoliert durchzuführen. Dieser Ansatz wird zunehmend verwendet, um Sprachmodelle für mehrstufiges Denken und generische Aufgaben zu trainieren, bei denen das Modell Aktionen wie Tool-Aufrufe, Codeausführung oder Websuche über mehrere Runden hinweg durchführt und für die gesamte Sequenz belohnt wird. Dies unterscheidet sich von Single-Turn RLHF/RLAIF, bei dem jeweils einem Output eine Belohnung zugewiesen wird.

Eine einfache Analogie

Stellen Sie sich vor, Sie sind ein Kundendienstmitarbeiter, der ein Support-Ticket bearbeitet. Sie lösen es nicht in einer Nachricht auf. Du stellst klärende Fragen, schaust im Kundenkonto nach, versuchst eine Lösung, überprüfst, ob sie funktioniert hat, und meldest, falls es nicht funktioniert hat. Am Ende geht der Kunde entweder zufrieden oder nicht. Mit der Zeit werden Sie immer besser darin, zu erkennen, welche Abfolge von Schritten tendenziell zu einer guten Lösung führt.

Multi-turn RL trainiert das Modell auf die gleiche Weise. Anstatt das Modell anhand einer einzelnen Antwortvariablen zu bewerten, lässt es das Modell eine Aufgabe in mehreren Schritten abarbeiten und belohnt sie auf der Grundlage der gesamten Sequenz. Das Modell lernt, welche Entscheidungen zu Beginn des Gesprächs tatsächlich wichtig waren.

Wichtige Begriffe

  • Agent: Die Entscheidungsinstanz im System. Es beobachtet die aktuelle Situation, entscheidet, welche Maßnahmen zu ergreifen sind, und lernt im Laufe der Zeit, seine Strategie zu verbessern. In der Praxis wird der Agent von einem KI-Modell angetrieben, aber beide sind nicht dasselbe. Das Modell ist das zugrundeliegende neuronale Netzwerk; der Agent ist das umfassendere System, das es verwendet, um wahrzunehmen, zu entscheiden und zu handeln. Einfach ausgedrückt: der Kundendienstmitarbeiter, der das Ticket bearbeitet.

  • Environment/Agentic Anwendung: alles, mit dem der Agent interagiert, einschließlich des Gesprächsverlaufs, der Kontodaten des Kunden und aller Tools, die der Agent verwenden kann. Einfach ausgedrückt: Die Support-Plattform, der Kunde und alle Informationen, die dem Mitarbeiter zur Verfügung stehen.

  • Status: Eine Momentaufnahme der aktuellen Situation, die der Agent beobachtet, bevor er entscheidet, was als Nächstes zu tun ist. Einfach ausgedrückt: was der Mitarbeiter gerade weiß, z. B. das Problem des Kunden, was bereits versucht wurde und die letzte Antwort.

  • Aktion: was der Agent bei jedem Schritt tut, z. B. eine klärende Frage zu stellen, ein Tool aufzurufen oder eine Antwort zu senden. Einfach ausgedrückt: Der nächste Schritt des Vertriebsmitarbeiters, egal ob er eine Frage stellt, etwas nachschlägt oder eine Lösung sendet.

  • Belohnung: Das Feedback-Signal, das der Agent entweder bei jedem Schritt oder am Ende der Aufgabe erhält und angibt, wie gut die Dinge gelaufen sind. Einfach ausgedrückt: Ist der Kunde zufrieden gegangen? Dieses Ergebnis ist die Belohnung.

  • Richtlinie: Die Strategie, die der Agent gelernt hat. Sie ordnet einen bestimmten Zustand der Aktion zu, die am wahrscheinlichsten zu einem guten Ergebnis führt. Einfach ausgedrückt: Das Wissen des Vertriebsmitarbeiters basiert auf Erfahrung und weiß, was in einer bestimmten Situation am besten funktioniert.

  • Episode: Ein vollständiger Durchlauf einer Aufgabe von Anfang bis Ende. Einfach ausgedrückt: ein vollständiges Support-Gespräch, von der ersten Nachricht des Kunden bis zur Lösung.

  • Runde: ein einzelner Austausch innerhalb einer Episode, in der Regel eine Aktion des Agenten und die Reaktion, die er von der Umgebung erhält. In einer Konversation ist dies eine Nachricht und ihre Antwort. Einfach ausgedrückt: ein Schritt in der Support-Konversation, z. B. wenn der Agent eine Frage stellt und der Kunde antwortet.

  • Flugbahn: Die gesamte Abfolge von Zuständen, Aktionen und Belohnungen, die während einer gesamten Episode aufgezeichnet wurden. Es handelt sich um die vollständige Aufzeichnung dessen, was der Agent getan hat und was als Ergebnis passiert ist. Anhand dieser Aufzeichnung wird die Belohnung berechnet und die Richtlinie aktualisiert. Einfach ausgedrückt: Das gesamte Protokoll des Support-Gesprächs von Anfang bis Ende, einschließlich aller Entscheidungen, die der Agent getroffen hat, und wie sich die Dinge entwickelt haben.

  • Kumulative Belohnung: Die Gesamtbelohnung, die sich in allen Schritten einer Episode angesammelt hat und die der Agent letztendlich zu maximieren versucht. Einfach ausgedrückt: nicht nur, ob ein Schritt gut gelaufen ist, sondern ob das gesamte Gespräch insgesamt gut verlaufen ist.

Anwendungsfälle für mehrstufiges Reinforcement Learning

Multi-turn RL ist der richtige Ansatz, wenn eine einzige Antwort nicht ausreicht, um eine Aufgabe gut zu erledigen. Wenn Ihr Anwendungsfall eine Abfolge von Schritten umfasst, also Entscheidungen, die von früheren Schritten abhängen, ist Multi-Turn-RL eine Überlegung wert.

Hier sind einige Signale, die darauf hindeuten:

  • Ihre Aufgabe erfordert eine wechselseitige Interaktion: Das Modell muss Fragen stellen, Informationen sammeln und sich an das anpassen, was es dabei lernt. Ein einziger Prompt-Response-Zyklus reicht nicht aus. Beispiel: Ein Support-Mitarbeiter diagnostiziert ein Problem, indem er Folgefragen stellt, bevor er eine Lösung vorschlägt.

  • Die Qualität des Ergebnisses hängt von einer Abfolge von Aktionen ab: Um am Ende die richtige Antwort zu erhalten, müssen Sie durchweg die richtigen Schritte unternehmen. Nur das Endergebnis zu belohnen, reicht nicht aus, wenn es auf den Weg dorthin ankommt. Beispiel: Ein Programmierassistent, der Code in mehreren Schritten plant, schreibt, ausführt und debuggt.

  • Das Modell muss Tools in mehreren Schritten verwenden: Das Modell ruft externe Tools wie Suche, APIs oder Codeausführung auf, und die Ergebnisse eines Toolaufrufs beeinflussen, was als Nächstes ausgeführt wird. Beispiel: Ein wissenschaftlicher Mitarbeiter, der nach Informationen sucht, die Ergebnisse auswertet und seine Abfrage verfeinert, bevor er eine Zusammenfassung erstellt.

  • Fehler während einer Aufgabe sollten wiedergutzumachen sein: Sie möchten, dass das Modell erkennt, wenn etwas nicht funktioniert, und den Kurs korrigiert, anstatt sich von Anfang an auf einen schlechten Weg festzulegen. Beispiel: Ein Agent probiert eine Lösung aus, prüft, ob sie funktioniert hat, und versucht, falls nicht, einen anderen Ansatz.

  • Sie sehen eine gute Leistung in einem Zug, aber eine schlechte Komplettlösung der Aufgaben: Wenn Ihr Modell einzelne Schritte gut bewältigt, aber Schwierigkeiten hat, sie zu einem kohärenten, erfolgreichen Ergebnis zusammenzufügen, kann Multi-Turn-RL dazu beitragen, diese Lücke zu schließen.

Unterstützte Modelle, Preise und Regionen

Unterstützte Modelle

Modell Region
Nova Lite 2.0 IAD (US-Ost-1), PDX (US-West-2)
GPT-OSS-20B IAD (US-Ost-1), PDX (US-West-2)
Gemma-4-31B-it PDX (US-West-2)
Qwen 3.6 27 B PDX (US-West-2)

Preisgestaltung

Vollständige Preisinformationen finden Sie auf der Seite mit den öffentlichen Preisen. Die Gebühren basieren auf drei Dimensionen:

  • Prefill: Die Kosten für die Verarbeitung der Eingabe-Tokens, die zu Beginn jedes Trainingsschritts in das Modell eingegeben werden. Dazu gehören die Aufforderung, der Gesprächsverlauf und jeder Kontext, den das Modell erhält, bevor es eine Antwort generiert.

  • Beispiel: Die Kosten der Token, die das Modell während der Trainingseinführung generiert. Hier generiert das Modell seine Antworten, die dann ausgewertet und zur Berechnung des Belohnungssignals verwendet werden.

  • Zug: Die Kosten für den Rückwärtspass, bei dem die Gewichte des Modells auf der Grundlage des Belohnungssignals aktualisiert werden. Dies ist der zentrale Lernschritt im RL-Prozess.

Topics