View a markdown version of this page

Multi-turn pembelajaran penguatan - Amazon SageMaker AI

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Multi-turn pembelajaran penguatan

Multi-turn pembelajaran penguatan (RL) melatih agen untuk membuat keputusan yang baik di seluruh urutan langkah, tidak hanya dalam satu momen. Agen mengamati lingkungannya, mengambil tindakan, menerima hadiah, dan pindah ke keadaan baru, mengulangi proses ini selama banyak langkah waktu. Tujuannya adalah untuk mempelajari kebijakan (perilaku model) yang memaksimalkan imbalan kumulatif di seluruh urutan daripada mengoptimalkan untuk satu langkah dalam isolasi. Pendekatan ini semakin banyak digunakan untuk melatih model bahasa pada penalaran multi-langkah dan tugas agen, di mana model mengambil tindakan seperti panggilan alat, eksekusi kode, atau pencarian web di beberapa putaran dan dihargai berdasarkan keseluruhan urutan. Ini berbeda dari putaran tunggal RLHF/RLAIF, di mana hadiah diberikan ke satu output pada satu waktu.

Analogi sederhana

Bayangkan Anda adalah agen layanan pelanggan yang menangani tiket dukungan. Anda tidak menyelesaikannya dalam satu pesan. Anda mengajukan pertanyaan klarifikasi, mencari akun pelanggan, mencoba perbaikan, memeriksa apakah berhasil, dan menindaklanjuti jika tidak. Pada akhirnya, pelanggan pergi puas atau tidak. Seiring waktu, Anda menjadi lebih baik dalam mengenali urutan langkah mana yang cenderung mengarah pada resolusi yang baik.

Multi-turn RL melatih model dengan cara yang sama. Alih-alih menilai model pada satu respons, model ini memungkinkan model bekerja melalui tugas di beberapa langkah dan memberikannya penghargaan berdasarkan keseluruhan urutan. Model mempelajari keputusan mana sebelumnya dalam percakapan yang sebenarnya penting.

Terminologi kunci

  • A gen: entitas pengambilan keputusan dalam sistem. Ini mengamati situasi saat ini, memutuskan tindakan apa yang harus diambil, dan belajar dari waktu ke waktu untuk meningkatkan strateginya. Dalam praktiknya, agen didukung oleh model AI, tetapi keduanya bukan hal yang sama. Model adalah jaringan saraf yang mendasarinya; agen adalah sistem yang lebih luas yang menggunakannya untuk memahami, memutuskan, dan bertindak. Secara sederhana: perwakilan layanan pelanggan menangani tiket.

  • Environment/Agentic Aplikasi: semua yang berinteraksi dengan agen, termasuk riwayat percakapan, detail akun pelanggan, dan alat apa pun yang dapat digunakan agen. Secara sederhana: platform dukungan, pelanggan, dan semua informasi yang tersedia untuk perwakilan.

  • Status: gambaran situasi saat ini yang diamati agen sebelum memutuskan apa yang harus dilakukan selanjutnya. Secara sederhana: apa yang diketahui perwakilan saat ini, seperti masalah pelanggan, apa yang telah dicoba, dan balasan terbaru.

  • Tind akan: apa yang dilakukan agen pada setiap langkah, seperti mengajukan pertanyaan klarifikasi, memanggil alat, atau mengirim tanggapan. Secara sederhana: langkah perwakilan berikutnya, apakah itu mengajukan pertanyaan, mencari sesuatu, atau mengirim perbaikan.

  • Hadiah: sinyal umpan balik yang diterima agen, baik pada setiap langkah atau di akhir tugas, menunjukkan seberapa baik semuanya berjalan. Secara sederhana: apakah pelanggan pergi puas? Hasilnya adalah pahala.

  • Kebijakan: strategi yang telah dipelajari agen. Ini memetakan keadaan tertentu ke tindakan yang paling mungkin mengarah pada hasil yang baik. Secara sederhana: pengetahuan perwakilan dibangun dari pengalaman, mengetahui apa yang cenderung bekerja dalam situasi tertentu.

  • Episode: satu putaran tugas lengkap dari awal hingga akhir. Secara sederhana: satu percakapan dukungan penuh, dari pesan pertama pelanggan hingga resolusi.

  • Putaran: pertukaran tunggal dalam satu episode, biasanya satu tindakan yang diambil oleh agen dan respons yang diterimanya dari lingkungan. Dalam percakapan, ini adalah satu pesan dan jawabannya. Secara sederhana: satu langkah dalam percakapan dukungan, seperti agen mengajukan pertanyaan dan pelanggan merespons.

  • Lintas an: urutan lengkap status, tindakan, dan hadiah yang direkam di seluruh episode. Ini adalah catatan lengkap tentang apa yang dilakukan agen dan apa yang terjadi sebagai hasilnya, digunakan untuk menghitung hadiah dan memperbarui kebijakan. Secara sederhana: seluruh transkrip percakapan dukungan dari awal hingga akhir, termasuk setiap keputusan yang dibuat agen dan bagaimana hal-hal terjadi.

  • Hadiah kumulatif: total hadiah yang terakumulasi di semua langkah dalam satu episode, yang pada akhirnya coba maksimalkan oleh agen. Secara sederhana: bukan hanya apakah satu langkah berjalan dengan baik, tetapi apakah seluruh percakapan berjalan dengan baik secara keseluruhan.

Gunakan kasus untuk pembelajaran penguatan multi-putaran

Multi-turn RL adalah pendekatan yang tepat ketika satu respons tidak cukup untuk menyelesaikan tugas dengan baik. Jika kasus penggunaan Anda melibatkan urutan langkah, keputusan yang bergantung pada yang sebelumnya, RL multi-turn layak dipertimbangkan.

Berikut adalah beberapa sinyal yang mengarah ke sana:

  • Tugas Anda membutuhkan interaksi bolak-balik: Model perlu mengajukan pertanyaan, mengumpulkan informasi, dan beradaptasi berdasarkan apa yang dipelajarinya di sepanjang jalan. Satu siklus prompt-response saja tidak cukup. Contoh: agen dukungan yang mendiagnosis masalah dengan mengajukan pertanyaan lanjutan sebelum menyarankan perbaikan.

  • Kualitas hasil tergantung pada urutan tindakan: Mendap atkan jawaban yang benar di akhir membutuhkan membuat gerakan yang benar sepanjang jalan. Menghargai hanya hasil akhir saja tidak cukup jika jalan untuk sampai ke sana penting. Contoh: asisten pengkodean yang merencanakan, menulis, menjalankan, dan men-debug kode di beberapa langkah.

  • Model perlu menggunakan alat di beberapa langkah: Model memang gil alat eksternal seperti pencarian, API, atau eksekusi kode, dan hasil dari satu panggilan alat memengaruhi apa yang dilakukannya selanjutnya. Contoh: asisten peneliti yang mencari informasi, mengevaluasi hasil, dan menyempurnakan kuerinya sebelum menghasilkan ringkasan.

  • Kesalahan di tengah tugas harus dapat dipuli hkan: Anda ingin model mengenali ketika sesuatu tidak berfungsi dan benar, daripada berkomitmen pada jalur yang buruk sejak awal. Contoh: agen yang mencoba solusi, memeriksa apakah berhasil, dan mencoba pendekatan yang berbeda jika tidak.

  • Anda melihat kinerja satu putaran yang baik tetapi penyelesaian tugas ujung ke ujung yang buruk: Jika model Anda menangani langkah-langkah individu dengan baik tetapi berjuang untuk merangkainya menjadi hasil yang koheren dan sukses, RL multi-putaran dapat membantu menjembatani kesenjangan itu.

Model, harga, dan wilayah yang didukung

Model yang didukung

Model Region
Nova Lite 2.0 IAD (us-timur-1), PDX (us-barat-2)
GPT-OSS-20B IAD (us-timur-1), PDX (us-barat-2)
Gemma-4-31B-it PDX (us-barat-2)
Qwen 3.6 27B PDX (us-barat-2)

Harga

Untuk detail harga lengkap, lihat halaman harga publik. Biaya didasarkan pada tiga dimensi:

  • Prefill: biaya pemrosesan token input yang dimasukkan ke dalam model pada awal setiap langkah pelatihan. Ini termasuk prompt, riwayat percakapan, dan konteks apa pun yang diterima model sebelum menghasilkan respons.

  • Contoh: biaya token yang dihasilkan model selama peluncuran pelatihan. Di sinilah model menghasilkan responsnya, yang kemudian dievaluasi dan digunakan untuk menghitung sinyal hadiah.

  • Ker eta: biaya pass mundur, di mana bobot model diperbarui berdasarkan sinyal hadiah. Ini adalah langkah pembelajaran inti dalam proses RL.

Topik