Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Penyetelan halus penguatan (RFT)
Penguatan Fine-Tuning (RFT) adalah teknik yang meningkatkan kinerja model melalui sinyal umpan balik — skor terukur atau penghargaan yang menunjukkan kualitas respons — daripada pengawasan langsung dengan jawaban yang tepat. Tidak seperti SFT yang belajar dari pasangan input-output, RFT menggunakan fungsi hadiah untuk mengevaluasi respons model dan secara berulang mengoptimalkan model untuk memaksimalkan imbalan ini. RFT mendukung pelatihan single-turn dan multi-turn:
-
Single-turn RFT: Model menghasilkan respons tunggal terhadap prompt, dan fungsi hadiah menilai respons itu. Terbaik untuk tugas dengan metrik kualitas per respons yang jelas seperti matematika, pembuatan kode, dan penalaran terstruktur.
-
Multi-turn RFT: Model terlibat dalam interaksi multi-langkah (misalnya, alur kerja agen dengan penggunaan alat), dan fungsi hadiah mengevaluasi lintasan keseluruhan. Terbaik untuk tugas-tugas kompleks yang membutuhkan pengambilan keputusan berurutan, seperti pemecahan masalah multi-langkah, orkestrasi alat, dan agen percakapan.
Kapan menggunakan RFT
Gunakan RFT ketika Anda dapat menentukan kriteria keberhasilan yang jelas dan terukur tetapi berjuang untuk memberikan output yang tepat untuk pelatihan. RFT sangat ideal ketika:
-
Anda memiliki fungsi hadiah yang andal yang dapat mengevaluasi keluaran model secara terprogram
-
Anda perlu menyelaraskan perilaku model dengan preferensi atau batasan tertentu
-
Mengumpulkan contoh berlabel berkualitas tinggi itu mahal atau tidak praktis
-
Ada beberapa solusi yang valid tetapi beberapa jelas lebih baik daripada yang lain (penulisan kreatif, pengoptimalan kode, penalaran kompleks)
RFT unggul dalam domain di mana kualitas output dapat diukur secara objektif: pemecahan masalah matematika, pembuatan kode, penalaran ilmiah, analisis data terstruktur, penalaran multi-langkah, penggunaan alat, dan alur kerja kompleks dengan kendala tertentu.
Model yang didukung
Single-turn dan RFT multi-turn tersedia untuk model Amazon Nova berikut:
-
Nova 2.0 (Lite)
Kapan menggunakan Single-turn RFT vs Multi-turn RFT
Pilih Single-turn RFT ketika tugas adalah pertukaran satu kali: model menerima prompt dan menghasilkan respons tunggal yang dapat dinilai sendiri, tanpa panggilan alat perantara atau status lingkungan untuk dilacak. Ini sesuai dengan kasus penggunaan seperti klasifikasi, ekstraksi, Tanya Jawab khusus domain, ringkasan, moderasi konten, atau tugas apa pun dengan jawaban yang dapat diverifikasi (kecocokan tepat, F1, validasi skema, berbasis aturan atau LLM-judge cek pada output akhir). Ini lebih sederhana, lebih murah, dan lebih cepat untuk dijalankan, karena setiap peluncuran adalah satu generasi dan hadiahnya dihitung sekali di akhir.
Pilih Multi-turn RFT ketika tugas mengharuskan model untuk bertindak sebagai agen selama beberapa langkah - memanggil alat, membaca dan mengubah keadaan, dan beradaptasi dengan apa yang kembali - sebelum hasilnya dapat dinilai. Ini sesuai dengan alur kerja agen seperti urutan penggunaan alat, pemecahan masalah multi-langkah, asisten percakapan, atau tugas apa pun di mana keberhasilan bergantung pada lintasan (urutan dan kebenaran tindakan di seluruh belokan), bukan hanya jawaban akhir.
Aturan praktis: jika tugas Anda dapat dinilai dari output model tunggal tanpa panggilan alat atau status yang berkembang, gunakan Single-turn RFT; jika keberhasilan tergantung pada urutan tindakan terhadap alat atau lingkungan stateful, gunakan Multi-turn RFT.
Kapan menggunakan Nova 1.0 versus Nova 2.0
RFT hanya tersedia di Nova 2.0 Lite. Untuk model Nova 1.0, gunakan Direct Preference Optimization (DPO) atau Proximal Policy Optimization (PPO) sebagai teknik penyelarasan alternatif.
Mode penalaran
Amazon Nova 2.0 mendukung mode penalaran selama pelatihan RFT. Mode berikut tersedia:
-
none: Tidak ada alasan (hilangkan bidang resoning_efort)
-
rendah: Overhead penalaran minimal
-
tinggi: Kemampuan penalaran maksimum (default saat resoning_efort ditentukan)
catatan
Tidak ada opsi medium untuk RFT. Jika bidang resoning_efort tidak ada dalam konfigurasi Anda, penalaran dinonaktifkan.