Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Kustomisasi Amazon Nova pada SageMaker HyperPod
Anda dapat menyesuaikan model Amazon Nova, termasuk model Amazon Nova 2.0 yang disempurnakan, menggunakan resep Amazon Nova dan melatihnya di Hyperpod. Resep adalah file konfigurasi YAML yang memberikan detail kepada SageMaker AI tentang cara menjalankan pekerjaan kustomisasi model Anda. SageMaker HyperPod mendukung dua jenis layanan: Forge dan Non-forge.
Hyperpod menawarkan komputasi berkinerja tinggi dengan instans GPU yang dioptimalkan dan Amazon FSx untuk penyimpanan Lustre, pemantauan yang kuat melalui integrasi dengan alat seperti TensorBoard, manajemen pos pemeriksaan fleksibel untuk peningkatan berulang, penerapan mulus ke Amazon Bedrock untuk inferensi, dan pelatihan terdistribusi multi-node yang dapat diskalakan yang efisien - semuanya bekerja bersama untuk menyediakan organisasi dengan lingkungan yang aman, berkinerja, dan fleksibel untuk menyesuaikan model Amazon Nova dengan kebutuhan bisnis spesifik mereka.
Kustomisasi Amazon Nova pada SageMaker HyperPod menyimpan artefak model termasuk pos pemeriksaan model dalam bucket Amazon S3 yang dikelola layanan. Artefak dalam bucket yang dikelola layanan dienkripsi dengan SageMaker AI-managed AWS KMS kunci. Service-managed Bucket Amazon S3 saat ini tidak mendukung enkripsi data menggunakan kunci KMS yang dikelola pelanggan. Anda dapat menggunakan lokasi pos pemeriksaan ini untuk pekerjaan evaluasi atau inferensi Amazon Bedrock.
Harga standar dapat berlaku untuk instans komputasi, penyimpanan Amazon S3, dan FSx untuk Lustre. Untuk detail harga, lihat harga Hyperpod
Persyaratan komputasi untuk model Amazon Nova 2
Tabel berikut merangkum persyaratan komputasi SageMaker HyperPod dan pelatihan pekerjaan pelatihan SageMaker AI untuk model Amazon Nova 2.
Teknik Pelatihan |
Instans Minimum |
Tipe Instans |
Jumlah GPU |
Catatan |
Model yang Didukung |
|---|---|---|---|---|---|
SFT (LoRa) |
4 |
P5.48xlarge |
16 |
Parameter-efficient penyetelan halus |
Nova 2 Lite |
SFT (Peringkat Penuh) |
4 |
P5.48xlarge |
32 |
Penyetelan model lengkap |
Nova 2 Lite |
RFT pada Pekerjaan Pel SageMaker atihan (LoRa) |
2 |
P5.48xlarge |
16 |
Fungsi Hadiah Kustom di AWS Lingkungan Anda |
Nova 2 Lite |
RFT pada Pekerjaan Pel SageMaker atihan (Peringkat Penuh) |
4 |
P5.48xlarge |
32 |
Panjang konteks 32K |
Nova 2 Lite |
RFT aktif SageMaker HyperPod |
8 |
P5.48xlarge |
64 |
Panjang konteks default 8192 |
Nova 2 Lite |
CPT |
4 |
P5.48xlarge |
16 |
Memproses sekitar 400 juta token per instans per hari |
Nova 2 Lite |
Untuk mengoptimalkan alur kerja penyesuaian model Amazon Nova Anda di Hyperpod, ikuti praktik terbaik yang disarankan ini untuk pelatihan yang efisien, manajemen sumber daya, dan penerapan model yang sukses.
Praktik Terbaik untuk kustomisasi Amazon Nova
Gambaran umum
Bagian ini memberikan ikhtisar teknik penyesuaian dan membantu Anda memilih pendekatan terbaik untuk kebutuhan dan data yang tersedia.
Dua tahap pelatihan LLM
Pelatihan model bahasa besar terdiri dari dua tahap utama: pra-pelatihan dan pasca-pelatihan. Selama pra-pelatihan, model memproses token teks mentah dan mengoptimalkan untuk prediksi token berikutnya. Proses ini menciptakan pelengkapan pola yang menyerap sintaks, semantik, fakta, dan pola penalaran dari web dan teks yang dikuratori. Namun, model pra-terlatih tidak memahami instruksi, tujuan pengguna, atau perilaku yang sesuai dengan konteks. Ini melanjutkan teks dalam gaya apa pun yang sesuai dengan distribusi pelatihannya. Model pra-terlatih melengkapi otomatis alih-alih mengikuti petunjuk, menghasilkan pemformatan yang tidak konsisten, dan dapat mencerminkan bias yang tidak diinginkan atau konten yang tidak aman dari data pelatihan. Pre-training membangun kompetensi umum, bukan kegunaan tugas.
Post-training mengubah pelengkap pola menjadi asisten yang berguna. Anda menjalankan beberapa putaran Supervisor Fine-Tuning (SFT) untuk mengajarkan model mengikuti instruksi, mematuhi skema dan kebijakan, memanggil alat, dan menghasilkan output yang andal dengan meniru demonstrasi berkualitas tinggi. Penjajaran ini mengajarkan model untuk menanggapi permintaan sebagai tugas daripada teks untuk melanjutkan. Anda kemudian menerapkan Penguatan Fine-Tuning (RFT) untuk mengoptimalkan perilaku menggunakan umpan balik yang terukur (seperti verifikasi atau LLM-as-a-judge), menyeimbangkan pertukaran seperti akurasi versus singkatnya, keamanan versus cakupan, atau penalaran multi-langkah di bawah kendala. Dalam praktiknya, Anda mengganti SFT dan RFT dalam siklus untuk membentuk model yang telah dilatih sebelumnya menjadi sistem yang andal dan selaras dengan kebijakan yang melakukan tugas-tugas kompleks secara konsisten.
Pilih pendekatan kustomisasi yang tepat
Pada bagian ini kita akan membahas strategi penyesuaian pasca pelatihan: RFT dan SFT.
Penyetelan halus penguatan (RFT)
Penyetelan penguatan meningkatkan kinerja model melalui sinyal umpan baliknya — skor terukur atau penghargaan yang menunjukkan kualitas respons — daripada pengawasan langsung dengan jawaban yang tepat. Tidak seperti penyempurnaan tradisional yang diawasi yang belajar dari pasangan input-output, RFT menggunakan fungsi hadiah untuk mengevaluasi respons model dan secara berulang mengoptimalkan model untuk memaksimalkan imbalan ini. Pendekatan ini bekerja dengan baik untuk tugas-tugas di mana mendefinisikan output yang tepat yang tepat menantang, tetapi Anda dapat mengukur kualitas respons dengan andal. RFT memungkinkan model untuk mempelajari perilaku dan preferensi yang kompleks melalui uji coba dan umpan balik, menjadikannya ideal untuk aplikasi yang memerlukan pengambilan keputusan bernuansa, pemecahan masalah kreatif, atau kepatuhan terhadap kriteria kualitas tertentu yang dapat Anda evaluasi secara terprogram. Misalnya, menjawab pertanyaan hukum yang kompleks adalah kasus penggunaan yang ideal untuk RFT karena Anda ingin mengajarkan model cara bernalar lebih baik untuk menjawab pertanyaan dengan lebih akurat.
Cara kerjanya
Dalam penyempurnaan penguatan, Anda mulai dari garis dasar yang disetel instruksi dan memperlakukan setiap prompt seperti turnamen kecil. Untuk masukan yang diberikan, Anda mengambil sampel beberapa jawaban kandidat dari model, menilai masing-masing dengan fungsi hadiah, lalu memberi peringkat mereka dalam grup itu. Langkah pembaruan mendorong model untuk membuat kandidat dengan skor lebih tinggi lebih mungkin di lain waktu dan kandidat dengan skor lebih rendah lebih kecil kemungkinannya, sementara batasan tetap dekat dengan garis dasar mencegah perilaku melayang atau menjadi bertele-tele atau eksploitatif. Anda mengulangi loop ini melalui banyak petunjuk, menyegarkan kasus sulit, memperketat verifikasi atau rubrik penilaian saat Anda melihat eksploitasi, dan terus melacak metrik tugas.
Kapan menggunakan RFT
Tugas yang paling diuntungkan dari RFT berbagi beberapa sifat. Mereka memiliki sinyal keberhasilan yang terukur bahkan ketika satu output yang benar sulit untuk ditentukan. Mereka mengakui kredit paruh atau kualitas berperingkat sehingga Anda dapat memberi peringkat yang lebih baik dibandingkan jawaban yang lebih buruk dalam prompt atau menggunakan fungsi hadiah. Mereka melibatkan beberapa tujuan yang harus seimbang (seperti akurasi dengan singkatnya, kejelasan, keamanan, atau biaya). Mereka membutuhkan kepatuhan terhadap batasan eksplisit yang dapat Anda periksa secara terprogram. Mereka beroperasi dalam pengaturan berbasis alat atau berbasis lingkungan di mana hasil dapat diamati (sukses atau gagal, latensi, penggunaan sumber daya). Mereka terjadi dalam rezim label rendah di mana mengumpulkan target emas mahal tetapi umpan balik otomatis atau berbasis rubrik berlimpah. RFT bekerja paling baik ketika Anda dapat mengubah kualitas menjadi skalar atau peringkat yang andal dan ingin model secara istimewa memperkuat perilaku skor lebih tinggi tanpa memerlukan target berlabel yang lengkap.
Pertimbangkan metode lain ketika:
-
Anda memiliki pasangan input-output berlabel yang berlimpah dan andal - Gunakan SFT
-
Kesenjangan utama adalah pengetahuan atau jargon — Gunakan generasi yang diperbesar (RAG)
-
Sinyal hadiah Anda berisik atau tidak dapat diandalkan dan Anda tidak dapat memperbaikinya dengan rubrik atau catur yang lebih baik - Stabilkan terlebih dahulu sebelum RFT
Kapan tidak menggunakan RFT
Hindari RFT dalam situasi ini:
-
Anda dapat dengan murah menghasilkan pasangan input-output berlabel yang andal (SFT lebih sederhana, lebih murah, dan lebih stabil)
-
Kesenjangan adalah pengetahuan atau jargon daripada perilaku (gunakan RAG)
-
Sinyal hadiah Anda berisik, jarang, mudah dimainkan, atau mahal atau lambat untuk dihitung (perbaiki evaluator terlebih dahulu)
-
Kinerja dasar hampir nol (bootstrap dengan SFT sebelum mengoptimalkan preferensi)
-
Tugas memiliki skema deterministik, pemformatan yang ketat, atau satu jawaban yang benar (SFT atau validasi berbasis aturan berfungsi lebih baik)
-
Latensi ketat atau anggaran biaya tidak dapat menyerap pengambilan sampel atau eksplorasi tambahan yang dibutuhkan RFT
-
Kendala keamanan atau kebijakan tidak ditentukan secara jelas dan dapat ditegakkan dalam hadiah
Jika Anda dapat menunjuk ke “jawaban yang benar,” gunakan SFT. Jika Anda membutuhkan pengetahuan baru, gunakan RAG. Gunakan RFT hanya setelah Anda memiliki dasar yang solid dan fungsi hadiah yang kuat, cepat, dan sulit dieksploitasi.
Penyetelan halus yang diawasi (SFT)
Penyetelan halus yang diawasi melatih LLM pada kumpulan data pasangan input-output berlabel manusia untuk tugas Anda. Anda memberikan contoh petunjuk (pertanyaan, instruksi, dan sebagainya) dengan tanggapan yang benar atau diinginkan, dan terus melatih model pada contoh-contoh ini. Model menyesuaikan bobotnya untuk meminimalkan kerugian yang diawasi (biasanya entropi silang antara prediksi dan token keluaran target). Ini adalah pelatihan yang sama yang digunakan dalam sebagian besar tugas pembelajaran mesin yang diawasi, diterapkan untuk mengkhususkan LLM.
SFT mengubah perilaku, bukan pengetahuan. Itu tidak mengajarkan model fakta baru atau jargon yang tidak dilihatnya dalam pra-pelatihan. Ini mengajarkan model bagaimana menjawab, bukan apa yang harus diketahui. Jika Anda memerlukan pengetahuan domain baru (seperti terminologi internal), gunakan retrieval-augmented generation (RAG) untuk memberikan konteks itu pada waktu inferensi. SFT kemudian menambahkan perilaku mengikuti instruksi yang diinginkan di atas.
Cara kerjanya
SFT mengoptimalkan LLM dengan meminimalkan kerugian cross-entropi rata-rata pada token respons, memperlakukan token prompt sebagai konteks dan menutupinya dari kerugian. Model menginternalisasi gaya target, struktur, dan aturan keputusan Anda, belajar menghasilkan penyelesaian yang benar untuk setiap prompt. Misalnya, untuk mengklasifikasikan dokumen ke dalam kategori khusus, Anda menyempurnakan model dengan prompt (teks dokumen) dan penyelesaian berlabel (label kategori). Anda melatih pasangan tersebut sampai model mengeluarkan label yang tepat untuk setiap prompt dengan probabilitas tinggi.
Anda dapat melakukan SFT hanya dengan beberapa ratus contoh dan meningkatkan hingga beberapa ratus ribu. Sampel SFT harus berkualitas tinggi dan langsung selaras dengan perilaku model yang diinginkan.
Kapan menggunakan SFT
Gunakan SFT ketika Anda memiliki tugas yang terdefinisi dengan baik dengan output yang diinginkan yang jelas. Jika Anda dapat secara eksplisit menyatakan “Diberikan input X, output yang benar adalah Y” dan mengumpulkan contoh pemetaan tersebut, penyempurnaan yang diawasi adalah pilihan yang baik. SFT unggul dalam skenario ini:
-
Tugas klasifikasi terstruktur atau kompleks — Klasifikasikan dokumen internal atau kontrak ke dalam banyak kategori khusus. Dengan SFT, model mempelajari kategori spesifik ini lebih baik daripada meminta saja.
-
Question-answering atau tugas transformasi dengan jawaban Fine-tune yang diketahui — model untuk menjawab pertanyaan dari basis pengetahuan perusahaan, atau mengonversi data antar format di mana setiap input memiliki respons yang benar.
-
Konsistensi pemformatan dan gaya — Latih model untuk selalu merespons dalam format atau nada tertentu dengan menyempurnakan contoh format atau nada yang benar. Misalnya, pelatihan pada pasangan prompt-response yang menunjukkan suara merek tertentu mengajarkan model untuk menghasilkan output dengan gaya itu. Instruction-following perilaku awalnya sering diajarkan melalui SFT pada contoh yang dikuratori dari perilaku asisten yang baik.
SFT adalah cara paling langsung untuk mengajarkan LLM keterampilan atau perilaku baru ketika Anda dapat menentukan seperti apa perilaku yang tepat. Ini menggunakan pemahaman bahasa model yang ada dan memfokuskannya pada tugas Anda. Gunakan SFT ketika Anda ingin model melakukan hal tertentu dan Anda memiliki atau dapat membuat dataset contoh.
Gunakan SFT saat Anda dapat merakit pasangan prompt dan respons berkualitas tinggi yang mencerminkan perilaku yang Anda inginkan. Ini cocok dengan tugas dengan target yang jelas atau format deterministik seperti skema, fungsi atau panggilan alat, dan jawaban terstruktur di mana imitasi adalah sinyal pelatihan yang sesuai. Tujuannya adalah pembentukan perilaku: mengajarkan model untuk memperlakukan petunjuk sebagai tugas, mengikuti instruksi, mengadopsi kebijakan nada dan penolakan, dan menghasilkan pemformatan yang konsisten. Rencanakan setidaknya ratusan demonstrasi, dengan kualitas data, konsistensi, dan deduplikasi lebih penting daripada volume mentah. Untuk pembaruan yang mudah dan hemat biaya, gunakan metode hemat parameter seperti Low-Rank Adaptasi untuk melatih adaptor kecil sambil membiarkan sebagian besar tulang punggung tidak tersentuh.
Kapan tidak menggunakan SFT
Jangan gunakan SFT ketika kesenjangan adalah pengetahuan daripada perilaku. Itu tidak mengajarkan model fakta baru, jargon, atau peristiwa baru-baru ini. Dalam kasus tersebut, gunakan generasi penambahan pengambilan untuk membawa pengetahuan eksternal pada kesimpulan. Hindari SFT ketika Anda dapat mengukur kualitas tetapi tidak dapat memberi label satu jawaban yang benar. Gunakan penyempurnaan penguatan dengan hadiah yang dapat diverifikasi atau LLM-as-a-judge untuk mengoptimalkan hadiah tersebut secara langsung. Jika kebutuhan atau konten Anda sering berubah, andalkan pengambilan dan penggunaan alat daripada melatih ulang model.