Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Model pondasi dan hyperparameter untuk penyempurnaan
Model pondasi mahal secara komputasi dan dilatih pada korpus besar yang tidak berlabel. Fine-tuning model dasar pra-terlatih adalah cara yang terjangkau untuk memanfaatkan kemampuan luas mereka sambil menyesuaikan model pada korpus kecil Anda sendiri. Fine-tuning adalah metode penyesuaian yang melibatkan pelatihan lebih lanjut dan mengubah bobot model Anda.
Fine-tuning mungkin berguna bagi Anda jika Anda membutuhkan:
-
untuk menyesuaikan model Anda dengan kebutuhan bisnis tertentu
-
model Anda untuk berhasil bekerja dengan bahasa khusus domain, seperti jargon industri, istilah teknis, atau kosakata khusus lainnya
-
peningkatan kinerja untuk tugas-tugas tertentu
-
respons yang akurat, relatif, dan sadar konteks dalam aplikasi
-
tanggapan yang lebih faktual, kurang beracun, dan lebih selaras dengan persyaratan tertentu
Ada dua pendekatan utama yang dapat Anda ambil untuk menyempurnakan tergantung pada kasus penggunaan Anda dan model pondasi yang dipilih.
-
Jika Anda tertarik untuk menyempurnakan model Anda pada data khusus domain, lihat. Fine-tune model bahasa besar (LLM) menggunakan adaptasi domain
-
Jika Anda tertarik dengan penyempurnaan berbasis instruksi menggunakan contoh prompt dan respons, lihat. Fine-tune model bahasa besar (LLM) menggunakan instruksi yang cepat
Model pondasi tersedia untuk penyempurnaan
Anda dapat menyempurnakan salah satu model JumpStart pondasi berikut:
-
Mekar 3B
-
Mekar 7B1
-
BloomZ 3B FP16
-
BloomZ 7B1 FP16
-
Kode Lama 13B
-
Kode Lama 13B Python
-
Kode Lama 34B
-
Kode Lama 34B Python
-
Kode Llama 70B
-
Kode Llama 70B Python
-
Kode Lama 7B
-
Kode Llama 7B Python
-
CyberAgentLM2-7B-Chat (CALM2-7B-Chat)
-
Falcon 40B BF16
-
Falcon 40B Menginstruksikan BF16
-
Falcon 7B BF16
-
Falcon 7B Menginstruksikan BF16
-
Flan-T5 Basis
-
Flan-T5 Besar
-
Flan-T5 Kecil
-
Flan-T5 XL
-
Flan-T5 XXL
-
Permata 2B
-
Gemma 2B Instruksi
-
Gemma 7B
-
Gemma 7B Instruksi
-
GPT-2 XL
-
GPT-J 6B
-
GPT-Neo 1,3B
-
GPT-Neo 125M
-
GPT-NEO 2,7B
-
LightGPT Instruksi 6B
-
Lama 2 13B
-
Llama 2 13B Chat
-
Llama 2 13B Neuron
-
Lama 2 70B
-
Llama 2 70B Chat
-
Lama 2 7B
-
Llama 2 7B Chat
-
Llama 2 7B Neuron
-
Mistral 7B
-
Mixtral 8x7B
-
Mixtral 8x7B Instruksi
-
RedPajama INCITE Basis 3B V1
-
RedPajama INCITE Basis 7B V1
-
RedPajama INCITE Chat 3B V1
-
RedPajama INCITE Chat 7B V1
-
RedPajama INCITE Instruksi 3B V1
-
RedPajama INCITE Instruksi 7B V1
-
Difusi Stabil 2.1
Hiperparameter fine tuning yang umumnya didukung
Model pondasi yang berbeda mendukung hyperparameter yang berbeda saat menyempurnakan. Berikut ini adalah hyperparameter yang didukung secara umum yang dapat menyesuaikan model Anda lebih lanjut selama pelatihan:
| Parameter Inferensi | Deskripsi |
|---|---|
|
Jumlah lintasan yang diambil model melalui kumpulan data penyempurnaan selama pelatihan. Harus bilangan bulat lebih besar dari 1. |
|
Tingkat pembaruan bobot model setelah mengerjakan setiap batch contoh pelatihan penyempurnaan. Harus float positif lebih besar dari 0. |
|
Apakah akan menginstruksi-melatih model atau tidak. Harus |
|
Ukuran batch per inti GPU atau CPU untuk pelatihan. Harus berupa bilangan bulat positif. |
|
Ukuran batch per inti GPU atau CPU untuk evaluasi. Harus berupa bilangan bulat positif. |
|
Untuk tujuan debugging atau pelatihan yang lebih cepat, potong jumlah contoh pelatihan ke nilai ini. Nilai -1 berarti bahwa model menggunakan semua sampel pelatihan. Harus berupa bilangan bulat positif atau -1. |
|
Untuk tujuan debugging atau pelatihan yang lebih cepat, potong jumlah contoh validasi ke nilai ini. Nilai -1 berarti bahwa model menggunakan semua sampel validasi. Harus berupa bilangan bulat positif atau -1. |
|
Panjang urutan input total maksimum setelah tokenisasi. Urutan yang lebih panjang dari ini akan terpotong. Jika -1, |
|
Jika tidak ada saluran validasi, rasio validasi kereta terpisah dari data pelatihan. Harus antara 0 dan 1. |
|
Jika data validasi tidak ada, ini memperbaiki pemisahan acak data pelatihan input ke data pelatihan dan validasi yang digunakan oleh model. Harus berupa bilangan bulat. |
|
Jumlah proses yang digunakan untuk pra-pemrosesan. Jika |
|
Low-rank nilai adaptasi (LoRa) r, yang bertindak sebagai faktor penskalaan untuk pembaruan berat. Harus berupa bilangan bulat positif. |
|
Low-rank nilai alfa adaptasi (LoRa), yang bertindak sebagai faktor penskalaan untuk pembaruan berat. Umumnya 2 hingga 4 kali ukuran |
|
Nilai putus untuk lapisan adaptasi peringkat rendah (LoRa) Harus mengambang positif antara 0 dan 1. |
|
Jika |
|
Jika |
Anda dapat menentukan nilai hyperparameter saat menyempurnakan model Anda di Studio. Untuk informasi selengkapnya, lihat Fine-tune model di Studio.
Anda juga dapat mengganti nilai hyperparameter default saat menyempurnakan model Anda menggunakan SDK. SageMaker Python Untuk informasi selengkapnya, lihat Fine-tune model pondasi yang tersedia untuk umum dengan JumpStartEstimator kelas.