View a markdown version of this page

Model bahasa besar yang didukung untuk penyempurnaan - Amazon SageMaker AI

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Model bahasa besar yang didukung untuk penyempurnaan

Menggunakan API Autopilot, pengguna dapat menyempurnakan model bahasa besar (LLM) yang didukung oleh Amazon. SageMaker JumpStart

catatan

Untuk model penyempurnaan yang memerlukan penerimaan perjanjian lisensi pengguna akhir, Anda harus secara eksplisit menyatakan penerimaan EULA saat membuat pekerjaan AutoML Anda. Perhatikan bahwa setelah menyempurnakan model yang telah dilatih sebelumnya, bobot model asli diubah, jadi Anda tidak perlu menerima EULA nanti saat menerapkan model yang disetel dengan baik.

Untuk informasi tentang cara menerima EULA saat membuat pekerjaan penyempurnaan menggunakan API AutoML, lihat. Cara mengatur penerimaan EULA saat menyempurnakan model menggunakan API AutoML

Anda dapat menemukan detail lengkap dari setiap model dengan mencari ID JumpStart Model Anda di tabel model berikut, dan kemudian mengikuti tautan di kolom Sumber. Rincian ini mungkin termasuk bahasa yang didukung oleh model, bias yang mungkin ditunjukkan, kumpulan data yang digunakan untuk penyempurnaan, dan banyak lagi.

Tabel berikut mencantumkan JumpStart model yang didukung yang dapat Anda sesuaikan dengan pekerjaan AutoML.

JumpStart Model ID BaseModelNamedalam permintaan API Deskripsi
huggingface-textgeneration-dolly-v2-3b-bf16 Dolly3B

Dolly 3B adalah model bahasa besar yang mengikuti instruksi parameter 2,8 miliar berdasarkan pythia-2.8b. https://huggingface.co/EleutherAI/pythia-2.8b#pythia-28b Ini dilatih pada dataset instruction/response fine tuning databricks-dolly-15k dan dapat melakukan tugas-tugas termasuk brainstorming, klasifikasi, pertanyaan dan jawaban, pembuatan teks, ekstraksi informasi, dan ringkasan.

huggingface-textgeneration-dolly-v2-7b-bf16 Dolly7B

Dolly 7B adalah model bahasa besar mengikuti instruksi parameter 6,9 miliar berdasarkan pythia-6.9b. https://huggingface.co/EleutherAI/pythia-6.9b Ini dilatih pada dataset instruction/response fine tuning databricks-dolly-15k dan dapat melakukan tugas-tugas termasuk brainstorming, klasifikasi, pertanyaan dan jawaban, pembuatan teks, ekstraksi informasi, dan ringkasan.

huggingface-textgeneration-dolly-v2-12b-bf16 Dolly12B

Dolly 12B adalah model bahasa besar yang mengikuti instruksi parameter 12 miliar berdasarkan pythia-12b. https://huggingface.co/EleutherAI/pythia-12b Ini dilatih pada dataset instruction/response fine tuning databricks-dolly-15k dan dapat melakukan tugas-tugas termasuk brainstorming, klasifikasi, pertanyaan dan jawaban, pembuatan teks, ekstraksi informasi, dan ringkasan.

huggingface-llm-falcon-7b-bf16 Falcon7B

Falcon 7B adalah model bahasa besar kausal 7 miliar parameter yang dilatih pada 1.500 miliar token yang ditingkatkan dengan korpus yang dikuratori. Falcon-7B dilatih pada data bahasa Inggris dan Prancis saja, dan tidak menggeneralisasi dengan tepat ke bahasa lain. Karena model ini dilatih pada sejumlah besar data web, ia membawa stereotip dan bias yang biasa ditemukan secara online.

huggingface-llm-falcon-7b-instruct-bf16 Falcon7BInstruct

Falcon 7B Instruct adalah model bahasa besar kausal 7 miliar parameter yang dibangun di atas Falcon 7B dan disesuaikan pada campuran set data 250 juta token. chat/instruct Falcon 7B Instruct sebagian besar dilatih pada data bahasa Inggris, dan tidak menggeneralisasi dengan tepat ke bahasa lain. Selain itu, karena dilatih pada korpora skala besar yang mewakili web, ia membawa stereotip dan bias yang biasa ditemui secara online.

huggingface-llm-falcon-40b-bf16 Falcon40B

Falcon 40B adalah model bahasa besar kausal 40 miliar parameter yang dilatih pada 1.000 miliar token yang ditingkatkan dengan korpus yang dikuratori. Ini dilatih sebagian besar dalam bahasa Inggris, Jerman, Spanyol, dan Prancis, dengan kemampuan terbatas dalam bahasa Italia, Portugis, Polandia, Belanda, Rumania, Ceko, dan Swedia. Itu tidak menggeneralisasi dengan tepat ke bahasa lain. Selain itu, karena dilatih pada korpora skala besar yang mewakili web, ia membawa stereotip dan bias yang biasa ditemui secara online.

huggingface-llm-falcon-40b-instruct-bf16 Falcon40BInstruct

Falcon 40B Instruct adalah model bahasa besar kausal 40 miliar parameter yang dibangun di atas Falcon40B dan disesuaikan dengan campuran Baize. Ini sebagian besar dilatih pada data bahasa Inggris dan Prancis, dan tidak menggeneralisasi dengan tepat ke bahasa lain. Selain itu, karena dilatih pada korpora skala besar yang mewakili web, ia membawa stereotip dan bias yang biasa ditemui secara online.

huggingface-text2text-flan-t5-large FlanT5L

Keluarga Flan-T5 model adalah sekumpulan model bahasa besar yang disesuaikan pada beberapa tugas dan dapat dilatih lebih lanjut. Model-model ini sangat cocok untuk tugas-tugas seperti terjemahan bahasa, pembuatan teks, penyelesaian kalimat, disambiguasi arti kata, ringkasan, atau jawaban pertanyaan. Flan T5 L adalah model bahasa besar 780 juta parameter yang dilatih pada berbagai bahasa. Anda dapat menemukan daftar bahasa yang didukung oleh Flan T5 L dalam detail model yang diambil dari pencarian Anda berdasarkan ID model di tabel JumpStart model.

huggingface-text2text-flan-t5-xl FlanT5XL

Keluarga Flan-T5 model adalah sekumpulan model bahasa besar yang disesuaikan pada beberapa tugas dan dapat dilatih lebih lanjut. Model-model ini sangat cocok untuk tugas-tugas seperti terjemahan bahasa, pembuatan teks, penyelesaian kalimat, disambiguasi arti kata, ringkasan, atau jawaban pertanyaan. Flan T5 XL adalah model bahasa besar 3 miliar parameter yang dilatih pada berbagai bahasa. Anda dapat menemukan daftar bahasa yang didukung oleh Flan T5 XL dalam detail model yang diambil dari pencarian Anda berdasarkan ID model di tabel JumpStart model.

huggingface-text2text-flan-t5-xxll FlanT5XXL

Keluarga Flan-T5 model adalah sekumpulan model bahasa besar yang disesuaikan pada beberapa tugas dan dapat dilatih lebih lanjut. Model-model ini sangat cocok untuk tugas-tugas seperti terjemahan bahasa, pembuatan teks, penyelesaian kalimat, disambiguasi arti kata, ringkasan, atau jawaban pertanyaan. Flan T5 XXL adalah model parameter 11 miliar. Anda dapat menemukan daftar bahasa yang didukung oleh Flan T5 XXL dalam detail model yang diambil dari pencarian Anda berdasarkan ID model di tabel JumpStart model.

meta-textgeneration-llama-2-7b Llama2-7B

Llama 2 adalah kumpulan model teks generatif yang telah dilatih sebelumnya dan disetel dengan baik, mulai dari skala 7 miliar hingga 70 miliar parameter. Llama2-7B adalah model parameter 7 miliar yang ditujukan untuk penggunaan bahasa Inggris dan dapat disesuaikan untuk berbagai tugas pembuatan bahasa alami.

meta-textgeneration-llama-2-7b-f Llama2-7BChat

Llama 2 adalah kumpulan model teks generatif yang telah dilatih sebelumnya dan disetel dengan baik, mulai dari skala 7 miliar hingga 70 miliar parameter. Llama2-7B adalah model obrolan parameter 7 miliar yang dioptimalkan untuk kasus penggunaan dialog.

meta-textgeneration-llama-2-13b Llama2-13B

Llama 2 adalah kumpulan model teks generatif yang telah dilatih sebelumnya dan disetel dengan baik, mulai dari skala 7 miliar hingga 70 miliar parameter. Llama2-13B adalah model parameter 13 miliar yang ditujukan untuk penggunaan bahasa Inggris dan dapat disesuaikan untuk berbagai tugas pembuatan bahasa alami.

meta-textgeneration-llama-2-13b-f Llama2-13BChat

Llama 2 adalah kumpulan model teks generatif yang telah dilatih sebelumnya dan disetel dengan baik, mulai dari skala 7 miliar hingga 70 miliar parameter. Llama2-13B adalah model obrolan parameter 13 miliar yang dioptimalkan untuk kasus penggunaan dialog.

huggingface-llm-mistral-7b Mistral7B

Mistral 7B adalah kode tujuh miliar parameter dan model pembuatan teks bahasa Inggris tujuan umum. Ini dapat digunakan dalam berbagai kasus penggunaan termasuk ringkasan teks, klasifikasi, penyelesaian teks, atau penyelesaian kode.

huggingface-llm-mistral-7b-instruct Mistral7BInstruct

Mistral 7B Instruct adalah versi Mistral 7B yang disetel dengan baik untuk kasus penggunaan percakapan. Itu dikhususkan menggunakan berbagai kumpulan data percakapan yang tersedia untuk umum dalam bahasa Inggris.

huggingface-textgeneration1-mpt-7b-bf16 MPT7B

MPT 7B adalah model bahasa besar transformator gaya decoder dengan 6,7 miliar parameter, pra-dilatih dari awal pada 1 triliun token teks dan kode bahasa Inggris. Ini disiapkan untuk menangani panjang konteks yang panjang.

huggingface-textgeneration1-mpt-7b-instruct-bf16 MPT7BInstruct

MPT 7B Instruct adalah model untuk instruksi bentuk pendek berikut tugas-tugas. Ini dibangun dengan menyempurnakan MPT 7B pada dataset yang berasal dari databricks-dolly-15k dan set data Anthropic Helpful and Harmless (). HH-RLHF