View a markdown version of this page

Benchmark LLM dengan VLLm dan lm-evaluation-harness di Deadline Cloud - Batas Waktu Cloud

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Benchmark LLM dengan VLLm dan lm-evaluation-harness di Deadline Cloud

Paket pekerjaan vllm_lm_eval_leaderboard mengevaluasi beberapa LLM terhadap beberapa tolok ukur dalam satu pekerjaan Deadline Cloud. Setiap model menjadi satu tugas dalam sapuan parameter, dan tugas berjalan secara paralel di seluruh pekerja. Langkah terakhir menggabungkan hasil per model ke dalam papan peringkat (CSV dan Markdown).

Setiap tugas dalam EvalModels langkah memulai server VLLM lokal, menjalankan setiap benchmark dengan lm-evaluation-harness EleutherAI terhadap titik akhir lokal, lalu menghentikan VllM. Model dimuat langsung dari HuggingFace Hub, jadi lampiran pekerjaan tidak diperlukan.

Untuk menjalankan bundel ini, gunakan template pertanian CloudFormation CUDA. Template menyediakan armada yang dikelola layanan GPU NVIDIA (A10G atau L4) dan antrian dengan lingkungan antrian conda yang digunakan bundel ini tanpa modifikasi. Jika Anda sudah memiliki peternakan, Anda memerlukan armada SMF dengan GPU NVIDIA, setidaknya 32 GB RAM, dan setidaknya 4 vCPU.

Daftar model default adalah campuran kecil, tidak berlubang, pemuatan cepat yang cocok pada satu A10G atau L4:,, dan. Qwen/Qwen2.5-0.5B Qwen/Qwen2.5-1.5B EleutherAI/pythia-1.4b Untuk menggunakan model lain, edit range daftar parameterSpace.taskParameterDefinitions di bawah initemplate.yaml.

Tolok ukur default membentuk rangkaian penalaran akal sehat:. hellaswag,arc_easy,arc_challenge,winogrande Ganti pada waktu pengiriman:

deadline bundle submit ./job_bundles/vllm_lm_eval_leaderboard/ \ --parameter Benchmarks="hellaswag,mmlu,gsm8k"

Jika armada Anda tidak meningkatkan pekerja, penyebab paling umum adalah kuota layanan vCPU EC2. Konfirmasikan bahwa Anda memiliki headroom untuk Menjalankan instans On-Demand G dan VT di konsol Service Quotas.

Untuk panduan lengkap yang mencakup prasyarat, pengaturan pertanian, model dan tolok ukur khusus, dan pembersihan, lihat. Benchmark LLM dengan VLLm dan lm-evaluation-harness