Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Benchmark LLM dengan vLLM dan lm-evaluation-harness di Deadline Cloud
Bundel pekerjaan vllm_lm_eval_leaderboard di GitHub situs web mengevaluasi beberapa LLM terhadap beberapa tolok ukur dalam satu
Setiap tugas dalam EvalModels langkah memulai server vLLM lokal, menjalankan setiap benchmark dengan lm-evaluation-harness eLeutherai terhadap titik akhir lokal, lalu menghentikan vLLM. Untuk informasi lebih lanjut, lihat vLLM
Untuk menjalankan bundel ini, gunakan CloudFormation template pertanian CUDA
Daftar model default adalah campuran kecil, tanpa batas, dan cepat yang cocok untuk satu A10G atau L4:,, dan. Qwen/Qwen2.5-0.5B Qwen/Qwen2.5-1.5B EleutherAI/pythia-1.4b Untuk menggunakan model lain, edit range daftar parameterSpace.taskParameterDefinitions di bawahtemplate.yaml.
Tolok ukur default membentuk rangkaian penalaran akal sehat:hellaswag,arc_easy,arc_challenge,winogrande. Ganti pada waktu pengiriman:
deadline bundle submit ./job_bundles/vllm_lm_eval_leaderboard/ \ --parameter Benchmarks="hellaswag,mmlu,gsm8k"
Jika armada Anda tidak meningkatkan jumlah pekerja, penyebab paling umum adalah kuota layanan Deadline Cloud. Konfirmasikan bahwa Anda memiliki ruang untuk GPU instans OnDemand G per wilayah dan OnDemand vCPU per wilayah di konsol Kuota Layanan.
Untuk panduan lengkap yang mencakup prasyarat, pengaturan pertanian, model dan tolok ukur khusus, dan pembersihan, lihatBenchmark LLM dengan vLLM dan lm-evaluation-harness.