

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

# Benchmark LLM dengan VLLm dan lm-evaluation-harness di Deadline Cloud
<a name="examples-jb-vllm-leaderboard"></a>

Paket pekerjaan [vllm\_lm\_eval\_leaderboard](https://github.com/aws-deadline/deadline-cloud-samples/tree/mainline/job_bundles/vllm_lm_eval_leaderboard) mengevaluasi beberapa LLM terhadap beberapa tolok ukur dalam satu pekerjaan Deadline Cloud. Setiap model menjadi satu tugas dalam sapuan parameter, dan tugas berjalan secara paralel di seluruh pekerja. Langkah terakhir menggabungkan hasil per model ke dalam papan peringkat (CSV dan Markdown).

Setiap tugas dalam `EvalModels` langkah memulai server [VLLM](https://github.com/vllm-project/vllm) lokal, menjalankan setiap benchmark dengan [lm-evaluation-harness EleutherAI terhadap titik akhir lokal, lalu menghentikan](https://github.com/EleutherAI/lm-evaluation-harness) VllM. Model dimuat langsung dari HuggingFace Hub, jadi lampiran pekerjaan tidak diperlukan.

Untuk menjalankan bundel ini, gunakan template [pertanian CloudFormation CUDA](https://github.com/aws-deadline/deadline-cloud-samples/tree/mainline/cloudformation/farm_templates/cuda_farm). Template menyediakan armada yang dikelola layanan GPU NVIDIA (A10G atau L4) dan antrian dengan lingkungan antrian conda yang digunakan bundel ini tanpa modifikasi. Jika Anda sudah memiliki peternakan, Anda memerlukan armada SMF dengan GPU NVIDIA, setidaknya 32 GB RAM, dan setidaknya 4 vCPU.

Daftar model default adalah campuran kecil, tidak berlubang, pemuatan cepat yang cocok pada satu A10G atau L4:,, dan. `Qwen/Qwen2.5-0.5B` `Qwen/Qwen2.5-1.5B` `EleutherAI/pythia-1.4b` Untuk menggunakan model lain, edit `range` daftar `parameterSpace.taskParameterDefinitions` di bawah ini`template.yaml`.

Tolok ukur default membentuk rangkaian penalaran akal sehat:. `hellaswag,arc_easy,arc_challenge,winogrande` Ganti pada waktu pengiriman:

```
deadline bundle submit ./job_bundles/vllm_lm_eval_leaderboard/ \
  --parameter Benchmarks="hellaswag,mmlu,gsm8k"
```

Jika armada Anda tidak meningkatkan pekerja, penyebab paling umum adalah kuota layanan vCPU EC2. Konfirmasikan bahwa Anda memiliki headroom untuk *Menjalankan instans On-Demand G dan VT di konsol Service* Quotas.

Untuk panduan lengkap yang mencakup prasyarat, pengaturan pertanian, model dan tolok ukur khusus, dan pembersihan, lihat. [Benchmark LLM dengan VLLm dan lm-evaluation-harness](tutorial-vllm-leaderboard.md)