

本文為英文版的機器翻譯版本，如內容有任何歧義或不一致之處，概以英文版為準。

# 在截止日期雲端使用 vLLM 和 lm-evaluation-harness 對 LLMs 進行基準測試
<a name="examples-jb-vllm-leaderboard"></a>

[vllm\_lm\_eval\_leaderboard](https://github.com/aws-deadline/deadline-cloud-samples/tree/mainline/job_bundles/vllm_lm_eval_leaderboard) 任務套件會根據單一截止日期雲端任務中的多個基準評估多個 LLMs。每個模型會在參數掃描中成為一個任務，而任務會跨工作者平行執行。最後一個步驟會將每個模型的結果彙總到排名的排行榜 (CSV 和 Markdown)。

`EvalModels` 步驟中的每個任務都會啟動本機 [vLLM](https://github.com/vllm-project/vllm) 伺服器，針對本機端點使用 [EleutherAI 的 lm-evaluation-harness](https://github.com/EleutherAI/lm-evaluation-harness) 執行每個基準測試，然後停止 vLLM。模型直接從 HuggingFace Hub 載入，因此不需要任務附件。

若要執行此套件，請部署 [CUDA 陣列 CloudFormation 範本](https://github.com/aws-deadline/deadline-cloud-samples/tree/mainline/cloudformation/farm_templates/cuda_farm)。範本會佈建 NVIDIA GPU 服務受管機群 (A10G 或 L4) 和具有 conda 佇列環境的佇列，此套件無須修改即可使用。如果您已有陣列，則需要具有 NVIDIA GPUs、至少 32 GB RAM 和至少 4 個 vCPUs的 SMF 機群。

預設模型清單是小型、無門控、快速載入的混合，適用於單一 A10G 或 L4：`Qwen/Qwen2.5-0.5B`、 `Qwen/Qwen2.5-1.5B`和 `EleutherAI/pythia-1.4b`。若要使用其他模型，請在 `parameterSpace.taskParameterDefinitions`中編輯 下的`range`清單`template.yaml`。

預設基準會形成通用推理套件：`hellaswag,arc_easy,arc_challenge,winogrande`。在提交時覆寫：

```
deadline bundle submit ./job_bundles/vllm_lm_eval_leaderboard/ \
  --parameter Benchmarks="hellaswag,mmlu,gsm8k"
```

如果您的機群未擴展工作者，最常見的原因是 EC2 vCPU 服務配額。確認您在 Service Quotas 主控台中有*執行隨需 G 和 VT 執行個體*的前端空間。

如需涵蓋先決條件、陣列設定、自訂模型和基準以及清除的完整演練，請參閱 [使用 vLLM 和 lm-evaluation-harness 為 LLMs 建立基準](tutorial-vllm-leaderboard.md)。