

本文属于机器翻译版本。若本译文内容与英语原文存在差异，则一律以英文原文为准。

# 在 Deadline Cloud 上使用 vLLM 和 lm-评估工具对 LLM 进行基准测试
<a name="examples-jb-vllm-leaderboard"></a>

vllm\_ [lm\_eval\_leaderboard 作业捆绑包在单个 Deadline Cloud](https://github.com/aws-deadline/deadline-cloud-samples/tree/mainline/job_bundles/vllm_lm_eval_leaderboard) 作业中根据多个基准评估多个 LLM。在参数扫描中，每个模型都变成一个任务，任务在工作人员之间并行运行。最后一步将每个模型的结果汇总到排名排行榜（CSV 和 Markdown）中。

`EvalModels`步骤中的每项任务都会启动本地 [vlLM 服务器，使用 eLe](https://github.com/vllm-project/vllm) [utherai 的 lm-评估工具对本地端点运行每个基准测试，然后停止 vLLM](https://github.com/EleutherAI/lm-evaluation-harness)。模型直接从 HuggingFace Hub 加载，因此不需要作业附件。

要运行此捆绑包，请部署 [CUDA 场 CloudFormation 模板](https://github.com/aws-deadline/deadline-cloud-samples/tree/mainline/cloudformation/farm_templates/cuda_farm)。该模板预置了一个 NVIDIA GPU 服务托管队列（A10G 或 L4）和一个队列，其中包含此捆绑包未经修改即可使用的 conda 队列环境。如果你已经有一个服务器场，你需要一支装有 NVIDIA GPU、至少 32 GB 内存和至少 4 个 vCPU 的 SMF 队列。

默认型号列表是一个小型、无门控、快速加载的混音，适用于单个 A10G 或 L4:、和。`Qwen/Qwen2.5-0.5B` `Qwen/Qwen2.5-1.5B` `EleutherAI/pythia-1.4b`要使用其他模型，请编辑`parameterSpace.taskParameterDefinitions`中的`range`列表`template.yaml`。

默认基准测试构成了常识性推理套件:`hellaswag,arc_easy,arc_challenge,winogrande`. 提交时覆盖：

```
deadline bundle submit ./job_bundles/vllm_lm_eval_leaderboard/ \
  --parameter Benchmarks="hellaswag,mmlu,gsm8k"
```

如果您的队列没有扩大员工规模，最常见的原因是 EC2 vCPU 服务配额。在 Service Quotas 控制台中确认您有足够的空间来*运行 On-Demand G 和 VT 实例*。

有关涵盖先决条件、服务器场设置、自定义模型和基准测试以及清理的完整演练，请参阅。[使用 vLLM 和 lm-评估工具对 LLM 进行基准测试](tutorial-vllm-leaderboard.md)