本文属于机器翻译版本。若本译文内容与英语原文存在差异,则一律以英文原文为准。
在 Deadline Cloud 上使用 vLLM 和 lm-evaluation-harness 对 LL
GitHub 网站上的 vllm_lm_eval_leaderboard
该EvalModels步骤中的每项任务都会启动本地 vLLM 服务器,使用 Eleutherai 的 lm-evaluation-harnes-harness 针对本地端点运行每个基准测试,然后停止 vLLM。有关更多信息,请参阅网站上的 vLLM
要运行此软件包,请在 GitHub 网站上部署 CUDA 农场 CloudFormation 模板
默认型号列表是一个小型、无门限、可快速加载的组合,适用于单个 A10G 或 L4:、和。Qwen/Qwen2.5-0.5B Qwen/Qwen2.5-1.5B EleutherAI/pythia-1.4b要使用其他型号,请编辑parameterSpace.taskParameterDefinitions中的range列表template.yaml。
默认基准测试构成了常识推理套件:hellaswag,arc_easy,arc_challenge,winogrande. 在提交时覆盖:
deadline bundle submit ./job_bundles/vllm_lm_eval_leaderboard/ \ --parameter Benchmarks="hellaswag,mmlu,gsm8k"
如果您的队列无法扩大员工规模,则最常见的原因是 Deadline Cloud 服务配额。在服务配额控制台中确认您有足够的空间容纳每个区域的 OnDemand G 实例 G OnDemand PU 和每个区域的 vCPU。
有关涵盖先决条件、农场设置、自定义模型和基准测试以及清理的完整演练,请参阅使用 vLLM 和 lm-evaluation-harness 对 LLM 进行基准。