View a markdown version of this page

在截止日期雲端使用 vLLM 和 lm-evaluation-harness 對 LLMs 進行基準測試 - 截止日期雲端

本文為英文版的機器翻譯版本,如內容有任何歧義或不一致之處,概以英文版為準。

在截止日期雲端使用 vLLM 和 lm-evaluation-harness 對 LLMs 進行基準測試

vllm_lm_eval_leaderboard 任務套件會根據單一截止日期雲端任務中的多個基準評估多個 LLMs。每個模型會在參數掃描中成為一個任務,而任務會跨工作者平行執行。最後一個步驟會將每個模型的結果彙總到排名的排行榜 (CSV 和 Markdown)。

EvalModels 步驟中的每個任務都會啟動本機 vLLM 伺服器,針對本機端點使用 EleutherAI 的 lm-evaluation-harness 執行每個基準測試,然後停止 vLLM。模型直接從 HuggingFace Hub 載入,因此不需要任務附件。

若要執行此套件,請部署 CUDA 陣列 CloudFormation 範本。範本會佈建 NVIDIA GPU 服務受管機群 (A10G 或 L4) 和具有 conda 佇列環境的佇列,此套件無須修改即可使用。如果您已有陣列,則需要具有 NVIDIA GPUs、至少 32 GB RAM 和至少 4 個 vCPUs的 SMF 機群。

預設模型清單是小型、無門控、快速載入的混合,適用於單一 A10G 或 L4:Qwen/Qwen2.5-0.5BQwen/Qwen2.5-1.5BEleutherAI/pythia-1.4b。若要使用其他模型,請在 parameterSpace.taskParameterDefinitions中編輯 下的range清單template.yaml

預設基準會形成通用推理套件:hellaswag,arc_easy,arc_challenge,winogrande。在提交時覆寫:

deadline bundle submit ./job_bundles/vllm_lm_eval_leaderboard/ \ --parameter Benchmarks="hellaswag,mmlu,gsm8k"

如果您的機群未擴展工作者,最常見的原因是 EC2 vCPU 服務配額。確認您在 Service Quotas 主控台中有執行隨需 G 和 VT 執行個體的前端空間。

如需涵蓋先決條件、陣列設定、自訂模型和基準以及清除的完整演練,請參閱 使用 vLLM 和 lm-evaluation-harness 為 LLMs 建立基準