本文為英文版的機器翻譯版本,如內容有任何歧義或不一致之處,概以英文版為準。
在截止日期雲端使用 vLLM 和 lm-evaluation-harness 對 LLMs 進行基準測試
vllm_lm_eval_leaderboard
EvalModels 步驟中的每個任務都會啟動本機 vLLM
若要執行此套件,請部署 CUDA 陣列 CloudFormation 範本
預設模型清單是小型、無門控、快速載入的混合,適用於單一 A10G 或 L4:Qwen/Qwen2.5-0.5B、 Qwen/Qwen2.5-1.5B和 EleutherAI/pythia-1.4b。若要使用其他模型,請在 parameterSpace.taskParameterDefinitions中編輯 下的range清單template.yaml。
預設基準會形成通用推理套件:hellaswag,arc_easy,arc_challenge,winogrande。在提交時覆寫:
deadline bundle submit ./job_bundles/vllm_lm_eval_leaderboard/ \ --parameter Benchmarks="hellaswag,mmlu,gsm8k"
如果您的機群未擴展工作者,最常見的原因是 EC2 vCPU 服務配額。確認您在 Service Quotas 主控台中有執行隨需 G 和 VT 執行個體的前端空間。
如需涵蓋先決條件、陣列設定、自訂模型和基準以及清除的完整演練,請參閱 使用 vLLM 和 lm-evaluation-harness 為 LLMs 建立基準。