기계 번역으로 제공되는 번역입니다. 제공된 번역과 원본 영어의 내용이 상충하는 경우에는 영어 버전이 우선합니다.
Deadline Cloud에서 vLLM 및 lm-evaluation-harness를 사용하여 LLMs 벤치마크
vllm_lm_eval_leaderboard
이 EvalModels 단계의 각 작업은 로컬 vLLM
이 번들을 실행하려면 CUDA 팜 CloudFormation 템플릿을
기본 모델 목록은 단일 A10G 또는 L4: , Qwen/Qwen2.5-0.5B Qwen/Qwen2.5-1.5B,에 맞는 작고 빠르게 로드되는 비동기식 혼합입니다EleutherAI/pythia-1.4b. 다른 모델을 사용하려면의 parameterSpace.taskParameterDefinitions에서 range 목록을 편집합니다template.yaml.
기본 벤치마크는 공통 추론 제품군인를 형성합니다hellaswag,arc_easy,arc_challenge,winogrande. 제출 시 재정의:
deadline bundle submit ./job_bundles/vllm_lm_eval_leaderboard/ \ --parameter Benchmarks="hellaswag,mmlu,gsm8k"
플릿이 작업자를 스케일 업하지 않는 경우 가장 일반적인 원인은 EC2 vCPU 서비스 할당량입니다. Service Quotas 콘솔에서 온디맨드 G 및 VT 인스턴스를 실행할 수 있는 여유 공간이 있는지 확인합니다.
사전 조건, 팜 설정, 사용자 지정 모델 및 벤치마크, 정리를 다루는 전체 연습은 섹션을 참조하세요vLLM 및 lm-evaluation-harnessLLMs 벤치마크.