

기계 번역으로 제공되는 번역입니다. 제공된 번역과 원본 영어의 내용이 상충하는 경우에는 영어 버전이 우선합니다.

# Deadline Cloud에서 vLLM 및 lm-evaluation-harness를 사용하여 LLMs 벤치마크
<a name="examples-jb-vllm-leaderboard"></a>

[vllm\_lm\_eval\_leaderboard](https://github.com/aws-deadline/deadline-cloud-samples/tree/mainline/job_bundles/vllm_lm_eval_leaderboard) 작업 번들은 단일 Deadline Cloud 작업에서 여러 벤치마크를 기준으로 여러 LLMs을 평가합니다. 각 모델은 파라미터 스윕에서 하나의 작업이 되며 작업은 작업자 간에 병렬로 실행됩니다. 마지막 단계는 모델별 결과를 순위 리더보드(CSV 및 마크다운)로 집계합니다.

이 `EvalModels` 단계의 각 작업은 로컬 [vLLM](https://github.com/vllm-project/vllm) 서버를 시작하고, 로컬 엔드포인트에 대한 [EleutherAI의 lm-evaluation-harness](https://github.com/EleutherAI/lm-evaluation-harness)를 사용하여 모든 벤치마크를 실행한 다음, vLLM을 중지합니다. 모델은 HuggingFace Hub에서 직접 로드되므로 작업 연결이 필요하지 않습니다.

이 번들을 실행하려면 [CUDA 팜 CloudFormation 템플릿을](https://github.com/aws-deadline/deadline-cloud-samples/tree/mainline/cloudformation/farm_templates/cuda_farm) 배포합니다. 템플릿은 NVIDIA GPU 서비스 관리형 플릿(A10G 또는 L4)과이 번들이 수정 없이 사용하는 conda 대기열 환경이 있는 대기열을 프로비저닝합니다. 이미 팜이 있는 경우 NVIDIA GPUs, 최소 32GB의 RAM 및 최소 4개의 vCPUs 필요합니다.

기본 모델 목록은 단일 A10G 또는 L4: , `Qwen/Qwen2.5-0.5B` `Qwen/Qwen2.5-1.5B`,에 맞는 작고 빠르게 로드되는 비동기식 혼합입니다`EleutherAI/pythia-1.4b`. 다른 모델을 사용하려면의 `parameterSpace.taskParameterDefinitions`에서 `range` 목록을 편집합니다`template.yaml`.

기본 벤치마크는 공통 추론 제품군인를 형성합니다`hellaswag,arc_easy,arc_challenge,winogrande`. 제출 시 재정의:

```
deadline bundle submit ./job_bundles/vllm_lm_eval_leaderboard/ \
  --parameter Benchmarks="hellaswag,mmlu,gsm8k"
```

플릿이 작업자를 스케일 업하지 않는 경우 가장 일반적인 원인은 EC2 vCPU 서비스 할당량입니다. Service Quotas 콘솔에서 *온디맨드 G 및 VT 인스턴스를 실행할* 수 있는 여유 공간이 있는지 확인합니다.

사전 조건, 팜 설정, 사용자 지정 모델 및 벤치마크, 정리를 다루는 전체 연습은 섹션을 참조하세요[vLLM 및 lm-evaluation-harnessLLMs 벤치마크](tutorial-vllm-leaderboard.md).