

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

# Effettua il benchmark dei LLM con vLLM e lm-evaluation-harness su Deadline Cloud
<a name="examples-jb-vllm-leaderboard"></a>

Il job bundle [vllm\_lm\_eval\_leaderboard valuta](https://github.com/aws-deadline/deadline-cloud-samples/tree/mainline/job_bundles/vllm_lm_eval_leaderboard) più LLM rispetto a più benchmark in un unico job di Deadline Cloud. Ogni modello diventa un'attività in uno sweep di parametri e le attività vengono eseguite in parallelo tra i lavoratori. Un passaggio finale aggrega i risultati per modello in una classifica classificata (CSV e Markdown).

Ogni attività della `EvalModels` fase avvia un server [vLLM](https://github.com/vllm-project/vllm) locale, esegue ogni benchmark con lm-evaluation-harness di [eleutherAI](https://github.com/EleutherAI/lm-evaluation-harness) sull'endpoint locale, quindi arresta vLLM. I HuggingFace modelli vengono caricati direttamente dall'Hub, quindi non sono necessari allegati di lavoro.

Per eseguire questo pacchetto, distribuisci il modello di farm [CUDA](https://github.com/aws-deadline/deadline-cloud-samples/tree/mainline/cloudformation/farm_templates/cuda_farm). CloudFormation Il modello fornisce una flotta gestita dal servizio GPU NVIDIA (A10G o L4) e una coda con un ambiente di coda conda che questo pacchetto utilizza senza modifiche. Se hai già una farm, ti serve una flotta SMF con GPU NVIDIA, almeno 32 GB di RAM e almeno 4 vCPU.

L'elenco di modelli predefinito è un mix piccolo, non datato, a caricamento rapido che si adatta a un singolo A10G o L4:, e. `Qwen/Qwen2.5-0.5B` `Qwen/Qwen2.5-1.5B` `EleutherAI/pythia-1.4b` Per utilizzare altri modelli, modifica l'elenco sotto in. `range` `parameterSpace.taskParameterDefinitions` `template.yaml`

I benchmark predefiniti formano una suite di ragionamento basata sul buon senso:. `hellaswag,arc_easy,arc_challenge,winogrande` Sostituisci al momento dell'invio:

```
deadline bundle submit ./job_bundles/vllm_lm_eval_leaderboard/ \
  --parameter Benchmarks="hellaswag,mmlu,gsm8k"
```

Se la tua flotta non aumenta il numero di dipendenti, la causa più comune è una quota di servizio vCPU EC2. Verifica di avere spazio di manovra per *eseguire istanze On-Demand G e VT* nella console Service Quotas.

Per una procedura dettagliata che copre i prerequisiti, la configurazione della farm, i modelli e i benchmark personalizzati e la pulizia, consulta. [Effettua il benchmark dei LLM con vLLM e lm-evaluation-harness](tutorial-vllm-leaderboard.md)