Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
Effettua il benchmark dei LLM con vLLM e lm-evaluation-harness su Deadline Cloud
Il job bundle vllm_lm_eval_leaderboard valuta
Ogni attività della EvalModels fase avvia un server vLLM
Per eseguire questo pacchetto, distribuisci il modello di farm CUDA
L'elenco di modelli predefinito è un mix piccolo, non datato, a caricamento rapido che si adatta a un singolo A10G o L4:, e. Qwen/Qwen2.5-0.5B Qwen/Qwen2.5-1.5B EleutherAI/pythia-1.4b Per utilizzare altri modelli, modifica l'elenco sotto in. range parameterSpace.taskParameterDefinitions template.yaml
I benchmark predefiniti formano una suite di ragionamento basata sul buon senso:. hellaswag,arc_easy,arc_challenge,winogrande Sostituisci al momento dell'invio:
deadline bundle submit ./job_bundles/vllm_lm_eval_leaderboard/ \ --parameter Benchmarks="hellaswag,mmlu,gsm8k"
Se la tua flotta non aumenta il numero di dipendenti, la causa più comune è una quota di servizio vCPU EC2. Verifica di avere spazio di manovra per eseguire istanze On-Demand G e VT nella console Service Quotas.
Per una procedura dettagliata che copre i prerequisiti, la configurazione della farm, i modelli e i benchmark personalizzati e la pulizia, consulta. Effettua il benchmark dei LLM con vLLM e lm-evaluation-harness