View a markdown version of this page

Confronta gli LLM con vLLM e lm-evaluation-harness su Deadline Cloud - Deadline Cloud

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

Confronta gli LLM con vLLM e lm-evaluation-harness su Deadline Cloud

Il pacchetto di job vllm_lm_eval_leaderboard sul GitHub sito Web valuta più LLM rispetto a più benchmark in un singolo job Deadline Cloud. Ogni modello diventa un'unica attività in un'analisi dei parametri e le attività vengono eseguite in parallelo tra i lavoratori. Un passaggio finale aggrega i risultati per modello in una classifica classificata (CSV e Markdown).

Ogni attività della EvalModels fase avvia un server vLLM locale, esegue ogni benchmark con lm-evaluation-harness di EleutherAI rispetto all'endpoint locale, quindi interrompe il vLLM. Per ulteriori informazioni GitHub , vedere vLLM e lm-evaluation-harness sul sito Web. I modelli vengono caricati direttamente da Hugging Face Hub, quindi non sono necessari allegati al lavoro.

Per eseguire questo pacchetto, distribuisci il modello di farm CUDA sul sito web. CloudFormation GitHub Il modello fornisce una flotta gestita da servizi GPU NVIDIA (A10G o L4) e una coda con un ambiente di coda conda che questo pacchetto utilizza senza modifiche. Se hai già una farm, hai bisogno di una flotta SMF con GPU NVIDIA, almeno 32 GB di RAM e almeno 4 vCPU.

L'elenco di modelli predefinito è un mix piccolo, non datato e a caricamento rapido che si adatta a un singolo A10G o L4:,, e. Qwen/Qwen2.5-0.5B Qwen/Qwen2.5-1.5B EleutherAI/pythia-1.4b Per utilizzare altri modelli, modifica l'elenco sotto in. range parameterSpace.taskParameterDefinitions template.yaml

I benchmark predefiniti costituiscono una suite di ragionamento basato sul buon senso:. hellaswag,arc_easy,arc_challenge,winogrande Sostituisci al momento dell'invio:

deadline bundle submit ./job_bundles/vllm_lm_eval_leaderboard/ \ --parameter Benchmarks="hellaswag,mmlu,gsm8k"

Se la tua flotta non è in grado di aumentare il numero di dipendenti, la causa più comune è la quota di servizi Deadline Cloud. Verifica di avere spazio per le GPU di istanza OnDemand G per regione e le OnDemand vCPU per regione nella console Service Quotas.

Per una procedura dettagliata completa che include i prerequisiti, la configurazione della farm, i modelli e i benchmark personalizzati e la pulizia, consulta. Confronta gli LLM con vLLM e lm-evaluation-harness