Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
Confronta gli LLM con vLLM e lm-evaluation-harness su Deadline Cloud
Il pacchetto di job vllm_lm_eval_leaderboard sul GitHub sito Web valuta più LLM rispetto a più benchmark in un singolo
Ogni attività della EvalModels fase avvia un server vLLM locale, esegue ogni benchmark con lm-evaluation-harness di EleutherAI rispetto all'endpoint locale, quindi interrompe il vLLM. Per ulteriori informazioni
Per eseguire questo pacchetto, distribuisci il modello di farm CUDA sul sito web. CloudFormation
L'elenco di modelli predefinito è un mix piccolo, non datato e a caricamento rapido che si adatta a un singolo A10G o L4:,, e. Qwen/Qwen2.5-0.5B Qwen/Qwen2.5-1.5B EleutherAI/pythia-1.4b Per utilizzare altri modelli, modifica l'elenco sotto in. range parameterSpace.taskParameterDefinitions template.yaml
I benchmark predefiniti costituiscono una suite di ragionamento basato sul buon senso:. hellaswag,arc_easy,arc_challenge,winogrande Sostituisci al momento dell'invio:
deadline bundle submit ./job_bundles/vllm_lm_eval_leaderboard/ \ --parameter Benchmarks="hellaswag,mmlu,gsm8k"
Se la tua flotta non è in grado di aumentare il numero di dipendenti, la causa più comune è la quota di servizi Deadline Cloud. Verifica di avere spazio per le GPU di istanza OnDemand G per regione e le OnDemand vCPU per regione nella console Service Quotas.
Per una procedura dettagliata completa che include i prerequisiti, la configurazione della farm, i modelli e i benchmark personalizzati e la pulizia, consulta. Confronta gli LLM con vLLM e lm-evaluation-harness