Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
Vergleichen Sie LLMs mit vLLM und lm-evaluation-harness auf Deadline Cloud
Das Jobpaket vllm_lm_eval_leaderboard
Jede Aufgabe in diesem EvalModels Schritt startet einen lokalen vLLM-Server, führt jeden Benchmark mit dem lm-evaluation-harness
Um dieses Paket auszuführen, stellen Sie die CloudFormation CUDA-Farmvorlage
Die Standardmodellliste ist eine kleine, ungegliederte, schnell ladende Mischung, die auf einen einzelnen A10G oder L4 passt:,, und. Qwen/Qwen2.5-0.5B Qwen/Qwen2.5-1.5B EleutherAI/pythia-1.4b Um andere Modelle zu verwenden, bearbeiten Sie die Liste unter in. range parameterSpace.taskParameterDefinitions template.yaml
Die Standard-Benchmarks bilden eine Sammlung vernünftiger Überlegungen:. hellaswag,arc_easy,arc_challenge,winogrande Zum Zeitpunkt des Absendens überschreiben:
deadline bundle submit ./job_bundles/vllm_lm_eval_leaderboard/ \ --parameter Benchmarks="hellaswag,mmlu,gsm8k"
Wenn Ihre Flotte nicht skaliert, ist die häufigste Ursache ein EC2-vCPU-Servicekontingent. Vergewissern Sie sich, dass Sie in der Service Quotas Quotas-Konsole genügend Spielraum für Running On-Demand G- und VT-Instances haben.
Eine vollständige exemplarische Vorgehensweise, in der die Voraussetzungen, die Einrichtung der Farm, benutzerdefinierte Modelle und Benchmarks sowie die Bereinigung behandelt werden, finden Sie unter. Benchmark-LLMs mit vLLM und lm-evaluation-harness