As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.
Compare LLMs com vLLM e lm-evaluation-harness no Deadline Cloud
O pacote de tarefas vllm_lm_eval_leaderboard avalia vários LLMs em relação a vários benchmarks em um único trabalho do
Cada tarefa na EvalModels etapa inicia um servidor vLLM
Para executar esse pacote, implante o modelo de fazenda CloudFormation CUDA
A lista de modelos padrão é uma mistura pequena, sem limites e de carregamento rápido que cabe em um único A10G ou L4:, e. Qwen/Qwen2.5-0.5B Qwen/Qwen2.5-1.5B EleutherAI/pythia-1.4b Para usar outros modelos, edite a range lista abaixo parameterSpace.taskParameterDefinitions emtemplate.yaml.
Os benchmarks padrão formam um conjunto de raciocínio de bom senso:. hellaswag,arc_easy,arc_challenge,winogrande Substituir no momento do envio:
deadline bundle submit ./job_bundles/vllm_lm_eval_leaderboard/ \ --parameter Benchmarks="hellaswag,mmlu,gsm8k"
Se sua frota não aumentar o número de funcionários, a causa mais comum é uma cota de serviço EC2 vCPU. Confirme se você tem espaço livre para executar instâncias On-Demand G e VT no console Service Quotas.
Para obter uma explicação completa que aborda os pré-requisitos, a configuração da fazenda, modelos e benchmarks personalizados e a limpeza, consulte. Compare LLMs com vLLM e lm-evaluation-harness