View a markdown version of this page

Compare LLMs com vLLM e lm-evaluation-harness no Deadline Cloud - Nuvem de prazos

As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.

Compare LLMs com vLLM e lm-evaluation-harness no Deadline Cloud

O pacote de tarefas vllm_lm_eval_leaderboard avalia vários LLMs em relação a vários benchmarks em um único trabalho do Deadline Cloud. Cada modelo se torna uma tarefa em uma varredura de parâmetros, e as tarefas são executadas paralelamente entre os trabalhadores. Uma etapa final agrega os resultados por modelo em uma tabela de classificação classificada (CSV e Markdown).

Cada tarefa na EvalModels etapa inicia um servidor vLLM local, executa cada benchmark com o lm-evaluation-harness da EleutherAI em relação ao endpoint local e interrompe o vLLM. Os modelos são carregados diretamente do HuggingFace Hub, portanto, os anexos do trabalho não são necessários.

Para executar esse pacote, implante o modelo de fazenda CloudFormation CUDA. O modelo provisiona uma frota gerenciada por serviços de GPU NVIDIA (A10G ou L4) e uma fila com um ambiente de fila conda que esse pacote usa sem modificação. Se você já tem uma fazenda, precisa de uma frota SMF com GPUs NVIDIA, pelo menos 32 GB de RAM e pelo menos 4 vCPUs.

A lista de modelos padrão é uma mistura pequena, sem limites e de carregamento rápido que cabe em um único A10G ou L4:, e. Qwen/Qwen2.5-0.5B Qwen/Qwen2.5-1.5B EleutherAI/pythia-1.4b Para usar outros modelos, edite a range lista abaixo parameterSpace.taskParameterDefinitions emtemplate.yaml.

Os benchmarks padrão formam um conjunto de raciocínio de bom senso:. hellaswag,arc_easy,arc_challenge,winogrande Substituir no momento do envio:

deadline bundle submit ./job_bundles/vllm_lm_eval_leaderboard/ \ --parameter Benchmarks="hellaswag,mmlu,gsm8k"

Se sua frota não aumentar o número de funcionários, a causa mais comum é uma cota de serviço EC2 vCPU. Confirme se você tem espaço livre para executar instâncias On-Demand G e VT no console Service Quotas.

Para obter uma explicação completa que aborda os pré-requisitos, a configuração da fazenda, modelos e benchmarks personalizados e a limpeza, consulte. Compare LLMs com vLLM e lm-evaluation-harness