Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Benchmark LLM dengan VLLm dan lm-evaluation-harness di Deadline Cloud
Paket pekerjaan vllm_lm_eval_leaderboard
Setiap tugas dalam EvalModels langkah memulai server VLLM
Untuk menjalankan bundel ini, gunakan template pertanian CloudFormation CUDA
Daftar model default adalah campuran kecil, tidak berlubang, pemuatan cepat yang cocok pada satu A10G atau L4:,, dan. Qwen/Qwen2.5-0.5B Qwen/Qwen2.5-1.5B EleutherAI/pythia-1.4b Untuk menggunakan model lain, edit range daftar parameterSpace.taskParameterDefinitions di bawah initemplate.yaml.
Tolok ukur default membentuk rangkaian penalaran akal sehat:. hellaswag,arc_easy,arc_challenge,winogrande Ganti pada waktu pengiriman:
deadline bundle submit ./job_bundles/vllm_lm_eval_leaderboard/ \ --parameter Benchmarks="hellaswag,mmlu,gsm8k"
Jika armada Anda tidak meningkatkan pekerja, penyebab paling umum adalah kuota layanan vCPU EC2. Konfirmasikan bahwa Anda memiliki headroom untuk Menjalankan instans On-Demand G dan VT di konsol Service Quotas.
Untuk panduan lengkap yang mencakup prasyarat, pengaturan pertanian, model dan tolok ukur khusus, dan pembersihan, lihat. Benchmark LLM dengan VLLm dan lm-evaluation-harness