翻訳は機械翻訳により提供されています。提供された翻訳内容と英語版の間で齟齬、不一致または矛盾がある場合、英語版が優先します。
Deadline Cloud で LLMsを使用して LLM をベンチマークする lm-evaluation-harness
vllm_lm_eval_leaderboard
EvalModels ステップの各タスクはローカル vLLM
このバンドルを実行するには、CUDA ファーム CloudFormation テンプレート
デフォルトのモデルリストは、単一の A10G または L4 に適合する小さく、非ゲートで高速ロードのミックスです。、Qwen/Qwen2.5-0.5BQwen/Qwen2.5-1.5B、および ですEleutherAI/pythia-1.4b。他のモデルを使用するには、 の parameterSpace.taskParameterDefinitionsでrangeリストを編集しますtemplate.yaml。
デフォルトのベンチマークは、共通推論スイート を形成しますhellaswag,arc_easy,arc_challenge,winogrande。送信時に上書きする:
deadline bundle submit ./job_bundles/vllm_lm_eval_leaderboard/ \ --parameter Benchmarks="hellaswag,mmlu,gsm8k"
フリートがワーカーをスケールアップしない場合、最も一般的な原因は EC2 vCPU サービスクォータです。Service Quotas コンソールでオンデマンド G および VT インスタンスを実行するためのヘッドルームがあることを確認します。
前提条件、ファームのセットアップ、カスタムモデルとベンチマーク、クリーンアップに関する詳細なチュートリアルについては、「」を参照してくださいLLMsを使用して LLM をベンチマークする lm-evaluation-harness。