View a markdown version of this page

Deadline Cloud で LLMsを使用して LLM をベンチマークする lm-evaluation-harness - Deadline クラウド

翻訳は機械翻訳により提供されています。提供された翻訳内容と英語版の間で齟齬、不一致または矛盾がある場合、英語版が優先します。

Deadline Cloud で LLMsを使用して LLM をベンチマークする lm-evaluation-harness

vllm_lm_eval_leaderboard ジョブバンドルは、1 つの Deadline Cloud ジョブ内の複数のベンチマークに対して複数の LLMs を評価します。各モデルはパラメータスイープで 1 つのタスクになり、タスクはワーカー間で並行して実行されます。最後のステップでは、モデルごとの結果をランク付けされたリーダーボード (CSV と Markdown) に集計します。

EvalModels ステップの各タスクはローカル vLLM サーバーを起動し、ローカルエンドポイントに対して EleutherAI の lm-evaluation-harness を使用してすべてのベンチマークを実行し、vLLM を停止します。モデルは HuggingFace Hub から直接ロードされるため、ジョブアタッチメントは必要ありません。

このバンドルを実行するには、CUDA ファーム CloudFormation テンプレートをデプロイします。テンプレートは、NVIDIA GPU サービスマネージドフリート (A10G または L4) と、このバンドルが変更なしで使用する conda キュー環境を持つキューをプロビジョニングします。ファームがすでにある場合は、NVIDIA GPUs、少なくとも 32 GB の RAM、少なくとも 4 つの vCPUs を備えた SMF フリートが必要です。

デフォルトのモデルリストは、単一の A10G または L4 に適合する小さく、非ゲートで高速ロードのミックスです。、Qwen/Qwen2.5-0.5BQwen/Qwen2.5-1.5B、および ですEleutherAI/pythia-1.4b。他のモデルを使用するには、 の parameterSpace.taskParameterDefinitionsrangeリストを編集しますtemplate.yaml

デフォルトのベンチマークは、共通推論スイート を形成しますhellaswag,arc_easy,arc_challenge,winogrande。送信時に上書きする:

deadline bundle submit ./job_bundles/vllm_lm_eval_leaderboard/ \ --parameter Benchmarks="hellaswag,mmlu,gsm8k"

フリートがワーカーをスケールアップしない場合、最も一般的な原因は EC2 vCPU サービスクォータです。Service Quotas コンソールでオンデマンド G および VT インスタンスを実行するためのヘッドルームがあることを確認します。

前提条件、ファームのセットアップ、カスタムモデルとベンチマーク、クリーンアップに関する詳細なチュートリアルについては、「」を参照してくださいLLMsを使用して LLM をベンチマークする lm-evaluation-harness