

翻訳は機械翻訳により提供されています。提供された翻訳内容と英語版の間で齟齬、不一致または矛盾がある場合、英語版が優先します。

# Deadline Cloud で LLMsを使用して LLM をベンチマークする lm-evaluation-harness
<a name="examples-jb-vllm-leaderboard"></a>

[vllm\_lm\_eval\_leaderboard](https://github.com/aws-deadline/deadline-cloud-samples/tree/mainline/job_bundles/vllm_lm_eval_leaderboard) ジョブバンドルは、1 つの Deadline Cloud ジョブ内の複数のベンチマークに対して複数の LLMs を評価します。各モデルはパラメータスイープで 1 つのタスクになり、タスクはワーカー間で並行して実行されます。最後のステップでは、モデルごとの結果をランク付けされたリーダーボード (CSV と Markdown) に集計します。

`EvalModels` ステップの各タスクはローカル [vLLM](https://github.com/vllm-project/vllm) サーバーを起動し、ローカルエンドポイントに対して [EleutherAI の lm-evaluation-harness](https://github.com/EleutherAI/lm-evaluation-harness) を使用してすべてのベンチマークを実行し、vLLM を停止します。モデルは HuggingFace Hub から直接ロードされるため、ジョブアタッチメントは必要ありません。

このバンドルを実行するには、[CUDA ファーム CloudFormation テンプレート](https://github.com/aws-deadline/deadline-cloud-samples/tree/mainline/cloudformation/farm_templates/cuda_farm)をデプロイします。テンプレートは、NVIDIA GPU サービスマネージドフリート (A10G または L4) と、このバンドルが変更なしで使用する conda キュー環境を持つキューをプロビジョニングします。ファームがすでにある場合は、NVIDIA GPUs、少なくとも 32 GB の RAM、少なくとも 4 つの vCPUs を備えた SMF フリートが必要です。

デフォルトのモデルリストは、単一の A10G または L4 に適合する小さく、非ゲートで高速ロードのミックスです。、`Qwen/Qwen2.5-0.5B``Qwen/Qwen2.5-1.5B`、および です`EleutherAI/pythia-1.4b`。他のモデルを使用するには、 の `parameterSpace.taskParameterDefinitions`で`range`リストを編集します`template.yaml`。

デフォルトのベンチマークは、共通推論スイート を形成します`hellaswag,arc_easy,arc_challenge,winogrande`。送信時に上書きする:

```
deadline bundle submit ./job_bundles/vllm_lm_eval_leaderboard/ \
  --parameter Benchmarks="hellaswag,mmlu,gsm8k"
```

フリートがワーカーをスケールアップしない場合、最も一般的な原因は EC2 vCPU サービスクォータです。Service Quotas コンソールで*オンデマンド G および VT インスタンスを実行する*ためのヘッドルームがあることを確認します。

前提条件、ファームのセットアップ、カスタムモデルとベンチマーク、クリーンアップに関する詳細なチュートリアルについては、「」を参照してください[LLMsを使用して LLM をベンチマークする lm-evaluation-harness](tutorial-vllm-leaderboard.md)。