

本文為英文版的機器翻譯版本，如內容有任何歧義或不一致之處，概以英文版為準。

# 第 2 層：核准的一組基礎模型和工具
<a name="model"></a>

隨著組織瀏覽生成式 AI 採用的早期階段，他們很快意識到沒有任何單一模型可以有效地解決所有使用案例。不同的模型在各種網域和任務中表現卓越，企業需要平衡每個特定應用程式的功能、成本和效能。這種現實推動了對靈活但受控制的基礎模型存取方法的需求。

**Topics**
+ [模型實驗和自訂](#model-experimentation-customization)
+ [模型評估](#model-evaluation)
+ [實作建議](#model-implementation-recs)

## 模型實驗和自訂
<a name="model-experimentation-customization"></a>

[Amazon Bedrock](https://docs.aws.amazon.com/bedrock/latest/userguide/what-is-bedrock.html) 旨在協助您實驗各種基礎模型，並支援可擴展的生產部署。透過 Amazon Bedrock [知識庫](https://docs.aws.amazon.com/bedrock/latest/userguide/knowledge-base.html)，您擁有全受管解決方案，可建置end-to-end擷取增強生成 (RAG) 工作流程。Amazon Bedrock 也支援受管代理程式，可以執行從預訂行程到管理庫存的複雜任務，無需程式碼。由於它是無伺服器，Amazon Bedrock 可減少基礎設施管理問題，並安全地與其他 整合 AWS 服務。

此外，您可以使用 Amazon Bedrock 來使用您自己的專屬資料[私下自訂基礎模型](https://docs.aws.amazon.com/bedrock/latest/userguide/custom-models.html)，並將其安全地提供給組織內的使用者。如需詳細資訊，請參閱《Amazon Bedrock 文件》中的[自訂模型，以改善其使用案例的效能](https://docs.aws.amazon.com/bedrock/latest/userguide/custom-models.html)。對於存取管理， AWS Identity and Access Management (IAM) 會與 Amazon Bedrock 整合，以便您可以設定精細存取控制。控制項決定哪些使用者可以啟用和存取特定模型。如需詳細資訊，請參閱本指南中的 [第 3 層： 上生成式 AI 平台的安全和管理 AWS](security.md)。

## 模型評估
<a name="model-evaluation"></a>

隨著組織從生成式 AI 原型進展到生產，為基礎模型建立嚴格的評估程序至關重要。雖然開放基準提供模型效能的一般洞見，但在判斷模型是否適合特定企業需求時，通常會很短。量身打造的評估策略可協助使用者選擇最適當的模型，以符合組織的獨特需求。

### 自訂模型評估的目標
<a name="model-evaluation-objectives"></a>

自訂評估方法可協助組織執行下列動作：
+ **評估業務相關任務的效能** – 評估模型處理與企業使用案例直接相關任務的能力。
+ **識別潛在的偏差和限制** – 偵測模型可能呈現偏差或失敗的區域，以便您可以確保模型適用於實際部署。
+ **比較模型與相關指標** – 使用符合您組織優先順序和目標的指標來比較不同的模型。
+ **選擇明智的模型** – 對模型選擇、微調和部署到生產環境做出資料驅動型決策。

### 選擇模型評估指標
<a name="model-evaluation-metrics"></a>

有效的模型評估利用各種技術，提供模型效能的整體檢視。透過這些技術，組織不僅可以評估模型的技術準確性，還可以評估其與企業特定需求的一致性。若要評估模型，您可以結合量化和定性指標來判斷效能、識別偏差，然後選擇模型。組織應同時使用基本實境指標 （含參考資料） 和彈性指標 （不含參考資料），以全面了解模型適用性。在 AI 中，*地面事實*是指在模型訓練期間保留的事實資料，讓您可以將其用於模型評估。

如果參考資料存在，請使用以地面事實為基礎的指標。這些指標提供具體的量化評估。同時，沒有基本事實的技術可以提供靈活性。這些技術可協助您在可讀性和完整性等維度上評估模型，即使沒有預先定義的正確答案也一樣。

 *以 Ground Truth 資料為基礎的指標* 

如果有參考資料，則以 Ground Truth 為基礎的指標可以提供量化評估。下列指標提供量化效能評估：
+ **ROUGE-L 分數** – 針對最長常見子序列 (LCS) 的裝訂評估 (ROUGE) 的召回導向研究，也稱為 *ROUGE-L*，會測量產生和參考文字之間的最長常見子序列。指標會評估一致性和內容重疊。
+ **餘弦相似性** – 此指標會評估文字之間的語意相似性。它提供對模型情境理解的洞察。
+ **METEOR 分數** – 以明確順序 (METEOR) 評分評估翻譯的指標結合了單字對齊和語意比對，以提供內容準確性和意義的平衡評估。
+ **二進位相似性** – 此指標會檢查是否完全相符，因此對於需要精確輸出的任務特別有用，例如命令產生。
+ **LLM-as-a-judge 分數** – 此指標使用另一個大型語言模型 (LLM) 在定義的規模上評定相似性。它提供精細的品質評估。

Amazon SageMaker Clarify 和 Amazon Bedrock 包含可協助您評估模型的功能。他們可以自動化模型評估任務，讓您可以量化模型風險和回應品質。如需詳細資訊，請參閱[評估、解釋和偵測模型中的偏差，](https://docs.aws.amazon.com/sagemaker/latest/dg/model-explainability.html)以及[評估 Amazon Bedrock 資源的效能](https://docs.aws.amazon.com/bedrock/latest/userguide/evaluation.html)。

 *沒有 Ground Truth 資料的指標* 

當參考資料不可用或作為補充方法時，您可以使用 *LLM-as-a-judge 技術*。它使用單獨的模型，根據對業務重要的維度來評估生成式 AI 解決方案的輸出。此技術提供評估各種模型品質的彈性。如需詳細資訊，請參閱《Amazon Bedrock 文件》中的[使用另一個 LLM 做為判斷器評估模型效能](https://docs.aws.amazon.com/bedrock/latest/userguide/evaluation-judge.html)。

您可以使用計算指標來評估檢索增強生成 (RAG) 系統從資料來源擷取相關資訊的有效性，以及產生的回應在回答問題方面的效果。RAG 評估的結果可讓您比較不同的 Amazon Bedrock 知識庫和其他 RAG 來源，然後為應用程式選擇最佳的知識庫或 RAG 系統。如需詳細資訊，請參閱 Amazon Bedrock 文件中的[評估 RAG 來源的效能](https://docs.aws.amazon.com/bedrock/latest/userguide/evaluation-kb.html)。

### 實作模型評估技術
<a name="model-evaluation-techniques"></a>

為了有效符合具有模型功能的企業需求，請使用一組強大的評估條件來引導模型評估程序。這些條件涵蓋一系列優先順序，從正確性和完整性到事實和敏感資料處理。每個條件都符合特定技術，以提供可行的洞見。例如，當事實準確性至關重要時，ROUGE-L 分數或餘弦相似性等指標可提供具體、可量化的基準。相反地，使用 LLM-as-a-judge 等技術來評估可讀性和新鮮度。這些技術提供針對組織標準量身打造的靈活、定性洞見。評估模型的關鍵維度包括：
+ **正確性** – 驗證所提供資訊的準確性
+ **完整性** – 驗證回應的深度和涵蓋範圍
+ **可讀性** – 評估清晰度和理解程度
+ **資訊的新鮮度** – 檢查內容是否相關且為最新版本
+ **敏感資料抑制** – 檢查是否適當處理機密資訊
+ **準確性** – 測量與事實資訊的一致性
+ **一致性** – 檢查邏輯流程和一致性
+ **事實 –** 驗證內容的真實性
+ **全面性** – 評估涵蓋範圍和全面性

透過在這些明確準則中錨定模型評估技術，您可以針對其特定目的徹底審核模型。這種結構化方法使模型符合企業目標、合規要求和使用者期望。它還為在生產環境中大規模部署生成式 AI 應用程式奠定了堅實的基礎。

## 實作建議
<a name="model-implementation-recs"></a>

若要建立有效的基礎模型策略，請考慮下列建議：
+ 組成具有明確角色、責任和決策程序的模型控管委員會。
+ 在基礎模型可用於整個組織之前，開發評估標準和評分機制來評估基礎模型。
+ 請記住，最大的基礎模型不一定是您使用案例的最佳模型。使用最上層模型開始proof-of-concept開發，以驗證商業價值，然後系統性地評估較小的模型以進行成本最佳化。
+ 開發儀表板來追蹤關鍵指標，例如推論延遲、輸送量、錯誤率和每個推論的成本。
+ 為團隊提供有關如何為其使用案例選擇正確模型的明確指導，包括實驗程序和評估標準。