本文為英文版的機器翻譯版本,如內容有任何歧義或不一致之處,概以英文版為準。
第 2 層:核准的一組基礎模型和工具
隨著組織瀏覽生成式 AI 採用的早期階段,他們很快意識到沒有任何單一模型可以有效地解決所有使用案例。不同的模型在各種網域和任務中表現卓越,企業需要平衡每個特定應用程式的功能、成本和效能。這種現實推動了對靈活但受控制的基礎模型存取方法的需求。
模型實驗和自訂
Amazon Bedrock 旨在協助您實驗各種基礎模型,並支援可擴展的生產部署。透過 Amazon Bedrock 知識庫,您擁有全受管解決方案,可建置end-to-end擷取增強生成 (RAG) 工作流程。Amazon Bedrock 也支援受管代理程式,可以執行從預訂行程到管理庫存的複雜任務,無需程式碼。由於它是無伺服器,Amazon Bedrock 可減少基礎設施管理問題,並安全地與其他 整合 AWS 服務。
此外,您可以使用 Amazon Bedrock 來使用您自己的專屬資料私下自訂基礎模型,並將其安全地提供給組織內的使用者。如需詳細資訊,請參閱《Amazon Bedrock 文件》中的自訂模型,以改善其使用案例的效能。對於存取管理, AWS Identity and Access Management (IAM) 會與 Amazon Bedrock 整合,以便您可以設定精細存取控制。控制項決定哪些使用者可以啟用和存取特定模型。如需詳細資訊,請參閱本指南中的 第 3 層: 上生成式 AI 平台的安全和管理 AWS。
模型評估
隨著組織從生成式 AI 原型進展到生產,為基礎模型建立嚴格的評估程序至關重要。雖然開放基準提供模型效能的一般洞見,但在判斷模型是否適合特定企業需求時,通常會很短。量身打造的評估策略可協助使用者選擇最適當的模型,以符合組織的獨特需求。
自訂模型評估的目標
自訂評估方法可協助組織執行下列動作:
-
評估業務相關任務的效能 – 評估模型處理與企業使用案例直接相關任務的能力。
-
識別潛在的偏差和限制 – 偵測模型可能呈現偏差或失敗的區域,以便您可以確保模型適用於實際部署。
-
比較模型與相關指標 – 使用符合您組織優先順序和目標的指標來比較不同的模型。
-
選擇明智的模型 – 對模型選擇、微調和部署到生產環境做出資料驅動型決策。
選擇模型評估指標
有效的模型評估利用各種技術,提供模型效能的整體檢視。透過這些技術,組織不僅可以評估模型的技術準確性,還可以評估其與企業特定需求的一致性。若要評估模型,您可以結合量化和定性指標來判斷效能、識別偏差,然後選擇模型。組織應同時使用基本實境指標 (含參考資料) 和彈性指標 (不含參考資料),以全面了解模型適用性。在 AI 中,地面事實是指在模型訓練期間保留的事實資料,讓您可以將其用於模型評估。
如果參考資料存在,請使用以地面事實為基礎的指標。這些指標提供具體的量化評估。同時,沒有基本事實的技術可以提供靈活性。這些技術可協助您在可讀性和完整性等維度上評估模型,即使沒有預先定義的正確答案也一樣。
以 Ground Truth 資料為基礎的指標
如果有參考資料,則以 Ground Truth 為基礎的指標可以提供量化評估。下列指標提供量化效能評估:
-
ROUGE-L 分數 – 針對最長常見子序列 (LCS) 的裝訂評估 (ROUGE) 的召回導向研究,也稱為 ROUGE-L,會測量產生和參考文字之間的最長常見子序列。指標會評估一致性和內容重疊。
-
餘弦相似性 – 此指標會評估文字之間的語意相似性。它提供對模型情境理解的洞察。
-
METEOR 分數 – 以明確順序 (METEOR) 評分評估翻譯的指標結合了單字對齊和語意比對,以提供內容準確性和意義的平衡評估。
-
二進位相似性 – 此指標會檢查是否完全相符,因此對於需要精確輸出的任務特別有用,例如命令產生。
-
LLM-as-a-judge 分數 – 此指標使用另一個大型語言模型 (LLM) 在定義的規模上評定相似性。它提供精細的品質評估。
Amazon SageMaker Clarify 和 Amazon Bedrock 包含可協助您評估模型的功能。他們可以自動化模型評估任務,讓您可以量化模型風險和回應品質。如需詳細資訊,請參閱評估、解釋和偵測模型中的偏差,以及評估 Amazon Bedrock 資源的效能。
沒有 Ground Truth 資料的指標
當參考資料不可用或作為補充方法時,您可以使用 LLM-as-a-judge 技術。它使用單獨的模型,根據對業務重要的維度來評估生成式 AI 解決方案的輸出。此技術提供評估各種模型品質的彈性。如需詳細資訊,請參閱《Amazon Bedrock 文件》中的使用另一個 LLM 做為判斷器評估模型效能。
您可以使用計算指標來評估檢索增強生成 (RAG) 系統從資料來源擷取相關資訊的有效性,以及產生的回應在回答問題方面的效果。RAG 評估的結果可讓您比較不同的 Amazon Bedrock 知識庫和其他 RAG 來源,然後為應用程式選擇最佳的知識庫或 RAG 系統。如需詳細資訊,請參閱 Amazon Bedrock 文件中的評估 RAG 來源的效能。
實作模型評估技術
為了有效符合具有模型功能的企業需求,請使用一組強大的評估條件來引導模型評估程序。這些條件涵蓋一系列優先順序,從正確性和完整性到事實和敏感資料處理。每個條件都符合特定技術,以提供可行的洞見。例如,當事實準確性至關重要時,ROUGE-L 分數或餘弦相似性等指標可提供具體、可量化的基準。相反地,使用 LLM-as-a-judge 等技術來評估可讀性和新鮮度。這些技術提供針對組織標準量身打造的靈活、定性洞見。評估模型的關鍵維度包括:
-
正確性 – 驗證所提供資訊的準確性
-
完整性 – 驗證回應的深度和涵蓋範圍
-
可讀性 – 評估清晰度和理解程度
-
資訊的新鮮度 – 檢查內容是否相關且為最新版本
-
敏感資料抑制 – 檢查是否適當處理機密資訊
-
準確性 – 測量與事實資訊的一致性
-
一致性 – 檢查邏輯流程和一致性
-
事實 – 驗證內容的真實性
-
全面性 – 評估涵蓋範圍和全面性
透過在這些明確準則中錨定模型評估技術,您可以針對其特定目的徹底審核模型。這種結構化方法使模型符合企業目標、合規要求和使用者期望。它還為在生產環境中大規模部署生成式 AI 應用程式奠定了堅實的基礎。
實作建議
若要建立有效的基礎模型策略,請考慮下列建議:
-
組成具有明確角色、責任和決策程序的模型控管委員會。
-
在基礎模型可用於整個組織之前,開發評估標準和評分機制來評估基礎模型。
-
請記住,最大的基礎模型不一定是您使用案例的最佳模型。使用最上層模型開始proof-of-concept開發,以驗證商業價值,然後系統性地評估較小的模型以進行成本最佳化。
-
開發儀表板來追蹤關鍵指標,例如推論延遲、輸送量、錯誤率和每個推論的成本。
-
為團隊提供有關如何為其使用案例選擇正確模型的明確指導,包括實驗程序和評估標準。