本文為英文版的機器翻譯版本,如內容有任何歧義或不一致之處,概以英文版為準。
第 1 層:為生成式 AI 建置可靠的資料和運算基礎設施
對於開發生成式 AI 應用程式,特別是需要訓練或微調基礎模型時,強大的資料基礎和運算基礎設施至關重要。隨著企業開始生成式 AI 旅程,他們需要可支援整個機器學習生命週期的基礎設施。他們還需要在效能、成本和營運效率之間取得適當的平衡。
可靠的生成式 AI 基礎設施應提供下列三個關鍵元件:基礎基礎設施、向量儲存和擷取基礎設施,以及運算基礎設施。這些元件共同提供彈性,以滿足任何專案的需求,無論其規模、需求或環境。
API 型實作的基礎基礎設施
大多數組織透過 APIs 使用預先訓練的基礎模型開始生成式 AI 旅程。Amazon Bedrock 透過統一 API 提供領導基礎模型的無伺服器存取。這可協助您實驗和部署生成式 AI 應用程式,而無需管理複雜的基礎設施。對於這些實作,您需要下列項目:
-
執行應用程式的 Amazon Elastic Compute Cloud (Amazon EC2) 一般用途執行個體。
-
Amazon Simple Storage Service (Amazon S3) 用於儲存應用程式資料和輸出。
-
Amazon CloudWatch 用於監控和記錄應用程式的效能和用量。
-
(選用) AWS Lambda 用於建置事件驅動生成式 AI 應用程式時的無伺服器運算。
向量儲存和擷取基礎設施
隨著生成式 AI 應用程式成熟,您可能需要使用特定領域的知識和內容來增強這些應用程式。使用擷取增強生成 (RAG),基礎模型會參考訓練資料來源之外的授權資料來源,例如組織的資料或文件,然後再產生回應。如需詳細資訊,請參閱 上的擷取增強產生選項和架構 AWS。
Amazon Bedrock 知識庫
為了有效率的向量操作,請考慮使用 Amazon EC2 運算最佳化執行個體進行內嵌產生。另請考慮使用 Amazon ElastiCache 快取經常存取的內嵌,以最佳化效能並降低成本。
如需向量資料庫和快取的詳細資訊,請參閱什麼是向量資料庫?
用於模型訓練和微調的高效能運算基礎設施
對於準備好自訂基礎模型的組織, 為模型訓練和微調 AWS 提供全面的基礎設施。您可以使用 Amazon Simple Storage Service (Amazon S3) 作為低成本、可擴展且高耐用性的物件儲存體,用於建置資料平台,以及儲存訓練資料和訓練模型。此外, AWS Glue 是一種無伺服器資料整合服務,可協助您準備資料以進行模型訓練。
對於訓練基礎設施,Amazon SageMaker AI 提供全受管的機器學習環境,其中包含建置、訓練和部署模型所需的工具和工作流程。使用 SageMaker AI 可以大幅降低您的營運開銷。請考慮使用加速運算執行個體,例如 G 和 P 執行個體系列。這些執行個體系列可讓您從 NVIDIA 存取最新的 GPUs,以進行機器學習訓練和推論。您也可以使用 AWS Trainium
對於真正的大型專案,您可以使用 Amazon EC2 UltraClusters
實作建議
請考慮下列建議,為您的生成式 AI 專案設定可擴展且符合成本效益的基礎設施:
-
若要快速實驗和初始部署,請從 Amazon Bedrock 開始,並為您的應用程式使用一般用途運算執行個體。
-
隨著您的需求不斷演進,請使用 Amazon Bedrock 知識庫或 Amazon OpenSearch Service 實作向量儲存解決方案。相應地擴展您的基礎設施。
-
如需進階自訂,請將安全且受管的機器學習環境的佈建標準化並自動化,以支援分散式團隊的需求。如需詳細資訊,請參閱在 上設定安全且受管良好的機器學習環境 AWS
(AWS 部落格文章)。 -
採用機器學習操作 (MLOps) 來自動化和標準化整個機器學習生命週期的程序。這些程序包括模型開發、測試、整合、發行和基礎設施管理。如需詳細資訊,請參閱什麼是 MLOps?
-
對於小規模實驗或概念驗證,請從 Amazon SageMaker AI 和一般用途運算執行個體開始。當您擴展至大型生產部署時,請考慮使用 Amazon EC2 加速運算執行個體,以獲得最高效能。
-
與隨需執行個體相比,在 SageMaker AI 中使用受管 Spot 訓練可將訓練模型的成本最佳化高達 90%。SageMaker AI 會代表您管理 Spot 中斷。