

本文為英文版的機器翻譯版本，如內容有任何歧義或不一致之處，概以英文版為準。

# 第 1 層：為生成式 AI 建置可靠的資料和運算基礎設施
<a name="infrastructure"></a>

對於開發生成式 AI 應用程式，特別是需要訓練或微調基礎模型時，強大的資料基礎和運算基礎設施至關重要。隨著企業開始生成式 AI 旅程，他們需要可支援整個機器學習生命週期的基礎設施。他們還需要在效能、成本和營運效率之間取得適當的平衡。

可靠的生成式 AI 基礎設施應提供下列三個關鍵元件：基礎基礎設施、向量儲存和擷取基礎設施，以及運算基礎設施。這些元件共同提供彈性，以滿足任何專案的需求，無論其規模、需求或環境。

**Topics**
+ [API 型實作的基礎基礎設施](#infrastructure-foundation)
+ [向量儲存和擷取基礎設施](#infrastructure-storage)
+ [用於模型訓練和微調的高效能運算基礎設施](#infrastructure-compute)
+ [實作建議](#infrastructure-implementation-recs)

## API 型實作的基礎基礎設施
<a name="infrastructure-foundation"></a>

大多數組織透過 APIs 使用預先訓練的基礎模型開始生成式 AI 旅程。[Amazon Bedrock](https://docs.aws.amazon.com/bedrock/latest/userguide/what-is-bedrock.html) 透過統一 API 提供領導基礎模型的無伺服器存取。這可協助您實驗和部署生成式 AI 應用程式，而無需管理複雜的基礎設施。對於這些實作，您需要下列項目：
+ 執行應用程式的 Amazon [Elastic Compute Cloud (Amazon EC2)](https://docs.aws.amazon.com/AWSEC2/latest/UserGuide/concepts.html) 一般用途執行個體。
+ [Amazon Simple Storage Service (Amazon S3)](https://docs.aws.amazon.com/AmazonS3/latest/userguide/Welcome.html) 用於儲存應用程式資料和輸出。
+ [Amazon CloudWatch](https://docs.aws.amazon.com/AmazonCloudWatch/latest/monitoring/WhatIsCloudWatch.html) 用於監控和記錄應用程式的效能和用量。
+ （選用） [AWS Lambda](https://docs.aws.amazon.com/lambda/latest/dg/welcome.html) 用於建置事件驅動生成式 AI 應用程式時的無伺服器運算。

## 向量儲存和擷取基礎設施
<a name="infrastructure-storage"></a>

隨著生成式 AI 應用程式成熟，您可能需要使用特定領域的知識和內容來增強這些應用程式。使用擷取增強生成 (RAG)，基礎模型會參考訓練資料來源之外的授權資料來源，例如組織的資料或文件，然後再產生回應。如需詳細資訊，請參閱 [上的擷取增強產生選項和架構 AWS](https://docs.aws.amazon.com/prescriptive-guidance/latest/retrieval-augmented-generation-options/introduction.html)。

[Amazon Bedrock 知識庫](https://aws.amazon.com/bedrock/knowledge-bases/)提供建置 RAG 應用程式的完整受管解決方案。它可協助您安全地將企業資料與基礎模型連線。如需更多彈性，您可以使用 [Amazon OpenSearch Service](https://docs.aws.amazon.com/opensearch-service/latest/developerguide/what-is.html) 搭配向量搜尋功能，或者您可以使用 [Amazon Relational Database Service (Amazon RDS) for PostgreSQL](https://docs.aws.amazon.com/AmazonRDS/latest/UserGuide/CHAP_PostgreSQL.html) 搭配 [pgvector](https://github.com/pgvector/pgvector) 延伸模組來存放向量內嵌。

為了有效率的向量操作，請考慮使用 Amazon EC2 運算最佳化執行個體進行內嵌產生。另請考慮使用 [Amazon ElastiCache](https://docs.aws.amazon.com/AmazonElastiCache/latest/dg/WhatIs.html) 快取經常存取的內嵌，以最佳化效能並降低成本。

如需向量資料庫和快取的詳細資訊，請參閱[什麼是向量資料庫？](https://aws.amazon.com/what-is/vector-databases/)以及[為 RAG 使用案例選擇 AWS 向量資料庫](https://docs.aws.amazon.com/prescriptive-guidance/latest/choosing-an-aws-vector-database-for-rag-use-cases/introduction.html)。

## 用於模型訓練和微調的高效能運算基礎設施
<a name="infrastructure-compute"></a>

對於準備好自訂基礎模型的組織， 為模型訓練和微調 AWS 提供全面的基礎設施。您可以使用 Amazon Simple Storage Service (Amazon S3) 作為低成本、可擴展且高耐用性的物件儲存體，用於建置資料平台，以及儲存訓練資料和訓練模型。此外， [AWS Glue](https://docs.aws.amazon.com/glue/latest/dg/what-is-glue.html) 是一種無伺服器資料整合服務，可協助您準備資料以進行模型訓練。

對於訓練基礎設施，[Amazon SageMaker AI ](https://docs.aws.amazon.com/sagemaker/latest/dg/whatis.html)提供全受管的機器學習環境，其中包含建置、訓練和部署模型所需的工具和工作流程。使用 SageMaker AI 可以大幅降低您的營運開銷。請考慮使用[加速運算執行個體](https://docs.aws.amazon.com/ec2/latest/instancetypes/ac.html#ac_hardware)，例如 G 和 P 執行個體系列。這些執行個體系列可讓您從 NVIDIA 存取最新的 GPUs，以進行機器學習訓練和推論。您也可以使用 [AWS Trainium](https://aws.amazon.com/ai/machine-learning/trainium/)，這是專門建置的機器學習加速器，可將訓練時間加速高達 50%，同時降低成本。

對於真正的大型專案，您可以使用 [Amazon EC2 UltraClusters](https://aws.amazon.com/ec2/ultraclusters/)。UltraClusters 由數千個位於指定 AWS 可用區域中並相互連接的加速 Amazon EC2 執行個體組成。UltraClusters 可以擴展到數千個 GPUs 或機器學習加速器。它們提供每秒 exa-floating 點操作 (exaflops) 的彙總運算容量，可減少訓練時間，並可將time-to-solution從數週縮短為幾天。

## 實作建議
<a name="infrastructure-implementation-recs"></a>

請考慮下列建議，為您的生成式 AI 專案設定可擴展且符合成本效益的基礎設施：
+ 若要快速實驗和初始部署，請從 Amazon Bedrock 開始，並為您的應用程式使用一般用途運算執行個體。
+ 隨著您的需求不斷演進，請使用 Amazon Bedrock 知識庫或 Amazon OpenSearch Service 實作向量儲存解決方案。相應地擴展您的基礎設施。
+ 如需進階自訂，請將安全且受管的機器學習環境的佈建標準化並自動化，以支援分散式團隊的需求。如需詳細資訊，請參閱[在 上設定安全且受管良好的機器學習環境 AWS](https://aws.amazon.com/blogs/mt/setting-up-machine-learning-environments-aws/) (AWS 部落格文章）。
+ 採用機器學習操作 (MLOps) 來自動化和標準化整個機器學習生命週期的程序。這些程序包括模型開發、測試、整合、發行和基礎設施管理。如需詳細資訊，請參閱[什麼是 MLOps？](https://aws.amazon.com/what-is/mlops/)
+ 對於小規模實驗或概念驗證，請從 Amazon SageMaker AI 和一般用途運算執行個體開始。當您擴展至大型生產部署時，請考慮使用 Amazon EC2 加速運算執行個體，以獲得最高效能。
+ 與隨需執行個體相比，在 SageMaker AI 中使用[受管 Spot 訓練](https://docs.aws.amazon.com/sagemaker/latest/dg/model-managed-spot-training.html)可將訓練模型的成本最佳化高達 90%。SageMaker AI 會代表您管理 Spot 中斷。