

本文属于机器翻译版本。若本译文内容与英语原文存在差异，则一律以英文原文为准。

# 第 1 层：为生成式 AI 构建可靠的数据和计算基础架构
<a name="infrastructure"></a>

对于开发生成式 AI 应用程序，尤其是在需要训练或微调基础模型的情况下，强大的数据基础和计算基础设施至关重要。随着企业踏上生成式人工智能之旅，他们需要能够支持整个机器学习生命周期的基础架构。他们还需要在性能、成本和运营效率之间取得适当的平衡。

可靠的生成式人工智能基础设施应提供以下三个关键组件：基础基础架构、矢量存储和检索基础设施以及计算基础架构。这些组件共同提供了满足任何项目需求的灵活性，无论其规模、要求或环境如何。

**Topics**
+ [基于 API 的实施的基础架构](#infrastructure-foundation)
+ [矢量存储和检索基础设施](#infrastructure-storage)
+ [用于模型训练和微调的高性能计算基础架构](#infrastructure-compute)
+ [实施建议](#infrastructure-implementation-recs)

## 基于 API 的实施的基础架构
<a name="infrastructure-foundation"></a>

大多数组织都是通过使用预训练的基础模型开始其生成式人工智能之旅的。 APIs[Amazon Bedrock](https://docs.aws.amazon.com/bedrock/latest/userguide/what-is-bedrock.html) 通过统一的 API 提供对领先基础模型的无服务器访问。这可以帮助您在不管理复杂基础设施的情况下试验和部署生成式 AI 应用程序。对于这些实现，你需要以下内容：
+ 用于运行应用程序的@@ [亚马逊弹性计算云 (Amazon EC2)](https://docs.aws.amazon.com/AWSEC2/latest/UserGuide/concepts.html) Cloud 通用实例。
+ [亚马逊简单存储服务 (Amazon S3) S](https://docs.aws.amazon.com/AmazonS3/latest/userguide/Welcome.html) ervice 用于存储应用程序数据和输出。
+ [Amazon CloudWatch](https://docs.aws.amazon.com/AmazonCloudWatch/latest/monitoring/WhatIsCloudWatch.html) 用于监控和记录您的应用程序的性能和使用情况。
+ （可选）[AWS Lambda](https://docs.aws.amazon.com/lambda/latest/dg/welcome.html)用于构建事件驱动的生成式 AI 应用程序时的无服务器计算。

## 矢量存储和检索基础设施
<a name="infrastructure-storage"></a>

随着生成式 AI 应用程序的成熟，您可能需要使用特定领域的知识和背景对其进行增强。使用检索增强生成 (RAG)，基础模型在生成响应之前会引用其训练数据源之外的权威数据源，例如组织的数据或文档。有关更多信息，请参阅中的[检索增强生成选项和架构 AWS](https://docs.aws.amazon.com/prescriptive-guidance/latest/retrieval-augmented-generation-options/introduction.html)。

[Amazon Bedrock 知识库](https://aws.amazon.com/bedrock/knowledge-bases/)为构建 RAG 应用程序提供了一种完全托管的解决方案。它可以帮助您将企业数据与基础模型安全地连接起来。[为了获得更大的灵活性，您可以使用具有矢量搜索功能的[亚马逊 OpenSearch 服务](https://docs.aws.amazon.com/opensearch-service/latest/developerguide/what-is.html)，也可以使用带有 pgvector 扩展的 Postgre [SQL 版亚马逊关系数据库服务 (Amazon RDS)](https://docs.aws.amazon.com/AmazonRDS/latest/UserGuide/CHAP_PostgreSQL.html) 来存储矢量嵌入。](https://github.com/pgvector/pgvector)

为了实现高效的矢量操作，可以考虑使用 Amazon EC2 计算优化型实例进行嵌入生成。还可以考虑使用 [Amazon 缓存经常访问的嵌入内容 ElastiCache](https://docs.aws.amazon.com/AmazonElastiCache/latest/dg/WhatIs.html)，以优化性能并降低成本。

有关矢量数据库和缓存的更多信息，请参阅[什么是矢量数据库？](https://aws.amazon.com/what-is/vector-databases/) 以及[为 RAG 用例选择 AWS 矢量数据库](https://docs.aws.amazon.com/prescriptive-guidance/latest/choosing-an-aws-vector-database-for-rag-use-cases/introduction.html)。

## 用于模型训练和微调的高性能计算基础架构
<a name="infrastructure-compute"></a>

对于准备自定义基础模型的组织， AWS 提供用于模型训练和微调的全面基础架构。您可以将 Amazon Simple Storage Service (Amazon S3) 用作低成本、可扩展且高度耐用的对象存储，用于构建数据平台以及存储训练数据和训练模型。此外，还[AWS Glue](https://docs.aws.amazon.com/glue/latest/dg/what-is-glue.html)是一项无服务器数据集成服务，可以帮助您为模型训练准备数据。

对于训练基础设施，[Amazon SageMaker AI](https://docs.aws.amazon.com/sagemaker/latest/dg/whatis.html) 提供了一个完全托管的机器学习环境，其中包含构建、训练和部署模型所需的工具和工作流程。使用 SageMaker AI 可以显著降低您的运营开销。考虑使用[加速计算实例](https://docs.aws.amazon.com/ec2/latest/instancetypes/ac.html#ac_hardware)，例如 G 和 P 实例系列。这些实例系列允许访问来 GPUs 自 NVIDIA 的最新版本，用于机器学习训练和推理。您还可以使用[AWS Trainium](https://aws.amazon.com/ai/machine-learning/trainium/)专门构建的机器学习加速器，可将训练时间缩短多达50％，同时降低成本。

对于真正的大型项目，您可以使用 [Amazon EC2 UltraClusters](https://aws.amazon.com/ec2/ultraclusters/)。 UltraClusters 由成千上万个加速的 Amazon EC2 实例组成，这些实例位于给定 AWS 可用区并相互连接。 UltraClusters 可以扩展到数千个 GPUs 或机器学习加速器。它们提供每秒 exa 浮点运算 (exaflops) 的聚合计算容量，从而缩短了训练时间，并且可以 time-to-solution从几周缩短到几天。

## 实施建议
<a name="infrastructure-implementation-recs"></a>

请考虑以下建议，为您的生成式 AI 项目设置可扩展且具有成本效益的基础架构：
+ 要进行快速实验和初始部署，请从 Amazon Bedrock 开始，为应用程序使用通用计算实例。
+ 随着需求的变化，使用亚马逊 Bedrock 知识库或亚马逊 OpenSearch 服务来实施矢量存储解决方案。相应地扩展您的基础架构。
+ 要进行高级定制，请标准化和自动配置安全且受管控的机器学习环境，以支持分布式团队的需求。有关更多信息，请参阅 AWS（AWS 博客文章）[上的 “设置安全、管理良好的机器学习环境](https://aws.amazon.com/blogs/mt/setting-up-machine-learning-environments-aws/)”。
+ 采用机器学习操作 (MLOps)，在整个机器学习生命周期中实现流程的自动化和标准化。这些流程包括模型开发、测试、集成、发布和基础设施管理。有关更多信息，请参阅[什么是 MLOps？](https://aws.amazon.com/what-is/mlops/)
+ 要进行小规模实验或概念验证，请从 Amazon SageMaker AI 和通用计算实例开始。在扩展到大型生产部署时，可以考虑使用 Amazon EC2 加速计算实例以获得最佳性能。
+ 与按需实例相比，在 SageMaker AI 中使用[托管定点](https://docs.aws.amazon.com/sagemaker/latest/dg/model-managed-spot-training.html)训练可将训练模型的成本优化多达 90%。 SageMaker AI 代表你管理现场干扰。