内容领域 3: ML 和 AI 工作流的部署与编排
任务
任务 3.1: 管理 ML 和 AI 模型类型的部署基础设施。
技能 3.1.1: 选择合适的计算环境和部署目标。
技能 3.1.2: 选择部署编排工具,以及多模型或多容器部署策略。
技能 3.1.3: 选择模型推理策略(例如,实时和批处理)。
技能 3.1.4: 评估并选择合适的基础模型 (FM) 部署选项。
技能 3.1.5: 将在 AWS 之外构建的模型部署到 AWS 环境中(例如,Amazon SageMaker AI、Amazon Bedrock 自定义模型导入)。
技能 3.1.6: 部署和配置用于特定任务的代理、与其他服务和工具的集成以及代理通信协议。
技能 3.1.7: 配置 FM 部署、模型托管和资源分配。
技能 3.1.8: 应用检索增强生成 (RAG) 系统配置(例如,检索策略、重排序)。
任务 3.2: 根据现有架构和要求,为 ML 和 AI 工作负载预置和配置资源。
技能 3.2.1: 优化按需资源与预置资源之间的资源配置,提高性能和成本效益。
技能 3.2.2: 利用堆栈与编排服务之间的集成通信,自动预置计算资源。
技能 3.2.3: 为 ML 和 AI 工作负载构建和维护容器。
技能 3.2.4: 在 VPC 网络环境中配置 SageMaker AI 终端节点。
技能 3.2.5: 以程序化的方式部署和托管模型(例如,使用适用于 Python 的 SageMaker AI SDK、AWS CLI、Boto3)。
技能 3.2.6: 为弹性伸缩实施选择特定指标。
技能 3.2.7: 利用向量数据库配置、文档索引和检索优化等技术,创建和管理 Amazon Bedrock 知识库。
技能 3.2.8: 实施检索管道来满足业务需求。
技能 3.2.9: 实施代理状态管理系统。
技能 3.2.10: 为 GPU 工作负载实施特定于 AI 的资源扩展。
技能 3.2.11: 部署代理工作流基础设施。
任务 3.3: 针对 MLOps 和 AI 工作负载,实施自动编排以及持续集成和持续交付 (CI/CD) 管道。
技能 3.3.1: 实施自动部署策略和回滚操作。
技能 3.3.2: 配置 AWS CodeBuild、AWS CodeCommit、AWS CodeDeploy、AWS CodePipeline 和 AWS CodeConnections 以及进行故障排除。
技能 3.3.3: 配置训练和推理作业。
技能 3.3.4: 在 CI/CD 管道中,为传统 ML 和 AI 工作负载配置自动测试策略。
技能 3.3.5: 构建并集成用于重新训练模型的机制。
技能 3.3.6: 管理模型版本来实现可重复性以及用于审计(例如,SageMaker 模型注册表、SageMaker AI 上的 MLflow)。
技能 3.3.7: 管理提示(例如,Amazon Bedrock 提示管理器)。
技能 3.3.8: 实施自动化的代理部署管道和代理版本管理。
技能 3.3.9: 实施 AI 模型测试框架,包括提示测试。
技能 3.3.10: 配置 FM 部署自动化以及经过微调的模型版本控制。
技能 3.3.11: 针对 RAG 系统更新和知识库更新周期,配置特定于 AI 的管道编排。