

# 内容领域 4： 操作、监控和保护 ML 与 AI 解决方案
<a name="machine-learning-engineer-associate-02-domain4"></a>

**Topics**
+ [任务 4.1： 监控 ML 与 AI 模型的推理和性能。](#machine-learning-engineer-associate-02-domain4-task1)
+ [任务 4.2： 优化并管理 ML 和 AI 基础设施的成本及性能。](#machine-learning-engineer-associate-02-domain4-task2)
+ [任务 4.3： 保护 ML 和 AI 工作负载以及模型终端节点。](#machine-learning-engineer-associate-02-domain4-task3)

## 任务 4.1： 监控 ML 与 AI 模型的推理和性能。
<a name="machine-learning-engineer-associate-02-domain4-task1"></a>
+ 技能 4.1.1： 使用 Amazon CloudWatch 生成式人工智能可观测性、Amazon Bedrock 模型评估和漂移检测管道，监控生产环境中的模型性能。
+ 技能 4.1.2： 监控工作流，检测数据处理或模型推理中的异常或错误。
+ 技能 4.1.3： 检测可能影响模型性能的数据分布变化。
+ 技能 4.1.4： 使用 A/B 测试监控用于生产的模型的性能。
+ 技能 4.1.5： 监控并自动管理代理的性能和协调任务（例如，协调失败检测、截断的流式传输、工具故障）。
+ 技能 4.1.6： 为基础模型 (FM) 配置特定于 AI 的性能监控，例如 Amazon Bedrock 评估。

## 任务 4.2： 优化并管理 ML 和 AI 基础设施的成本及性能。
<a name="machine-learning-engineer-associate-02-domain4-task2"></a>
+ 技能 4.2.1： 选择推理实例系列来优化性能和成本。
+ 技能 4.2.2： 配置并使用工具来对资源进行分析和故障排除（例如，Amazon CloudWatch、Amazon Bedrock AgentCore Observability、AWS X-Ray）。
+ 技能 4.2.3： 设置控制面板来监控性能指标。
+ 技能 4.2.4： 优化容量来节省成本、提升性能和可靠性。
+ 技能 4.2.5： 使用合适的成本管理工具，优化成本和设置成本配额。
+ 技能 4.2.6： 通过选择购买选项来优化基础设施成本。
+ 技能 4.2.7： 评估在生产环境中使用 FM 进行推理的成本影响。
+ 技能 4.2.8： 监控代理资源使用模式。
+ 技能 4.2.9： 通过使用量优化来管理 FM 推理成本。
+ 技能 4.2.10： 监控特定于 AI 的成本模式（例如，词元使用量优化、嵌入计算成本、向量数据库存储优化）。

## 任务 4.3： 保护 ML 和 AI 工作负载以及模型终端节点。
<a name="machine-learning-engineer-associate-02-domain4-task3"></a>
+ 技能 4.3.1： 通过检查代码和映像漏洞（例如，使用 Amazon CodeGuru、Amazon Inspector），保护持续集成和持续交付 (CI/CD) 管道。
+ 技能 4.3.2： 配置对 ML 和 AI 构件的最低权限访问。
+ 技能 4.3.3： 为 ML 和 AI 系统中的用户及应用程序配置 IAM 策略和角色。
+ 技能 4.3.4： 为 ML 和 AI 系统（例如 AWS CloudTrail、AWS Config）配置全面的监控、审计、合规性和日志记录。
+ 技能 4.3.5： 对 ML 和 AI 系统中的安全问题进行故障排除和调试。
+ 技能 4.3.6： 创建 VPC、子网和安全组来安全地隔离 ML 和 AI 系统。
+ 技能 4.3.7： 识别 ML 和 AI 系统中的安全风险与漏洞并采取缓解措施。
+ 技能 4.3.8： 选择合适的凭证类型来访问 FM（例如，Amazon Bedrock API 密钥、IAM 凭证）。
+ 技能 4.3.9： 实施安全保障和敏感数据保护措施，来满足应用程序要求和负责任的 AI 政策（例如，使用 Amazon Bedrock 防护机制）。