内容领域 4: 操作、监控和保护 ML 与 AI 解决方案
任务 4.1: 监控 ML 与 AI 模型的推理和性能。
技能 4.1.1: 使用 Amazon CloudWatch 生成式人工智能可观测性、Amazon Bedrock 模型评估和漂移检测管道,监控生产环境中的模型性能。
技能 4.1.2: 监控工作流,检测数据处理或模型推理中的异常或错误。
技能 4.1.3: 检测可能影响模型性能的数据分布变化。
技能 4.1.4: 使用 A/B 测试监控用于生产的模型的性能。
技能 4.1.5: 监控并自动管理代理的性能和协调任务(例如,协调失败检测、截断的流式传输、工具故障)。
技能 4.1.6: 为基础模型 (FM) 配置特定于 AI 的性能监控,例如 Amazon Bedrock 评估。
任务 4.2: 优化并管理 ML 和 AI 基础设施的成本及性能。
技能 4.2.1: 选择推理实例系列来优化性能和成本。
技能 4.2.2: 配置并使用工具来对资源进行分析和故障排除(例如,Amazon CloudWatch、Amazon Bedrock AgentCore Observability、AWS X-Ray)。
技能 4.2.3: 设置控制面板来监控性能指标。
技能 4.2.4: 优化容量来节省成本、提升性能和可靠性。
技能 4.2.5: 使用合适的成本管理工具,优化成本和设置成本配额。
技能 4.2.6: 通过选择购买选项来优化基础设施成本。
技能 4.2.7: 评估在生产环境中使用 FM 进行推理的成本影响。
技能 4.2.8: 监控代理资源使用模式。
技能 4.2.9: 通过使用量优化来管理 FM 推理成本。
技能 4.2.10: 监控特定于 AI 的成本模式(例如,词元使用量优化、嵌入计算成本、向量数据库存储优化)。
任务 4.3: 保护 ML 和 AI 工作负载以及模型终端节点。
技能 4.3.1: 通过检查代码和映像漏洞(例如,使用 Amazon CodeGuru、Amazon Inspector),保护持续集成和持续交付 (CI/CD) 管道。
技能 4.3.2: 配置对 ML 和 AI 构件的最低权限访问。
技能 4.3.3: 为 ML 和 AI 系统中的用户及应用程序配置 IAM 策略和角色。
技能 4.3.4: 为 ML 和 AI 系统(例如 AWS CloudTrail、AWS Config)配置全面的监控、审计、合规性和日志记录。
技能 4.3.5: 对 ML 和 AI 系统中的安全问题进行故障排除和调试。
技能 4.3.6: 创建 VPC、子网和安全组来安全地隔离 ML 和 AI 系统。
技能 4.3.7: 识别 ML 和 AI 系统中的安全风险与漏洞并采取缓解措施。
技能 4.3.8: 选择合适的凭证类型来访问 FM(例如,Amazon Bedrock API 密钥、IAM 凭证)。
技能 4.3.9: 实施安全保障和敏感数据保护措施,来满足应用程序要求和负责任的 AI 政策(例如,使用 Amazon Bedrock 防护机制)。