

# OPS08-BP04 建立工作负载指标基准
<a name="ops_workload_health_workload_metric_baselines"></a>

为工作负载指标确立基准可以帮助了解工作负载运行状况和性能。您可以使用基准来确定性能不足和性能过剩的应用程序和组件。工作负载基准增强了在问题变成事故之前缓解问题的能力。基准是开发活动模式和在指标偏离预期值时实施异常检测的基础。

 **期望结果：** 
+  在正常情况下，您的工作负载指标达到基准水平。 
+  您可以确定工作负载是否正常运行。 

 **常见反模式：** 
+  部署新功能之后，请求延迟会降低。没有为传入的已处理请求和总体延迟的复合指标确立基准。无法确定变更是会促成改进还是导致出现缺陷。 
+  用户活动突然暴增，但您没有确立指标基准。活动暴增会慢慢地导致应用程序中出现内存泄漏。最终这会使您的工作负载离线。 

 **建立此最佳实践的好处：** 
+  您可以使用关键组件和应用进程的指标了解工作负载的正常活动模式。 
+  您可以确定您的工作负载、其应用程序和组件是否表现正常或可能需要干预。 

 **在未建立这种最佳实践的情况下暴露的风险等级：**中等 

## 实施指导
<a name="implementation-guidance"></a>

 使用历史数据为您的工作负载中应用程序和组件的工作负载指标确立基准。在指标审查会议和故障排查时使用指标基准。定期审查工作负载性能，并随着架构的发展调整基准。 

 **客户示例** 

 在 AnyCompany Retail，为所有组件和应用程序确立基准。AnyCompany Retail 使用历史数据制定其两个月指标时段的工作负载指标基准。他们每两个月重新评估基准，并根据实际数据进行调整。 

 **实施步骤** 

1.  从工作负载指标出发进行反推，使用历史数据确立关键组件和应用程序的指标基准。限制每个组件或应用程序的指标数，避免出现监测疲劳。 

   1.  您可以使用 [Amazon CloudWatch Metrics Insights](https://docs.aws.amazon.com/AmazonCloudWatch/latest/monitoring/query_with_cloudwatch-metrics-insights.html) 大规模查询指标并确定趋势和模式。 

   1.  [Amazon CloudWatch 异常检测](https://docs.aws.amazon.com/AmazonCloudWatch/latest/monitoring/CloudWatch_Anomaly_Detection.html)使用机器学习算法来识别指标的行为模式、确定基准和揭示异常。 

   1.  [Amazon DevOps Guru](https://docs.aws.amazon.com/devops-guru/latest/userguide/welcome.html) 可以使用机器学习检测工作负载的运营问题。 

   1.  购买了 Enterprise Support 服务的客户可以向他们的技术客户经理请求[建立监测策略研讨会](https://aws.amazon.com/premiumsupport/technology-and-programs/proactive-services/)。此研讨会帮助您为工作负载构建可观测性策略。 

1.  建立一种机制，定期审查工作负载指标基准，特别是在发生重要业务事件之前。每季度至少一次使用历史数据评估工作负载指标基准。使用在指标审查会议中商定的基准。 

 **实施计划的工作量级别：**低。确立工作负载指标之后，确立基准可能需要您收集足够的数据来确定正常的行为模式。 

## 资源
<a name="resources"></a>

 **相关最佳实践：** 
+  [OPS08-BP02 定义工作负载指标](ops_workload_health_design_workload_metrics.md) - 在确定基准之前，必须先确立工作负载指标。 
+  [OPS08-BP03 收集和分析工作负载指标](ops_workload_health_collect_analyze_workload_metrics.md) - 在确立指标基准之前，必须先收集和分析工作负载指标。 
+  [OPS08-BP05 了解工作负载的预期活动模式](ops_workload_health_learn_workload_usage_patterns.md) - 此最佳实践建立在基准之上，它是为了形成使用趋势。 
+  [OPS08-BP06 在工作负载成果面临风险时发出提醒](ops_workload_health_workload_outcome_alerts.md) - 需要通过指标基准来确定阈值和形成警报。 
+  [OPS08-BP07 在检测到工作负载异常时发出提醒](ops_workload_health_workload_anomaly_alerts.md) - 异常检测需要确立指标基准。 

 **相关文档：** 
+ [AWS 可观测性最佳实践 - 告警](https://aws-observability.github.io/observability-best-practices/tools/alarms/)
+ [如何高效地监控应用程序](https://aws.amazon.com/startups/start-building/how-to-monitor-applications/)
+ [如何设置 CloudWatch 异常检测以设定动态告警、自动操作和推动在线销售](https://aws.amazon.com/blogs/mt/how-to-set-up-cloudwatch-anomaly-detection-to-set-dynamic-alarms-automate-actions-and-drive-online-sales/)
+ [实施 CloudWatch 异常检测](https://aws.amazon.com/blogs/mt/operationalizing-cloudwatch-anomaly-detection/)

 **相关视频：** 
+ [AWS re:Invent 2020：在亚马逊监控生产服务](https://www.youtube.com/watch?v=hnPcf_Czbvw)
+ [AWS re:Invent 2021 - 使用 CloudWatch Metrics Insights 大规模地从运营指标中获得见解](https://www.youtube.com/watch?v=xKib0xvbIfo)
+ [AWS re:Invent 2022 - 开发可观测性战略（COP302）](https://www.youtube.com/watch?v=Ub3ATriFapQ)
+ [2022 AWS 峰会（DC）- 现代应用程序的监控和可观测性](https://www.youtube.com/watch?v=AHiuyT0B5Gk)
+ [2022 AWS 峰会（SF）- 使用 AWS 实现全栈可观测性和应用程序监控（COP310）](https://www.youtube.com/watch?v=or7uFFyHIX0)

 **相关示例：** 
+ [AWS CloudTrail 和 Amazon CloudWatch 集成研讨会](https://catalog.us-east-1.prod.workshops.aws/workshops/2e48b9fc-f721-4417-b811-962b7f31b61c/en-US)

 **相关服务：** 
+ [ Amazon CloudWatch ](https://docs.aws.amazon.com/AmazonCloudWatch/latest/monitoring/WhatIsCloudWatch.html)
+ [ Amazon DevOps Guru ](https://docs.aws.amazon.com/devops-guru/latest/userguide/welcome.html)