View a markdown version of this page

可靠性和性能监控 AWS CloudHSM - AWS 规范性指导

本文属于机器翻译版本。若本译文内容与英语原文存在差异,则一律以英文原文为准。

可靠性和性能监控 AWS CloudHSM

您可以使用 Amazon CloudWatch Logs 近乎实时地监控您的 AWS CloudHSM 集群。使用 CloudWatch 指标,您可以配置 CloudWatch警报,以便在其中任何指标超过其定义的阈值时提醒您。有关更多信息,请参阅 AWS CloudHSM 文档 AWS CloudHSM中的 “使用 Amazon CloudWatch 日志和 AWS CloudHSM 审核日志” 和 “获取 CloudWatch 指标”。

本节介绍如何为以下指标配置警报,这可以帮助您监控 AWS CloudHSM 集群和硬件安全模块的可靠性状态(HSMs):

运行状况不佳的 HSM 实例(推荐)

HsmUnhealthy指标表明 HSM 实例的性能不正常。该指标的基准值为零。如果该指标大于零,则表示集群 HSMs 中的一个或多个指标未按预期运行。 AWS CloudHSM 自动为您替换运行状况不佳的实例。但是,在 HSM 开始出现意外行为之后和被标记为不健康之前发送的所有请求都将失败。

针对此指标创建警报可帮助您验证运行状况不佳的 HSM 实例是否已成功替换。它还提供了有关应用程序报告的错误的见解,这些错误可能是由不健康的 HSM 造成的。

如果您收到有关此指标的警报,请监控应用程序以确保它能够在短时间内处理故障,并验证在更换 HSM 后它是否仍能按预期运行。

下表显示了此警报的配置值。有关如何设置此警报的说明,请参阅 CloudWatch 日志文档中的基于静态阈值创建 CloudWatch 警报

属性
指标

HsmUnhealthy

命名空间

AWS/CloudHSM

维度

HSM IDcluster ID

Statistic

Maximum

阈值类型

Static

每当持续时间为

Greater/Equal

1

注意

您不能为了测试警报或应用程序性能而使 HSM 运行状况不佳。但是,您可以通过在短时间内屏蔽和解锁应用程序与 HSM 之间的流量来模拟 HSM 故障。要阻止此流量,您可以修改您的安全组网络访问控制列表(网络 ACLs)

HSM 温度

HsmTemperature指标表示硬件处理器的结温。如果温度达到 110 摄氏度,HSM 就会变得不健康。针对此指标的警报可以帮助您预测 HSM 是否会变得不健康。

下表显示了此警报的配置值。有关如何设置此警报的说明,请参阅 CloudWatch 日志文档中的基于静态阈值创建 CloudWatch 警报

属性
指标

HsmTemperature

命名空间

AWS/CloudHSM

维度

HSM IDcluster ID

Statistic

Maximum

阈值类型

Static

每当持续时间为

Greater/Equal

90