

本文属于机器翻译版本。若本译文内容与英语原文存在差异，则一律以英文原文为准。

# 韧性在 ROSA
<a name="disaster-recovery-resiliency"></a>

## AWS 全球基础设施弹性
<a name="disaster-recovery-resiliency-infra"></a>

 AWS 全球基础设施是围绕 AWS 区域 可用区构建的。 AWS 区域 提供多个物理分隔和隔离的可用区，这些可用区通过低延迟、高吞吐量和高度冗余的网络连接。利用可用区，您可以设计和操作在可用区之间无中断地自动实现失效转移的应用程序和数据库。与传统的单个或多个数据中心基础设施相比，可用区具有更高的可用性、容错能力和可扩展性。

 ROSA 为客户提供了在单个 AWS 可用区或跨多个可用区运行 Kubernetes 控制平面和数据平面的选项。虽然单可用区集群可用于实验，但我们鼓励客户在多个可用区中运行其工作负载。这样可以确保应用程序甚至可以承受整个可用区故障（非常罕见的事件）。

有关 AWS 区域 和可用区的更多信息，请参阅[AWS 全球基础设施](https://aws.amazon.com/about-aws/global-infrastructure/)。

## ROSA 集群弹性
<a name="disaster-recovery-resiliency-cluster"></a>

 ROSA 控制平面由至少三个 OpenShift 控制平面节点组成。每个控制面板节点都由一个 API 服务器实例、一个 `etcd` 实例和控制器组成。如果控制面板节点出现故障，所有 API 请求都会自动路由到其他可用节点，以确保集群可用性。

 ROSA 数据平面由至少两个 OpenShift 基础架构节点和两个 OpenShift 工作节点组成。基础设施节点运行的 pod 支持 OpenShift 集群基础设施组件，例如默认路由器、内置 OpenShift 注册表以及用于集群指标和监控的组件。 OpenShift 工作节点运行最终用户应用程序 pod。

红帽站点可靠性工程师 (SREs) 全面管理控制平面和基础架构节点。红帽会 SREs 主动监控 ROSA 集群，并负责更换所有出现故障的控制平面节点和基础设施节点。有关更多信息，请参阅 [的职责概述 ROSA](rosa-responsibilities.md)。

**重要**  
由于 ROSA 是一项托管服务，因此红帽负责管理所 ROSA 使用的底层 AWS 基础架构。客户不应尝试通过 AWS 控制台或手动关闭 ROSA 使用的 Amazon EC2 实例 AWS CLI。此操作可能会导致客户数据丢失。

如果 Worker 节点在数据面板上出现故障，则控制面板会将未调度的容器组（pod）重新定位到正常运行的 Worker 节点，直到故障节点恢复或替换。可以手动替换故障的 Worker 节点，也可以通过启用集群中计算机的自动扩展来自动替换。有关更多信息，请参阅 Red Hat 文档中的[集群自动扩展](https://access.redhat.com/documentation/en-us/red_hat_openshift_service_on_aws/4/html/cluster_administration/rosa-cluster-autoscaling)。

## 客户部署的应用程序恢复能力
<a name="disaster-recovery-resiliency-app"></a>

尽管 ROSA 提供了许多保护措施来确保服务的高可用性，但客户有责任构建其部署的应用程序以实现高可用性，以保护工作负载免受停机影响。有关更多信息，请参阅 Red Hat 文档中的[关于 ROSA的可用性](https://access.redhat.com/documentation/en-us/red_hat_openshift_service_on_aws/4/html/introduction_to_rosa/policies-and-service-definition#about-availability-for-rosa)。