

기계 번역으로 제공되는 번역입니다. 제공된 번역과 원본 영어의 내용이 상충하는 경우에는 영어 버전이 우선합니다.

# 운영 우수성 요소
<a name="operational-excellence"></a>

 AWS Well-Architected Framework의 [운영 우수](https://docs.aws.amazon.com/wellarchitected/latest/framework/operational-excellence.html)성 원칙은 시스템을 실행 및 모니터링하고 비즈니스 가치를 제공하기 위해 프로세스와 절차를 지속적으로 개선하는 데 중점을 둡니다. 운영 우수성 원칙에는 개발 및 워크로드를 효과적으로 지원하고 운영에 대한 인사이트를 얻을 수 있는 기능이 포함됩니다.

사람의 개입 없이 대부분의 문제를 감지하고 해결하는 자가 복구 워크로드를 통해 운영 복잡성을 줄일 수 있습니다. 이 목표를 달성하려면이 섹션에 설명된 모범 사례를 따르세요. Amazon Timestream for InfluxDB, InfluxDB 네이티브 지표 엔드포인트, APIs 및 메커니즘에 대한 Amazon [Amazon CloudWatch](https://docs.aws.amazon.com/AmazonCloudWatch/latest/monitoring/WhatIsCloudWatch.html) 지표를 사용하여 워크로드가 예상 동작과 다를 때 대응할 수 있습니다.

운영 우수성 원칙에 대한 이 논의는 다음 핵심 영역에 중점을 둡니다.
+ 코드형 인프라(IaC)
+ 변경 관리
+ 복원력 전략
+ 인시던트 관리
+ 감사 목적으로 로깅 및 모니터링

## IaC 접근 방식을 사용하여 배포 자동화
<a name="iac"></a>

IaC를 사용하여 Timestream for InfluxDB에서 배포를 자동화하는 모범 사례는 다음과 같습니다.
+ 가능하면 IaC를 적용하여 InfluxDB용 Timestream을 배포합니다. 일관된 환경 구성을 위해 [AWS CloudFormation](https://docs.aws.amazon.com/AWSCloudFormation/latest/UserGuide/Welcome.html) 템플릿, [AWS Cloud Development Kit (AWS CDK)](https://docs.aws.amazon.com/cdk/v2/guide/home.html)또는 [HashiCorp Terraform](https://aws.amazon.com/blogs/apn/terraform-beyond-the-basics-with-aws/)을 사용하여 인스턴스에 필요한 모든 리소스를 생성합니다.
+ 인스턴스 크기 조정과 같은 Timestream for InfluxDB 운영 절차를 자동화합니다.
+ 태그를 사용하여 Timestream for InfluxDB 리소스에 메타데이터를 추가하고 태그를 기반으로 사용량을 추적합니다. 자세한 내용은 [ InfluxDB용 Amazon Timestream 태그 지정](https://docs.aws.amazon.com/timestream/latest/developerguide/tagging-keyspaces-influxdb.html)을 참조하세요.

## 되돌릴 수 있는 소규모 변경 자주 적용
<a name="change-management"></a>

다음 권장 사항은 복잡성을 최소화하고 워크로드 중단 가능성을 줄이기 위해 작고 되돌릴 수 있는 변경 사항에 중점을 둡니다.
+ IaC 템플릿 및 스크립트를 GitHub 또는 GitLab과 같은 소스 제어 서비스에 저장합니다. 소스 제어에 AWS 자격 증명을 저장하지 마십시오.
+ IaC 배포에서 [AWS CodeDeploy](https://docs.aws.amazon.com/codedeploy/latest/userguide/welcome.html) 또는 [AWS CodeBuild](https://docs.aws.amazon.com/codebuild/latest/userguide/welcome.html)와 같은 지속적 통합 및 지속적 전송(CI/CD) 서비스를 사용해야 합니다. 이러한 서비스는 프로덕션 InfluxDB 인스턴스에 영향을 미치기 전에 임시 InfluxDB 인스턴스가 포함된 비프로덕션 환경에서 코드를 컴파일, 테스트 및 배포합니다.
+ 인프라 및 애플리케이션 쿼리를 프로덕션에 배포하기 전에 더 하위 환경에서 테스트합니다. 이를 통해 중단 가능성을 최소화하고 워크로드 및 규모에 맞게 원활하게 작동할 수 있습니다.

## 실패 예상
<a name="resilience"></a>

자가 복구 인프라는 장애를 예상하고 개입 없이 문제를 해결하려고 시도하며 운영 우수성을 보여줍니다. 다음 권장 사항은 Timestream for InfluxDB를 사용하여 이러한 성숙도를 달성하는 데 도움이 됩니다.
+ 지표를 사용하여 메모리, CPU 및 스토리지 사용량을 모니터링합니다. CloudWatch를 설정하여 사용 패턴이 변경되거나 배포 용량에 도달하면 알림을 받을 수 있습니다. 이렇게 하면 시스템 성능 및 가용성을 유지할 수 있습니다.
+ 리소스 제한에 가까워지면 DB 인스턴스를 확장합니다. 스토리지 및 메모리에 어느 정도 버퍼가 있어야만 애플리케이션에서 수요가 예기치 않게 늘어날 경우 이를 수용할 수 있습니다.
+ 데이터베이스 작업량으로 인해 프로비저닝한 I/O보다 많이 필요할 경우 장애 조치 또는 데이터베이스 오류가 발생한 후에 복구 속도가 느려집니다. DB 인스턴스의 I/O 용량을 늘리려면 I/O 용량이 더 높은 다른 DB 인스턴스로 마이그레이션합니다.
+ 클라이언트 애플리케이션이 DB 인스턴스의 DNS 데이터를 캐싱하는 경우 TTL(time-to-live) 값을 30초 미만으로 설정합니다. 장애 조치 후에 DB 인스턴스의 기본 IP 주소가 변경될 수 있습니다. DNS 데이터를 장기간 캐싱하면 연결에 실패할 수 있습니다. 애플리케이션이 더 이상 사용되지 않는 IP 주소에 연결을 시도할 수 있습니다.
+ 애플리케이션에서 완전한 AWS 리전 중단 상태를 유지해야 하는 경우 재해 복구(DR) 계획의 일부로 복제를 설정하거나 다른 리전에 쓰는 것이 좋습니다. 복제를 설정하는 동안 제한 사항을 이해합니다. 복제에 대한 자세한 내용은 [InfluxDB 설명서를](https://docs.influxdata.com/influxdb/cloud/write-data/replication/replicate-data/) 참조하세요.

## 모든 운영 장애로부터 학습
<a name="incident-management"></a>

자가 복구 인프라는 드문 문제가 발생하거나 응답이 원하는 만큼 효과적이지 않을 때 반복하여 개발하는 장기적인 작업입니다. 자가 복구 인프라 달성에 집중하려면 다음 사례를 채택하십시오.
+ 모든 장애로부터 학습하여 개선을 주도합니다.
+ 조직과 여러 팀에서 학습한 내용을 공유합니다. 조직 내 여러 팀이 Timestream for InfluxDB를 사용하는 경우 공통 채팅룸 또는 사용자 그룹을 생성하여 학습한 내용과 모범 사례를 공유합니다.

## 로깅 기능을 사용하여 무단 또는 비정상적인 활동 모니터링
<a name="logging-monitoring"></a>

비정상적인 성능 및 활동 패턴을 관찰하려면 다음 사례를 고려하세요.
+ 로그 [전송](https://docs.aws.amazon.com/timestream/latest/developerguide/timestream-for-influx-managing-view-influx-logs.html)을 활성화하여 Amazon [Simple Storage Service(Amazon S3)](https://docs.aws.amazon.com/AmazonS3/latest/userguide/Welcome.html)에 InfluxDB 로그를 저장합니다. InfluxDB는 다음을 확인하는 데 도움이 될 수 있는 정보를 기록합니다.
  + [데이터 영역 API 이벤트](https://docs.influxdata.com/influxdb/v2/reference/api/)
  + 응답 시간
  + 압축 세부 정보
  + 시스템에서 발생하는 모든 심각한 오류 또는 경고

  로그에 무단 액세스 또는 이상이 있는지 검토합니다. 전반적으로 로깅은 문제 해결을 위한 진단 정보를 제공합니다.
+ InfluxDB용 Timestream은를 사용하여 컨트롤 플레인 작업 로깅을 지원합니다 AWS CloudTrail. 자세한 내용은 [를 사용하여 InfluxDB API 호출에 Timestream 로깅 AWS CloudTrail](https://docs.aws.amazon.com/timestream/latest/developerguide/logging-using-cloudtrail-influxdb.html)을 참조하세요.
+ CloudWatch의 **Timestream/InfluxDB >** <**Namespace**>에서 `CPUUtilization``MemoryUtilization`, 및 `DiskUtilization` 지표를 모니터링할 수 있습니다.

자세한 내용은 [Timestream for InfluxDB 설명서를](https://docs.aws.amazon.com/timestream/latest/developerguide/monitoring-influxdb.html) 참조하세요.