View a markdown version of this page

Alarmes groupées - AWS ParallelCluster

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Alarmes groupées

La surveillance de l'état du cluster est essentielle pour garantir des performances optimales. AWS ParallelCluster vous permet de surveiller plusieurs alarmes CloudWatch basées sur le nœud principal du cluster.

Cette section fournit des informations détaillées sur chaque type d'alarmes de cluster de nœuds principaux, notamment ses conventions de dénomination, les conditions spécifiques qui déclenchent les alarmes et les étapes de dépannage suggérées.

La convention de dénomination des alarmes de cluster estCLUSTER_NAME-COMPONENT-METRIC, par mycluster-HeadNode-Cpu ex.

  • CLUSTER_NAME-HeadNode: indique l'état général du nœud principal. Il est rouge si au moins l'une des alarmes ci-dessous l'est.

  • CLUSTER_NAME-HeadNode-Health: rouge s'il y a au moins un échec du bilan de santé Amazon EC2. En cas d'alarme, nous vous suggérons de consulter la section Résoudre les problèmes liés à l'échec des vérifications de statut.

  • CLUSTER_NAME-HeadNode-Cpu: rouge si l'utilisation du processeur est supérieure à 90 %. En cas d'alarme, vérifiez les processus qui consomment le plus de CPUps -aux --sort=-%cpu | head -n 10.

  • CLUSTER_NAME-HeadNode-Mem: rouge si l'utilisation de la mémoire est supérieure à 90 %. En cas d'alarme, vérifiez les processus qui consomment le plus de mémoireps -aux --sort=-%mem | head -n 10.

  • CLUSTER_NAME-HeadNode-Disk: rouge si l'espace disque occupé est supérieur à 90 % sur le chemin /. En cas d'alarme, vérifiez les dossiers qui occupent la plus grande partie de l'espacedu -h --max-depth=2 / 2> /dev/null | sort -hr.