Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Remplacement des nœuds défectueux par Amazon EMR
Amazon EMR utilise régulièrement le service de vérification de l'
Note
L'une des raisons courantes pour lesquelles un nœud est défectueux est qu'il manque d'espace disque. Pour plus d'informations sur les situations où un nœud principal manque presque d'espace disque, l'article suivant du centre de connaissances Re:POST est utile : Pourquoi le nœud principal de mon cluster Amazon EMR manque-t-il d'espace disque ?
Note
Hadoop permet d'exécuter des contrôles personnalisés de l'état des nœuds. Ceci est expliqué plus en détail dans la documentation d'Apache Hadoop à l'adresse. NodeManager
Vous pouvez choisir si Amazon EMR doit mettre fin aux nœuds défectueux ou les conserver dans le cluster. Si vous désactivez le remplacement des nœuds défectueux, ils restent dans la liste des nœuds refusés et continuent à être pris en compte dans la capacité du cluster. Vous pouvez toujours vous connecter à votre instance principale Amazon EC2 pour la configuration et la restauration. Vous pouvez donc redimensionner votre cluster si vous souhaitez ajouter de la capacité. Pour plus d'informations sur le fonctionnement du remplacement et de la terminaison des nœuds, consultez la section Utilisation de la protection contre la résiliation.
Si le remplacement des nœuds défectueux est activé, Amazon EMR met fin à un nœud principal défectueux et provisionne une nouvelle instance, en fonction du nombre d'instances du groupe d'instances ou en fonction de la capacité cible pour les parcs d'instances. Si l'un des nœuds est défectueux pendant plus de 45 minutes, Amazon EMR les remplacera gracieusement. Si la mise hors service progressive d'un nœud n'est pas terminée dans un délai d'une heure, le nœud est arrêté de force, sauf si cette fermeture amène le cluster à un niveau inférieur au facteur de réplication ou aux contraintes de capacité HDFS.
Important
Notez que le temps nécessaire pour qu'un nœud soit correctement mis hors service ou mis hors service peut être sujet à modification.
Bien que le remplacement défectueux des nœuds atténue de manière significative les risques de perte de données, il n'élimine pas complètement le risque. Les données HDFS peuvent être définitivement perdues lors du remplacement progressif d'une instance principale défectueuse. Nous vous recommandons de toujours sauvegarder vos données.
Pour plus d'informations sur l'identification des nœuds défectueux et la restauration, consultez la section Erreurs liées aux ressources. En outre, pour en savoir plus sur les meilleures pratiques que vous pouvez suivre afin de préserver la santé d'un cluster, consultez la documentation suivante concernant l'erreur de ressource « Le cluster Amazon EMR se termine par NO_SLAVE_LEFT » et les nœuds principaux FAILED_BY_MASTER.
Amazon EMR publie Amazon CloudWatch Events pour le remplacement de nœuds défectueux, afin que vous puissiez suivre ce qui se passe avec vos instances principales défectueuses. Pour plus d'informations, consultez la section Événements de remplacement de nœuds défectueux.
Paramètres de protection par défaut pour le remplacement et la terminaison des nœuds
Le remplacement des nœuds défectueux est disponible pour toutes les versions d'Amazon EMR, mais les paramètres par défaut dépendent de l'étiquette de version que vous choisissez. Vous pouvez modifier n'importe lequel de ces paramètres en configurant le remplacement des nœuds défectueux lors de la création d'un nouveau cluster ou en accédant à la section Configuration du cluster à tout moment.
Si vous créez un cluster à nœud unique ou un cluster à haute disponibilité qui exécute Amazon EMR version 7.0 ou antérieure, le paramètre par défaut de remplacement de nœud défectueux dépend de la protection contre les interruptions :
L'activation de la protection contre les terminaisons désactive le remplacement des nœuds défectueux.
La désactivation de la protection contre les terminaisons permet le remplacement des nœuds défectueux.
Configuration du remplacement d'un nœud défectueux lorsque vous lancez un cluster
Vous pouvez activer ou désactiver le remplacement de nœuds défectueux lorsque vous lancez un cluster à l'aide de la console, de l' AWS CLI API ou de l'API.
Le paramètre de remplacement des nœuds défectueux par défaut dépend de la manière dont vous lancez le cluster :
-
Console Amazon EMR : le remplacement des nœuds défectueux est activé par défaut.
-
AWS CLI
aws emr create-cluster— le remplacement des nœuds défectueux est activé par défaut, sauf indication contraire de votre part--no-unhealthy-node-replacement. -
Commande d'RunJobFlow API Amazon EMR : le remplacement défectueux des nœuds est activé par défaut, sauf si vous définissez la valeur
UnhealthyNodeReplacementbooléenne sur ou.TrueFalse
Configuration du remplacement de nœuds défectueux dans un cluster en cours d'exécution
Vous pouvez activer ou désactiver le remplacement des nœuds défectueux pour un cluster en cours d'exécution à l'aide de la console AWS CLI, de l'API ou de l'API.