Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Meilleures pratiques en matière d'observabilité des EMR
L'observabilité des EMR englobe une approche complète de surveillance et de gestion des clusters AWS EMR. La base repose sur Amazon CloudWatch en tant que principal service de surveillance, complété par EMR Studio et des outils tiers tels que Prometheus et Grafana pour une visibilité accrue. Dans ce document, nous explorons des aspects spécifiques de l'observabilité des clusters :
-
Observabilité de Spark
(GitHub) : en ce qui concerne l'interface utilisateur de Spark, Amazon EMR propose trois options. -
Résolution des problèmes liés à Spark
(GitHub) : résolution des erreurs. -
Surveillance du cluster EMR
(GitHub) : surveillance des performances du cluster. -
Résolution des problèmes d'EMR
(GitHub) : identifiez, diagnostiquez et résolvez les problèmes courants liés aux clusters EMR. -
Optimisation des coûts
(GitHub) — Cette section décrit les meilleures pratiques pour gérer des charges de travail rentables.
Outil d'optimisation des performances pour les applications Apache Spark
-
AWS
L'outil EMR Advisor analyse les journaux d'événements de Spark afin de fournir des recommandations personnalisées pour optimiser les configurations des clusters EMR, améliorer les performances et réduire les coûts. En exploitant les données historiques, il suggère des tailles d'exécuteurs et des paramètres d'infrastructure idéaux, permettant une utilisation plus efficace des ressources et une amélioration des performances globales du cluster. -
https://github.com/amzn/amazon-codeguru-profiler-for-spark
L'outil Amazon CodeGuru Profiler aide les développeurs à identifier les problèmes de performances et les inefficacités de leurs applications Spark en collectant et en analysant les données d'exécution. L'outil s'intègre parfaitement aux applications Spark existantes, ne nécessitant qu'une configuration minimale, et fournit des informations détaillées via la AWS console sur l'utilisation du processeur, les modèles de mémoire et les points chauds de performances.