Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
SageMaker HyperPod monitoraggio delle risorse del cluster
Per ottenere un'osservabilità completa delle risorse del SageMaker HyperPod cluster e dei componenti software, integra il cluster con Amazon Managed Service for Prometheus e Amazon Managed Grafana. L'integrazione con Amazon Managed Service for Prometheus consente l'esportazione di metriche relative alle risorse del HyperPod cluster, fornendo informazioni dettagliate sulle loro prestazioni, utilizzo e integrità. L’integrazione con Grafana gestito da Amazon consente la visualizzazione di queste metriche attraverso varie dashboard Grafana che offrono un’interfaccia intuitiva per il monitoraggio e l’analisi del comportamento del cluster. Sfruttando questi servizi, ottieni una visione centralizzata e unificata del tuo HyperPod cluster, facilitando il monitoraggio proattivo, la risoluzione dei problemi e l'ottimizzazione dei carichi di lavoro di formazione distribuiti.
Suggerimento
Per trovare esempi e soluzioni pratiche, consulta anche il workshop. SageMaker HyperPod
Figura: questo diagramma di architettura mostra una panoramica della configurazione SageMaker HyperPod con Amazon Managed Service per Prometheus e Amazon Managed Grafana.
Procedi con i seguenti argomenti per configurare l'osservabilità del cluster. SageMaker HyperPod