Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
Risoluzione dei problemi relativi alle metriche sullo stato del cluster
Le metriche sullo stato del cluster vengono aggiunte alla CloudWatch dashboard di AWS ParallelCluster Amazon a partire dalla AWS ParallelCluster versione 3.6.0. Nelle sezioni seguenti, puoi conoscere le metriche sullo stato della dashboard e le azioni che puoi intraprendere per risolvere i problemi.
Argomenti
Visualizzando il Errori di provisioning delle istanze grafico
Se nel Instance Provisioning Errors grafico viene visualizzato un valore diverso da zero, significa che l'istanza Amazon EC2 per il backup dei nodi slurm non è stata avviata sull'API or. CreateFleet RunInstance
Vedere IAMPolicyErrors
-
Cosa è successo?
Alcune istanze non sono state avviate, a causa di autorizzazioni insufficienti con codice di errore.
UnauthorizedOperation -
Come risolvere?
Se hai configurato un InstanceRole or personalizzato InstanceProfile, controlla le tue policy IAM e verifica di utilizzare le credenziali corrette.
Controlla il
clustermgtdfile per i dettagli sugli errori dei nodi statici. Controllate ilslurm_resume.logfile per i dettagli sugli errori dei nodi dinamici. Usa i dettagli per saperne di più sulle autorizzazioni mancanti che devono essere aggiunte.
Vedere VcpuLimitErrors
-
Cosa è successo?
AWS ParallelCluster non è riuscito ad avviare le istanze perché ha raggiunto il limite di vCPU Account AWS per uno specifico tipo di istanza Amazon EC2 configurato per i nodi di calcolo del cluster.
-
Come risolvere?
Controlla l'
VcpuLimitExceedederrore nelclustermgtdfile per i nodi statici e controlla ilslurm_resume.logfile per i nodi dinamici per ottenere ulteriori dettagli. Per risolvere questo problema, puoi richiedere un aumento dei limiti della tua vCPU. Per ulteriori informazioni su come visualizzare i limiti attuali e richiederne di nuovi, consulta le quote dei servizi Amazon Elastic Compute Cloud nella Amazon Elastic Compute Cloud User Guide for Linux Instances.
Vedere VolumeLimitErrors
-
Cosa è successo?
Hai raggiunto il limite di volume di Amazon EBS sul tuo Account AWS e AWS ParallelCluster non riesci ad avviare istanze con codice
InsufficientVolumeCapacitydi errore o.VolumeLimitExceeded -
Come risolvere?
Controlla il
clustermgtdfile per i nodi statici e controlla ilslurm_resume.logfile per i nodi dinamici per ottenere ulteriori dettagli sui limiti di volume. Per risolvere questo problema, puoi utilizzare un altro volume Regione AWS, ripulire i volumi esistenti, oppure contattare il Centro AWS assistenza per inviare una richiesta di aumento del limite di volume di Amazon EBS.
Vedendo InsufficientCapacityErrors
-
Cosa è successo?
AWS ParallelCluster non ha una capacità sufficiente per avviare istanze Amazon EC2 sui nodi posteriori.
-
Come risolvere?
Controlla il
clustermgtdfile per i nodi statici e controlla ilslurm_resume.logfile per i nodi dinamici per ottenere dettagli sull'errore di capacità insufficiente. Per risolvere il problema, segui le indicazioni all'indirizzo. https://aws.amazon.com/premiumsupport/knowledge-center/ec2-insufficient-capacity-errors/
OtherInstanceLaunchFailures
-
Cosa è successo?
L'istanza Amazon EC2 per il backup dei nodi di calcolo non è stata avviata con l'
CreateFleetAPI or.RunInstance -
Come risolvere?
Controlla il
clustermgtdfile per i nodi statici e controlla ilslurm_resume.logfile per i nodi dinamici per ottenere i dettagli dell'errore.
Vedendo il Errori di istanza non integri grafico
-
Cosa è successo?
Sono state avviate diverse istanze di calcolo, ma successivamente sono state chiuse in quanto non integre.
-
Come risolvere?
Per ulteriori informazioni sulla risoluzione dei problemi relativi ai nodi non integri, vedere. Risoluzione dei problemi relativi alle sostituzioni e alle chiusure impreviste dei nodi
Vedere InstanceBootstrapTimeoutError
-
Cosa è successo?
Un'istanza non può unirsi al cluster all'interno di
resume_timeout(per nodi dinamici) onode_replacement_timeout(per nodi statici). Ciò può verificarsi se la rete non è configurata correttamente per i nodi di calcolo oppure se gli script personalizzati in esecuzione sul nodo di calcolo impiegano troppo tempo per essere completati. -
Come risolvere?
Per i nodi dinamici, controlla il
clustermgtdlog (/var/log/parallelcluster/clustermgtd) per l'indirizzo IP del nodo di calcolo e gli errori come i seguenti:Node bootstrap error: Resume timeout expires for nodePer i nodi statici, controlla il
clustermgtdlog (/var/log/parallelcluster/clustermgtd) per l'indirizzo IP del nodo di calcolo e gli errori come i seguenti:Node bootstrap error: Replacement timeout expires for node ... in replacement.Per ulteriori dettagli, controlla la presenza di errori nel
/var/log/cloud-init-output.logfile. È possibile recuperare gli indirizzi IP dei nodi di calcolo problematici dai file di registroclustermgtdeslurm_resume.
Vedere EC2HealthCheckErrors
-
Cosa è successo?
Un'istanza non ha superato un controllo dello stato di Amazon EC2.
-
Come risolvere?
Per informazioni su come risolvere questo problema, consulta Risoluzione dei problemi relativi alle istanze con controlli di stato non riusciti.
Vedere ScheduledEventHealthCheckErrors
-
Cosa è successo?
Un'istanza non ha superato un controllo dello stato degli eventi pianificati di Amazon EC2 e non è integra.
-
Come risolvere?
Per informazioni su come risolvere questo problema, consulta Eventi pianificati per le tue istanze.
Vedere NoCorrespondingInstanceErrors
-
Cosa è successo?
AWS ParallelCluster non riesco a trovare le istanze che supportano i nodi. È probabile che i nodi si siano interrotti automaticamente durante le operazioni di bootstrap. SlurmQueues/CustomActions/OnNodeStart| possono verificarsi errori di OnNodeConfigured script o di rete.
NoCorrespondingInstanceErrors -
Come risolvere?
Per ulteriori dettagli, controlla
/var/log/cloud-init-output.logil nodo di calcolo.
Vedendo il Calcola il tempo di inattività della flotta grafico
Vederne uno MaxDynamicNodeIdleTime che è significativamente più lungo del Riduzione del tempo di inattività threshold
-
Cosa è successo?
La tua istanza non sta terminando correttamente.
MaxDynamicNodeIdleTimemostra il tempo massimo in secondi di inattività di un nodo dinamico, supportato da un'istanza Amazon EC2. La soglia di Idle Time Scaledown è derivata dal parametro di configurazione del cluster. ScaledownIdletime Quando un nodo di calcolo è rimasto inattivo per più di Idle Time Scaledown, spegne il nodo e termina l'istanza di Slurm backup. AWS ParallelCluster In questo caso, qualcosa impedisce la chiusura dell'istanza. -
Come risolvere?
Per ulteriori informazioni su questo problema, vedere Sostituzione, chiusura o spegnimento di istanze e nodi problematici inRisoluzione dei problemi di scalabilità.