Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Redémarrer des nœuds de calcul avec Slurm dans AWS PIÈCES
AWS PCS prend en charge la commande native scontrol reboot de Slurm. Utilisez cette commande pour redémarrer les nœuds de calcul sans remplacer l'instance EC2. D'autres méthodes de redémarrage (console Amazon EC2 AWS CLI, correctifs automatisés ou maintenance du système) amènent AWS PCS à considérer l'instance EC2 comme défectueuse et à la remplacer.
Avantages du redémarrage de Slurm
Le redémarrage de Slurm offre plusieurs avantages pour la maintenance du cluster :
-
Préservez la capacité : évitez de perdre des instances EC2 à capacité limitée au profit d'autres clients.
-
Réduisez les coûts : éliminez les cycles de remplacement inutiles des instances et la facturation continue des nœuds inactifs.
-
Restauration plus rapide : aucun retard de provisionnement par rapport au remplacement de l'instance.
-
Flexibilité opérationnelle : effacez les fuites de mémoire, supprimez les fichiers temporaires et restaurez les nœuds en cas de dégradation.
Quand utiliser le redémarrage de Slurm
Utilisez Slurm reboot pour les scénarios de maintenance opérationnelle courants :
-
Résolution des problèmes : résolvez les problèmes de performances ou les processus qui ne répondent pas, en particulier pour les nœuds GPU.
-
Nettoyage des ressources : effacez les fuites de mémoire, les fichiers temporaires ou les processus bloqués qui affectent les performances des tâches.
/tmp -
Restauration : restaurez les nœuds bloqués ou dégradés avant de demander le remplacement complet des nœuds.
Limitations
-
Seuls les utilisateurs de Slurm Admin (utilisateurs root) peuvent exécuter des commandes de redémarrage.
-
La prise en charge du redémarrage est
scontrol rebootlimitée à. -
RebootProgram la configuration n'est pas prise en charge.
-
Aucune interface de console, ligne de commande uniquement.