Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Questions fréquemment posées sur le redémarrage de Slurm dans AWS PIÈCES
Trouvez les réponses aux questions les plus fréquentes concernant l'utilisation du redémarrage de Slurm dans AWS PCS.
- Qu'est-ce que l'assistance au redémarrage de Slurm ?
-
Support pour la commande native Slurm.
scontrol rebootUtilisez cette commande pour redémarrer les nœuds de calcul sans remplacement automatique des instances, ce qui préserve la capacité des instances EC2 et réduit les coûts d'exploitation. - Qui peut utiliser les commandes de redémarrage de Slurm ?
-
Seuls les utilisateurs de Slurm Admin (utilisateurs root) peuvent exécuter des commandes de redémarrage. Les utilisateurs réguliers qui tentent d'utiliser
scontrol rebootrecevront une erreur d'autorisation refusée de la part de Slurm sans affecter le nœud. - Qu'arrive-t-il aux tâches en cours d'exécution lors d'un redémarrage ?
-
Par défaut, les tâches se terminent normalement avant le redémarrage. Avec l'option ASAP, le nœud est vidé pour empêcher de nouvelles tâches, et le redémarrage a lieu une fois les tâches en cours terminées. Les tâches peuvent être annulées ou mises en attente pour un redémarrage immédiat.
- En quoi est-ce différent du redémarrage de la console EC2 ?
-
Le redémarrage de Slurm préserve l'instance EC2 et évite le remplacement, tandis que le redémarrage de la console EC2 déclenche le remplacement de l'instance par PCS en raison de l'échec des contrôles de santé lors du processus de redémarrage.
- Puis-je configurer des scripts de redémarrage personnalisés ?
-
Non, RebootProgram la configuration n'est pas prise en charge dans la version initiale. La fonctionnalité utilise le comportement de redémarrage standard de Slurm sans support de script personnalisé.
- Combien de temps dure un redémarrage de Slurm ?
-
Le temps de redémarrage varie en fonction du type d'instance, des processus de démarrage du client, de la configuration de l'AMI et de la nécessité d'effectuer les tâches au préalable. Le processus inclut l'attente de la fin des tâches, le redémarrage physique, les bilans de santé et l'enregistrement du démon slurmd.
- Puis-je consulter l'historique des redémarrages ?
-
Les événements de redémarrage sont enregistrés dans les journaux Slurm (slurmctld et slurmd) qui peuvent être surveillés. CloudWatch Le champ raison de l'état du nœud indique la raison du redémarrage au cours du processus.
- Que se passe-t-il si un nœud se bloque lors du redémarrage ?
-
Si un nœud ne termine pas le processus de redémarrage ResumeTimeout, il sera marqué comme étant en panne. Vérifiez la présence d'erreurs dans les CloudWatch journaux, vérifiez la connectivité réseau et examinez les journaux slurmd. Contactez AWS le support si les problèmes persistent.
- Puis-je redémarrer plusieurs nœuds à la fois ?
-
Oui, vous pouvez spécifier plusieurs nœuds dans la commande de redémarrage :
scontrol reboot ASAP node1,node2,node3 - Comment puis-je redémarrer un nœud sans attendre la fin des tâches ?
-
Pour redémarrer immédiatement les nœuds en cas de problèmes tels que des nœuds problématiques affectant des tâches multi-nœuds, une dégradation significative des performances ou un comportement instable du GPU, vous avez deux options :
-
Annuler et redémarrer — Tout d'abord, annulez les tâches concernées à l'aide de
scancel <job_id>, puis lancez un redémarrage immédiat à l'aide descontrol reboot ASAP <nodename>. Les tâches en cours seront interrompues et devront être soumises à nouveau une fois le nœud restauré. -
Drainage et mise en file d'attente (moins impactant) : commencez par lancer une vidange, puis redémarrez avec
scontrol reboot ASAP <nodename>, puis mettez en file d'attente les tâches concernées à l'aide de.scontrol requeue <job_id>Cela remet les tâches en attente au lieu de les annuler.
-
- Que se passe-t-il si je spécifie NextState=down ?
-
Si vous le spécifiez
nextstate=DOWN, le nœud sera marqué comme étant défectueux après le redémarrage et le remplacement de l'instance de déclenchement. Pour éviter le remplacement d'instance, ne spécifiez ni nextstate ni usenextstate=RESUME.
Ressources supplémentaires
-
Pour les procédures de redémarrage de base, consultezRedémarrer un nœud de calcul à l'aide de Slurm dans AWS PIÈCES.
-
Pour résoudre les problèmes de redémarrage, consultezRésolution des problèmes de redémarrage de Slurm dans AWS PIÈCES.
-
Pour la documentation sur le redémarrage de Slurm, consultez la documentation de Slurm scontrol.