Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.
Reinicia un nodo de procesamiento con Slurm en AWS PC
Utilice el comando de reinicio nativo de Slurm para resolver problemas de rendimiento, eliminar problemas de recursos o recuperarse de estados degradados sin perder la capacidad de las instancias EC2.
Requisitos previos
-
Privilegios de administrador de Slurm (acceso de usuario raíz)
-
Acceso a un nodo de inicio de sesión en el AWS clúster PCS
Procedimiento
-
Conéctese a un nodo de inicio de sesión a través de la consola EC2.
-
En la consola de EC2, elija Instances (Instancias).
-
Seleccione la instancia de su nodo de inicio de sesión.
-
Elija Conectar.
-
-
Identifique el nombre del nodo de procesamiento de destino mediante
sinfooscontrol show node.sinfo # or scontrol show node -
Ejecute el comando de reinicio con una de estas opciones:
aviso
No lo utilices
nextstate=DOWNcon elscontrol rebootcomando. Este parámetro marca el nodo como en mal estado y desencadena el reemplazo de la instancia.-
Reinicio básico (espera a que el nodo quede inactivo):
scontrol rebootnodename -
Reinicio inmediato (agota el nodo y se reinicia cuando se completan los trabajos):
scontrol reboot ASAPnodename -
Reiniciar con un motivo:
scontrol reboot ASAP reason="troubleshooting"nodename -
Reiniciar con el estado de reanudación:
scontrol reboot ASAP nextstate=RESUMEnodename
-
-
Supervise el progreso del reinicio utilizando
scontrol show node.scontrol show nodenodename -
Verifique que el nodo vuelva a funcionar una vez finalizado el reinicio.