View a markdown version of this page

Reinicia un nodo de procesamiento con Slurm en AWS PC - AWS PIEZAS

Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.

Reinicia un nodo de procesamiento con Slurm en AWS PC

Utilice el comando de reinicio nativo de Slurm para resolver problemas de rendimiento, eliminar problemas de recursos o recuperarse de estados degradados sin perder la capacidad de las instancias EC2.

Requisitos previos

  • Privilegios de administrador de Slurm (acceso de usuario raíz)

  • Acceso a un nodo de inicio de sesión en el AWS clúster PCS

Procedimiento

  1. Conéctese a un nodo de inicio de sesión a través de la consola EC2.

    1. En la consola de EC2, elija Instances (Instancias).

    2. Seleccione la instancia de su nodo de inicio de sesión.

    3. Elija Conectar.

  2. Identifique el nombre del nodo de procesamiento de destino mediante sinfo oscontrol show node.

    sinfo # or scontrol show node
  3. Ejecute el comando de reinicio con una de estas opciones:

    aviso

    No lo utilices nextstate=DOWN con el scontrol reboot comando. Este parámetro marca el nodo como en mal estado y desencadena el reemplazo de la instancia.

    • Reinicio básico (espera a que el nodo quede inactivo):

      scontrol reboot nodename
    • Reinicio inmediato (agota el nodo y se reinicia cuando se completan los trabajos):

      scontrol reboot ASAP nodename
    • Reiniciar con un motivo:

      scontrol reboot ASAP reason="troubleshooting" nodename
    • Reiniciar con el estado de reanudación:

      scontrol reboot ASAP nextstate=RESUME nodename
  4. Supervise el progreso del reinicio utilizandoscontrol show node.

    scontrol show node nodename
  5. Verifique que el nodo vuelva a funcionar una vez finalizado el reinicio.