Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.
Preguntas frecuentes sobre el reinicio de Slurm en AWS PC
Encuentra respuestas a las preguntas más frecuentes sobre el uso de Slurm reboot en PCS. AWS
- ¿Qué es la compatibilidad con el reinicio de Slurm?
-
Soporte para el comando nativo de
scontrol rebootSlurm. Utilice este comando para reiniciar los nodos de procesamiento sin reemplazar automáticamente las instancias, lo que preserva la capacidad de las instancias EC2 y reduce los costos operativos. - ¿Quién puede usar los comandos de reinicio de Slurm?
-
Solo los usuarios administradores de Slurm (usuarios root) pueden ejecutar los comandos de reinicio. Los usuarios habituales que intenten usarlos
scontrol rebootrecibirán un error de denegación de permiso por parte de Slurm sin afectar al nodo. - ¿Qué ocurre con los trabajos en ejecución durante un reinicio?
-
De forma predeterminada, los trabajos finalizan normalmente antes de que se reinicie. Con la opción ASAP, el nodo se vacía para evitar nuevos trabajos y se reinicia una vez finalizados los trabajos actuales. Los trabajos se pueden cancelar o volver a poner en cola para reiniciarlos inmediatamente.
- ¿En qué se diferencia esto del reinicio de la consola EC2?
-
El reinicio de Slurm preserva la instancia EC2 y evita su sustitución, mientras que los reinicios de la consola EC2 hacen que PCS sustituya la instancia debido a que las comprobaciones de estado no se realizan correctamente durante el proceso de reinicio.
- ¿Puedo configurar scripts de reinicio personalizados?
-
No, RebootProgram la configuración no se admite en la versión inicial. La función utiliza el comportamiento de reinicio estándar de Slurm sin soporte para scripts personalizados.
- ¿Cuánto dura un reinicio de Slurm?
-
El tiempo de reinicio varía según el tipo de instancia, los procesos de arranque del cliente, la configuración de la AMI y si los trabajos deben completarse primero. El proceso incluye esperar a que finalicen los trabajos, el reinicio físico, las comprobaciones de estado y el registro de demonios con slurmd.
- ¿Puedo ver el historial de reinicios?
-
Los eventos de reinicio se registran en los registros de Slurm (slurmctld y slurmd), que pueden supervisarse. CloudWatch El campo de motivo del estado del nodo muestra el motivo del reinicio durante el proceso.
- ¿Qué pasa si un nodo se bloquea durante el reinicio?
-
Si un nodo no completa el proceso de reinicio en ese ResumeTimeout momento, se marcará como INACTIVO. Revisa CloudWatch los registros para ver si hay errores, verifica la conectividad de la red y examina los registros de slurmd. Ponte en contacto con AWS el equipo de soporte si los problemas persisten.
- ¿Puedo reiniciar varios nodos a la vez?
-
Sí, puede especificar varios nodos en el comando de reinicio:
scontrol reboot ASAP node1,node2,node3 - ¿Cómo puedo reiniciar un nodo sin esperar a que finalicen los trabajos?
-
Para reiniciar los nodos de forma inmediata cuando surjan problemas, como nodos problemáticos que afectan a trabajos de varios nodos, una degradación significativa del rendimiento o un comportamiento inestable de la GPU, tienes dos opciones:
-
Cancelar y reiniciar: en primer lugar, cancela los trabajos afectados con y
scancel <job_id>, a continuación, inicia un reinicio inmediato con.scontrol reboot ASAP <nodename>Los trabajos en ejecución finalizarán y deberán volver a enviarse una vez que el nodo se recupere. -
Drenar y volver a poner en cola (lo que tiene menos impacto): comience por iniciar un proceso de vaciado, reinicie con y, a continuación
scontrol reboot ASAP <nodename>, vuelva a poner en cola los trabajos afectados utilizando.scontrol requeue <job_id>De este modo, los trabajos vuelven a estar pendientes en lugar de cancelarlos.
-
- ¿Qué ocurre si especifico nextState=down?
-
Si lo especificas
nextstate=DOWN, el nodo se marcará como en mal estado tras el reinicio y se activará el reemplazo de la instancia. Para evitar la sustitución de instancias, no especifiques nextstate ni usenextstate=RESUME.
Recursos adicionales
-
Para conocer los procedimientos básicos de reinicio, consulteReinicia un nodo de procesamiento con Slurm en AWS PC.
-
Para solucionar problemas de reinicio, consulteSolución de problemas de reinicio de Slurm en AWS PC.
-
Para ver la documentación sobre el reinicio de Slurm, consulte la documentación de Slurm scontrol.