本文属于机器翻译版本。若本译文内容与英语原文存在差异,则一律以英文原文为准。
在中使用 Slurm 重启计算节点 AWS PCS
使用 Slurm 的原生重启命令来解决性能问题、清除资源问题或在不损失 EC2 实例容量的情况下从降级状态中恢复。
先决条件
-
Slurm 管理员权限(根用户访问权限)
-
访问 AWS PCS 集群中的登录节点
过程
-
通过 EC2 控制台连接到登录节点。
-
在 EC2 控制台中,选择 Instances (实例)。
-
选择您的登录节点实例。
-
选择连接。
-
-
使用
sinfo或识别目标计算节点名称scontrol show node。sinfo # or scontrol show node -
使用以下选项之一执行重启命令:
警告
不要
nextstate=DOWN与该scontrol reboot命令一起使用。此参数将节点标记为运行状况不佳并触发实例替换。-
基本重启(等待节点进入空闲状态):
scontrol rebootnodename -
立即重启(耗尽节点并在任务完成后重新启动):
scontrol reboot ASAPnodename -
重启是有原因的:
scontrol reboot ASAP reason="troubleshooting"nodename -
以恢复状态重启:
scontrol reboot ASAP nextstate=RESUMEnodename
-
-
使用监控重启进度
scontrol show node。scontrol show nodenodename -
验证节点在重启完成后恢复服务。