View a markdown version of this page

Slurm reboot 中的常见问题解答 AWS 个 - AWS 个

本文属于机器翻译版本。若本译文内容与英语原文存在差异,则一律以英文原文为准。

Slurm reboot 中的常见问题解答 AWS 个

查找有关在 PCS 中 AWS 使用 Slurm 重启的常见问题的答案。

什么是 Slurm 重启支持?

支持原生 Slurm 命令scontrol reboot。使用此命令可在不自动更换实例的情况下重启计算节点,从而保留 EC2 实例容量并降低运营成本。

谁可以使用 Slurm 重启命令?

只有 Slurm 管理员用户(根用户)才能执行重启命令。尝试使用的普通用户scontrol reboot将在不影响节点的情况下收到来自 Slurm 的权限拒绝错误。

重启期间正在运行的作业会发生什么?

默认情况下,任务在重新启动之前正常完成。如果使用 ASAP 选项,则会耗尽节点以防止出现新任务,并且会在当前任务完成后重新启动。可以取消作业,也可以要求立即重启作业。

这与 EC2 控制台重启有何不同?

Slurm 重启可以保留 EC2 实例并避免更换,而 EC2 控制台重启会因重启过程中运行状况检查失败而触发 PC 替换实例。

我可以配置自定义重启脚本吗?

不,初始版本不支持 RebootProgram 配置。该功能使用标准的 Slurm 重启行为,不支持自定义脚本。

重启 Slurm 需要多长时间?

重启时间因实例类型、客户启动进程、AMI 配置以及任务是否需要先完成而异。该过程包括等待任务完成、物理重启、运行状况检查和 slurmd 守护程序注册。

我能看到重启的历史吗?

重启事件记录在 Slurm 日志(slurmctld 和 slurmd)中,可以通过这些日志(slurmctld 和 slurmd)进行监控。 CloudWatch节点状态中的原因字段显示了该过程中的重启原因。

如果节点在重启期间卡住了怎么办?

如果节点未在其中完成重启过程 ResumeTimeout,则会将其标记为 DOWN。检查 CloudWatch 日志中是否存在错误,验证网络连接,并检查 slurmd 日志。如果问题仍然存在,请联系 AWS 支持部门。

我可以一次重启多个节点吗?

是的,你可以在 reboot 命令中指定多个节点:

scontrol reboot ASAP node1,node2,node3
如何在不等待任务完成的情况下重启节点?

要在遇到影响多节点任务、严重性能下降或 GPU 行为不稳定等问题时立即重启节点,有两种选择:

  • 取消并重新启动 — 首先,使用取消受影响的作业scancel <job_id>,然后使用启动立即重启scontrol reboot ASAP <nodename>。正在运行的任务将终止,需要在节点恢复后重新提交。

  • Drain and Requeue(影响较小)— 首先启动排空并使用重新启动scontrol reboot ASAP <nodename>,然后使用重新排列受影响的任务。scontrol requeue <job_id>这会使任务恢复到待处理状态,而不是将其取消。

如果我指定 nextState=down 会发生什么?

如果您指定nextstate=DOWN,则在重启并触发实例替换后,该节点将被标记为运行状况不佳。为避免替换实例,请勿指定 nextstate 或使用nextstate=RESUME

其他资源