View a markdown version of this page

Actualización de la versión del planificador de un clúster en AWS PC - AWS PIEZAS

Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.

Actualización de la versión del planificador de un clúster en AWS PC

AWS El PCS le permite actualizar la versión del programador en un clúster existente sin tener que reconstruir la infraestructura. Las actualizaciones de versión trasladan el controlador del clúster a una versión principal de Slurm más reciente, lo que le permite acceder a nuevas funciones, mejoras de rendimiento y parches de seguridad. Las versiones más recientes también tienen una vida útil de soporte más larga antes de llegar al final de su vida útil.

Descripción general de

La actualización de la versión del programador implica tres operaciones:

  1. Prepare las AMI de destino: cree o identifique las AMI que incluyan la versión de Slurm de destino y el agente de PCS más reciente AWS .

  2. Actualizar el clúster (UpdateCluster): mueve el controlador a la versión principal de Slurm de destino.

  3. Actualizar grupos de nodos de procesamiento (UpdateComputeNodeGroup): apunta cada grupo de nodos de procesamiento a una nueva AMI para que los nuevos nodos usen la versión de destino. Para obtener más información, consulte Actualización de un AWS Grupo de nodos de cómputo PCS.

Hay dos rutas que puede seguir. Elija una opción en función de si puede tolerar la interrupción del trabajo.

Independientemente de la opción que elija, antes de que comience el proceso, todos los nodos del clúster deben ejecutar la misma versión «A» y, al final del proceso, todos los nodos deben ejecutar la misma versión «B». La opción 2 funciona independientemente de la configuración del clúster.

Opción 1: actualización continua Opción 2: parada Full-fleet de mantenimiento
Trabajos en ejecución No requiere la terminación del trabajo Se han terminado todos los trabajos en ejecución
Versión mínima del controlador de clústeres 24.05 Sin restricción
Flota de cómputos tras la actualización del controlador Las versiones se mezclaron temporalmente; se requieren pasos de drenaje. Se recomienda minimizar la cantidad de tiempo durante el cual se usan las versiones mixtas en un clúster. Todos los nodos se inician de cero en la versión de destino
nota

Antes de empezar, asegúrate de que todos los nodos de procesamiento estén en el último parche de la versión A de Slurm y en el agente de AWS PCS más reciente.

Limitaciones

Si tu clúster usa complementos de Spank (configuración de plugstack), AWS PCS no admite la opción 1. Una actualización continua puede provocar que las versiones de configuración del plugstack no coincidan y que se produzcan errores en los complementos.

Compatibilidad de versiones

En la siguiente tabla, se muestran las versiones de destino compatibles a las que actualizar, en función de la versión actual del clúster. Siempre se recomienda actualizar a la última versión permitida (que aparece en negrita).

El clúster y todos los nodos de procesamiento deben ejecutar siempre la misma versión de Slurm antes de iniciar una actualización.

Versión actual del clúster Versiones de destino compatibles
25.11 N/A
25,05 25,11
24.11 (EOL) 25.11, 25.05
24.05 (EOL) 25.11, 25.05, 24.11
23.11 (EL) (solo mediante la opción 2) 25.05, 24.11, 24.05

Para obtener más información sobre las versiones compatibles y las fechas de fin de vida útil, consulte. Versiones de Slurm en AWS PIEZAS

No puede omitir más de tres versiones principales en una sola actualización. Si la versión de destino está más de tres versiones principales por delante de la versión actual, realice la actualización en varios pasos consecutivos. Para ver un ejemplo de varios pasos, consulteEjemplo: actualizar entre varias versiones.

Impacto en los trabajos en ejecución

Durante la actualización, el mando Slurm no estará disponible durante un breve período. Esto tiene las siguientes consecuencias:

  • Trabajos en ejecución: en el caso de la opción 1 (actualización continua), los trabajos que ya se están ejecutando en los nodos de procesamiento siguen ejecutándose. Los nodos de procesamiento no requieren que el controlador esté disponible para la ejecución activa del trabajo. En el caso de la opción 2 (detener el mantenimiento de toda la flota), todos los trabajos en ejecución finalizan cuando se reduce la flota.

  • Envíos de nuevos trabajos: no puede enviar nuevos trabajos ni ejecutar los comandos del programador mientras el controlador no esté disponible.

  • Escalado: el escalado automático se detiene durante la actualización. No se lanza ninguna instancia nueva ni se termina ninguna instancia para reducirla hasta que se complete la actualización.

  • Datos contables: si la contabilidad está habilitada, los datos contables se conservan durante la actualización. Los registros de tareas almacenados en la base de datos de contabilidad se conservan tras el cambio de versión.

  • API REST de Slurm: si la API REST de Slurm está habilitada en el clúster, se actualiza automáticamente a la nueva versión del planificador como parte de la operación. UpdateCluster El punto final de la API REST no está disponible durante la actualización y se reanuda cuando el clúster vuelve al estado. ACTIVE Para obtener más información, consulte La API REST de Slurm en AWS PIEZAS.

Combinar las actualizaciones de la versión con los cambios de configuración

Puede combinar una actualización de versión con otros cambios de configuración en una sola UpdateCluster solicitud. Por ejemplo, puede actualizar la versión del planificador y habilitar la contabilidad en la misma operación.

nota

No añadas ajustes de Slurm específicos para la versión de destino mientras la flota aún contenga los nodos de la versión anterior. La configuración se distribuye a todos los nodos; es slurmd posible que la antigua no reconozca los parámetros nuevos.