Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.
Actualización de la versión del planificador de un clúster en AWS PC
AWS El PCS le permite actualizar la versión del programador en un clúster existente sin tener que reconstruir la infraestructura. Las actualizaciones de versión trasladan el controlador del clúster a una versión principal de Slurm más reciente, lo que le permite acceder a nuevas funciones, mejoras de rendimiento y parches de seguridad. Las versiones más recientes también tienen una vida útil de soporte más larga antes de llegar al final de su vida útil.
Descripción general de
La actualización de la versión del programador implica tres operaciones:
-
Prepare las AMI de destino: cree o identifique las AMI que incluyan la versión de Slurm de destino y el agente de PCS más reciente AWS .
-
Actualizar el clúster (
UpdateCluster): mueve el controlador a la versión principal de Slurm de destino. -
Actualizar grupos de nodos de procesamiento (
UpdateComputeNodeGroup): apunta cada grupo de nodos de procesamiento a una nueva AMI para que los nuevos nodos usen la versión de destino. Para obtener más información, consulte Actualización de un AWS Grupo de nodos de cómputo PCS.
Hay dos rutas que puede seguir. Elija una opción en función de si puede tolerar la interrupción del trabajo.
Independientemente de la opción que elija, antes de que comience el proceso, todos los nodos del clúster deben ejecutar la misma versión «A» y, al final del proceso, todos los nodos deben ejecutar la misma versión «B». La opción 2 funciona independientemente de la configuración del clúster.
| Opción 1: actualización continua | Opción 2: parada Full-fleet de mantenimiento | |
|---|---|---|
| Trabajos en ejecución | No requiere la terminación del trabajo | Se han terminado todos los trabajos en ejecución |
| Versión mínima del controlador de clústeres | 24.05 | Sin restricción |
| Flota de cómputos tras la actualización del controlador | Las versiones se mezclaron temporalmente; se requieren pasos de drenaje. Se recomienda minimizar la cantidad de tiempo durante el cual se usan las versiones mixtas en un clúster. | Todos los nodos se inician de cero en la versión de destino |
nota
Antes de empezar, asegúrate de que todos los nodos de procesamiento estén en el último parche de la versión A de Slurm y en el agente de AWS PCS más reciente.
Limitaciones
Si tu clúster usa complementos de Spank (configuración de plugstack), AWS PCS no admite la opción 1. Una actualización continua puede provocar que las versiones de configuración del plugstack no coincidan y que se produzcan errores en los complementos.
Compatibilidad de versiones
En la siguiente tabla, se muestran las versiones de destino compatibles a las que actualizar, en función de la versión actual del clúster. Siempre se recomienda actualizar a la última versión permitida (que aparece en negrita).
El clúster y todos los nodos de procesamiento deben ejecutar siempre la misma versión de Slurm antes de iniciar una actualización.
| Versión actual del clúster | Versiones de destino compatibles |
|---|---|
| 25.11 | N/A |
| 25,05 | 25,11 |
| 24.11 (EOL) | 25.11, 25.05 |
| 24.05 (EOL) | 25.11, 25.05, 24.11 |
| 23.11 (EL) | (solo mediante la opción 2) 25.05, 24.11, 24.05 |
Para obtener más información sobre las versiones compatibles y las fechas de fin de vida útil, consulte. Versiones de Slurm en AWS PIEZAS
No puede omitir más de tres versiones principales en una sola actualización. Si la versión de destino está más de tres versiones principales por delante de la versión actual, realice la actualización en varios pasos consecutivos. Para ver un ejemplo de varios pasos, consulteEjemplo: actualizar entre varias versiones.
Impacto en los trabajos en ejecución
Durante la actualización, el mando Slurm no estará disponible durante un breve período. Esto tiene las siguientes consecuencias:
-
Trabajos en ejecución: en el caso de la opción 1 (actualización continua), los trabajos que ya se están ejecutando en los nodos de procesamiento siguen ejecutándose. Los nodos de procesamiento no requieren que el controlador esté disponible para la ejecución activa del trabajo. En el caso de la opción 2 (detener el mantenimiento de toda la flota), todos los trabajos en ejecución finalizan cuando se reduce la flota.
-
Envíos de nuevos trabajos: no puede enviar nuevos trabajos ni ejecutar los comandos del programador mientras el controlador no esté disponible.
-
Escalado: el escalado automático se detiene durante la actualización. No se lanza ninguna instancia nueva ni se termina ninguna instancia para reducirla hasta que se complete la actualización.
-
Datos contables: si la contabilidad está habilitada, los datos contables se conservan durante la actualización. Los registros de tareas almacenados en la base de datos de contabilidad se conservan tras el cambio de versión.
-
API REST de Slurm: si la API REST de Slurm está habilitada en el clúster, se actualiza automáticamente a la nueva versión del planificador como parte de la operación.
UpdateClusterEl punto final de la API REST no está disponible durante la actualización y se reanuda cuando el clúster vuelve al estado.ACTIVEPara obtener más información, consulte La API REST de Slurm en AWS PIEZAS.
Combinar las actualizaciones de la versión con los cambios de configuración
Puede combinar una actualización de versión con otros cambios de configuración en una sola UpdateCluster solicitud. Por ejemplo, puede actualizar la versión del planificador y habilitar la contabilidad en la misma operación.
nota
No añadas ajustes de Slurm específicos para la versión de destino mientras la flota aún contenga los nodos de la versión anterior. La configuración se distribuye a todos los nodos; es slurmd posible que la antigua no reconozca los parámetros nuevos.