Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.
Solucionar problemas con los registros de trabajos faltantes en Slurm contabilidad
Los trabajos que se ejecutaron hasta su finalización no figuran en los informes de Slurm contabilidad, como el resultado de los comandos sacct osreport. Los registros solo están ausentes durante un período de tiempo limitado, normalmente después de un período en el que la tasa de presentación de trabajos es muy alta. Los informes contables se completan antes y después de ese período. Este tema se aplica a los clústeres que tienen habilitada la Slurm contabilidad. Para obtener más información sobre la contabilidad, consulteLa contabilidad de Slurm en AWS 2 PIEZAS.
Causa habitual
El daemon del Slurm controlador (slurmctld) no escribe los datos de cuentas directamente en la base de datos de cuentas. Envía los datos al daemon (slurmdbd) Slurm de la base de datos a través de una cola interna en memoria. La cola puede alcanzar su tamaño máximo si los trabajos se envían más rápido de lo que se confirman los registros en la base slurmdbd de datos. Cuando la cola está llena, slurmctld descarta los mensajes de contabilidad nuevos en lugar de añadirlos a la cola.
Los mensajes descartados no se vuelven a intentar, por lo que el historial de trabajos que contenían está permanentemente ausente de la base de datos de contabilidad. Solo se ven afectados los datos contables. La programación y ejecución de los trabajos continúan con normalidad. Los registros que slurmdbd ya se han confirmado permanecen en la base de datos. La contabilidad se reanuda automáticamente cuando se agota la cola.
Resolución
Para confirmar la causa y reducir la probabilidad de recurrencia
-
Busque en el
slurmctldregistro del clúster entradas similares a las siguientes.error: agent queue is full (33794), discarding DBD_JOB_START:1425 request
Cada entrada corresponde a un mensaje de contabilidad descartado. El tipo de mensaje identifica el registro que se perdió
DBD_JOB_START, comoDBD_JOB_COMPLETE,DBD_STEP_START, oDBD_STEP_COMPLETE. Si el clúster no entrega los registros del programador, configura la entrega de registros. Esto le permite confirmar la causa en caso de que la afección vuelva a ocurrir. Para obtener más información, consulte El planificador inicia sesión en AWS PCS. -
Establezca el
CommitDelayparámetro1en la configuración slurmdbd del clúster. Con esta configuración,slurmdbdagrupa las confirmaciones de la base de datos en lugar de confirmar cada registro de forma individual, lo que aumenta la velocidad a la que se agota la cola. Utilice laSlurmdbdCustomSettingspropiedad del clúster para aplicar la configuración. Para obtener más información, consulte Configuración de los ajustes personalizados de SlurmDBD en AWS PC y CommitDelayen la Slurm documentación. importante
SlurmdbdCustomSettingsreemplaza la configuración de slurmdbd del clúster en lugar de agregarla. Se elimina cualquier configuración que omita en la solicitud de actualización. Si es posible que el clúster ya tenga la configuración de slurmdbd, ejecuteaws pcs get-clusterprimero, agréguela{parameterName=CommitDelay,parameterValue="1"}a la lista recuperada y, a continuación, envíe la lista completa.ejemplo— Configurar un clúster
CommitDelayaws pcs update-cluster --cluster-identifiermy-cluster\ --slurm-configuration \ 'SlurmdbdCustomSettings=[{parameterName=CommitDelay,parameterValue="1"}]' -
Confirme que la configuración esté en su lugar. En Consola de administración de AWS, consulte la sección Configuración adicional del planificador para el clúster. En AWS CLI, ejecute el siguiente comando y compruebe el
slurmConfigurationcampo de la respuesta.aws pcs get-cluster --cluster-identifiermy-cluster
nota
Los registros contables slurmctld descartados no se pueden recuperar. Los trabajos que se ejecutaron durante el período afectado permanecen ausentes de los informes contables.
Prevención
Para detectar la saturación de las colas mientras se produce, en lugar de buscar los registros que faltan más adelante, entregue CloudWatch los slurmctld registros a Amazon Logs, Amazon Simple Storage Service (Amazon S3) o Amazon Data Firehose y supervise si hay entradas. agent queue is full Para obtener más información, consulte El planificador inicia sesión en AWS PCS.
CommitDelayConcéntrese 1 en clústeres que ejecuten cargas de trabajo con una tasa alta de envíos de trabajos.