

Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.

# Solucionar problemas con los registros de trabajos faltantes en Slurm contabilidad
<a name="troubleshooting-missing-accounting-records"></a>

Los trabajos que se ejecutaron hasta su finalización no figuran en los informes de Slurm contabilidad, como el resultado de los comandos `sacct` o`sreport`. Los registros solo están ausentes durante un período de tiempo limitado, normalmente después de un período en el que la tasa de presentación de trabajos es muy alta. Los informes contables se completan antes y después de ese período. Este tema se aplica a los clústeres que tienen habilitada la Slurm contabilidad. Para obtener más información sobre la contabilidad, consulte[La contabilidad de Slurm en AWS 2 PIEZAS](slurm-accounting.md).

## Causa habitual
<a name="troubleshooting-missing-accounting-records-cause"></a>

El daemon del Slurm controlador (`slurmctld`) no escribe los datos de cuentas directamente en la base de datos de cuentas. Envía los datos al daemon (`slurmdbd`) Slurm de la base de datos a través de una cola interna en memoria. La cola puede alcanzar su tamaño máximo si los trabajos se envían más rápido de lo que se confirman los registros en la base `slurmdbd` de datos. Cuando la cola está llena, `slurmctld` descarta los mensajes de contabilidad nuevos en lugar de añadirlos a la cola.

Los mensajes descartados no se vuelven a intentar, por lo que el historial de trabajos que contenían está permanentemente ausente de la base de datos de contabilidad. Solo se ven afectados los datos contables. La programación y ejecución de los trabajos continúan con normalidad. Los registros que `slurmdbd` ya se han confirmado permanecen en la base de datos. La contabilidad se reanuda automáticamente cuando se agota la cola.

## Resolución
<a name="troubleshooting-missing-accounting-records-resolution"></a>

**Para confirmar la causa y reducir la probabilidad de recurrencia**

1. Busque en el `slurmctld` registro del clúster entradas similares a las siguientes.

   ```
   error: agent queue is full (33794), discarding DBD_JOB_START:1425 request
   ```

   Cada entrada corresponde a un mensaje de contabilidad descartado. El tipo de mensaje identifica el registro que se perdió`DBD_JOB_START`, como`DBD_JOB_COMPLETE`,`DBD_STEP_START`, o`DBD_STEP_COMPLETE`. Si el clúster no entrega los registros del programador, configura la entrega de registros. Esto le permite confirmar la causa en caso de que la afección vuelva a ocurrir. Para obtener más información, consulte [El planificador inicia sesión en AWS PCS](monitoring_scheduler-logs.md).

1. Establezca el `CommitDelay` parámetro `1` en la configuración slurmdbd del clúster. Con esta configuración, `slurmdbd` agrupa las confirmaciones de la base de datos en lugar de confirmar cada registro de forma individual, lo que aumenta la velocidad a la que se agota la cola. Utilice la `SlurmdbdCustomSettings` propiedad del clúster para aplicar la configuración. Para obtener más información, consulte [Configuración de los ajustes personalizados de SlurmDBD en AWS PC](slurmdbd-custom-settings.md) y [CommitDelay](https://slurm.schedmd.com/slurmdbd.conf.html#OPT_CommitDelay) en la Slurm documentación.
**importante**  
`SlurmdbdCustomSettings`reemplaza la configuración de slurmdbd del clúster en lugar de agregarla. Se elimina cualquier configuración que omita en la solicitud de actualización. Si es posible que el clúster ya tenga la configuración de slurmdbd, ejecute `aws pcs get-cluster` primero, agréguela `{parameterName=CommitDelay,parameterValue="1"}` a la lista recuperada y, a continuación, envíe la lista completa.  
**Example — Configurar un clúster `CommitDelay`**  

   ```
   aws pcs update-cluster --cluster-identifier {{my-cluster}} \
   --slurm-configuration \
   'SlurmdbdCustomSettings=[{parameterName=CommitDelay,parameterValue="1"}]'
   ```

1. Confirme que la configuración esté en su lugar. En Consola de administración de AWS, consulte la sección Configuración ** adicional del planificador ** para el clúster. En AWS CLI, ejecute el siguiente comando y compruebe el `slurmConfiguration` campo de la respuesta.

   ```
   aws pcs get-cluster --cluster-identifier {{my-cluster}}
   ```

**nota**  
Los registros contables `slurmctld` descartados no se pueden recuperar. Los trabajos que se ejecutaron durante el período afectado permanecen ausentes de los informes contables.

## Prevención
<a name="troubleshooting-missing-accounting-records-prevention"></a>

Para detectar la saturación de las colas mientras se produce, en lugar de buscar los registros que faltan más adelante, entregue CloudWatch los `slurmctld` registros a Amazon Logs, Amazon Simple Storage Service (Amazon S3) o Amazon Data Firehose y supervise si hay entradas. `agent queue is full` Para obtener más información, consulte [El planificador inicia sesión en AWS PCS](monitoring_scheduler-logs.md).

`CommitDelay`Concéntrese `1` en clústeres que ejecuten cargas de trabajo con una tasa alta de envíos de trabajos.