View a markdown version of this page

Résolution des problèmes liés aux enregistrements de tâches manquants dans Slurm comptabilité - AWS PIÈCES

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Résolution des problèmes liés aux enregistrements de tâches manquants dans Slurm comptabilité

Les tâches exécutées jusqu'à leur terme ne figurent pas dans les rapports Slurm comptables, tels que la sortie des sreport commandes sacct ou. Les dossiers ne sont absents que pendant une période limitée, généralement après une période de très haut taux de soumission d'offres d'emploi. Les rapports comptables sont complets avant et après cette fenêtre. Cette rubrique s'applique aux clusters pour lesquels la Slurm comptabilité est activée. Pour plus d'informations sur la comptabilité, consultezComptabilité Slurm dans AWS PIÈCES.

Cause courante

Le démon du Slurm contrôleur (slurmctld) n'écrit pas les données de comptabilité directement dans la base de données de comptabilité. Il envoie les données au démon de Slurm base de données (slurmdbd) via une file d'attente interne en mémoire. La file d'attente peut atteindre sa taille maximale si les tâches sont soumises plus rapidement que les enregistrements slurmdbd de validation dans la base de données. Lorsque la file d'attente est pleine, slurmctld supprime les nouveaux messages de gestion au lieu de les ajouter à la file d'attente.

Les messages supprimés ne sont pas réessayés, de sorte que l'historique des tâches qu'ils contenaient est définitivement absent de la base de données comptable. Seules les données comptables sont concernées. La planification et l'exécution des tâches se poursuivent normalement. Les enregistrements slurmdbd déjà validés restent dans la base de données. La comptabilité reprend automatiquement lorsque la file d'attente est épuisée.

Résolution

Pour confirmer la cause et réduire les risques de récidive
  1. Recherchez dans le slurmctld journal du cluster des entrées similaires aux suivantes.

    error: agent queue is full (33794), discarding DBD_JOB_START:1425 request

    Chaque entrée correspond à un message de comptabilité rejeté. Le type de message identifie l'enregistrement qui a été perdu, par exemple DBD_JOB_STARTDBD_JOB_COMPLETE,DBD_STEP_START, ouDBD_STEP_COMPLETE. Si le cluster ne fournit pas les journaux du planificateur, configurez la livraison des journaux. Cela vous permet de confirmer la cause si le problème se reproduit. Pour de plus amples informations, veuillez consulter Le planificateur enregistre dans PCS AWS.

  2. Définissez le CommitDelay paramètre sur 1 dans la configuration slurmdbd du cluster. Avec ce paramètre, slurmdbd les validations de base de données sont regroupées au lieu de valider chaque enregistrement individuellement, ce qui augmente le taux de vidange de la file d'attente. Utilisez la SlurmdbdCustomSettings propriété du cluster pour appliquer le paramètre. Pour plus d'informations, consultez Configuration des paramètres personnalisés de SlurmDBD dans AWS PIÈCES et CommitDelay dans la Slurm documentation.

    Important

    SlurmdbdCustomSettingsremplace les paramètres slurmdbd du cluster au lieu d'y ajouter des paramètres. Tout paramètre que vous omettez dans la demande de mise à jour est supprimé. Si le cluster possède déjà des paramètres slurmdbd, lancez-le d'aws pcs get-clusterabord, ajoutez-le {parameterName=CommitDelay,parameterValue="1"} à la liste récupérée, puis soumettez la liste complète.

    Exemple— Configuration CommitDelay sur un cluster
    aws pcs update-cluster --cluster-identifier my-cluster \ --slurm-configuration \ 'SlurmdbdCustomSettings=[{parameterName=CommitDelay,parameterValue="1"}]'
  3. Vérifiez que le réglage est en place. Dans le Console de gestion AWS, consultez les paramètres de planification supplémentaires pour le cluster. Dans le AWS CLI, exécutez la commande suivante et vérifiez le slurmConfiguration champ de la réponse.

    aws pcs get-cluster --cluster-identifier my-cluster
Note

Les documents comptables qui slurmctld ont été supprimés ne peuvent pas être récupérés. Les tâches exécutées pendant la période concernée restent absentes des rapports comptables.

Prévention

Pour détecter la saturation de la file d'attente au lieu de rechercher les enregistrements manquants ultérieurement, envoyez slurmctld les journaux à Amazon CloudWatch Logs, Amazon Simple Storage Service (Amazon S3) ou Amazon Data Firehose, et surveillez-les pour détecter les agent queue is full entrées. Pour de plus amples informations, veuillez consulter Le planificateur enregistre dans PCS AWS.

CommitDelayConcentrez-vous 1 sur les clusters qui exécutent des charges de travail avec un taux de soumission de tâches élevé.