Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
Risoluzione dei problemi relativi ai record di lavoro mancanti in Slurm contabilità
I lavori completati non sono presenti nei report Slurm contabili, ad esempio l'output dei comandi sacct orsreport. I record sono assenti solo per un periodo di tempo limitato, in genere dopo un periodo in cui il tasso di invio dei lavori è molto elevato. I report contabili vengono completati prima e dopo tale finestra. Questo argomento si applica ai cluster in cui è abilitata la Slurm contabilità. Per ulteriori informazioni sulla contabilità, vedereContabilità Slurm in AWS 2 PEZZI.
Cause comuni
Il Slurm controller daemon (slurmctld) non scrive direttamente i dati contabili nel database di contabilità. Invia i dati al Slurm database daemon (slurmdbd) tramite una coda interna in memoria. La coda può raggiungere la dimensione massima se i lavori vengono inviati più slurmdbd velocemente dei record inviati al database. Quando la coda è piena, slurmctld elimina i nuovi messaggi contabili invece di aggiungerli alla coda.
I messaggi scartati non vengono ritentati, quindi la cronologia dei lavori trasmessi è permanentemente assente dal database contabile. Sono interessati solo i dati contabili. La pianificazione e l'esecuzione dei lavori proseguono normalmente. I record slurmdbd già salvati rimangono nel database. La contabilità riprende automaticamente quando la coda si esaurisce.
Risoluzione
Per confermare la causa e ridurre la possibilità di recidiva
-
Cerca nel
slurmctldregistro del cluster voci simili alle seguenti.error: agent queue is full (33794), discarding DBD_JOB_START:1425 request
Ogni voce corrisponde a un messaggio contabile scartato. Il tipo di messaggio identifica il record che è andato perso, ad esempio
DBD_JOB_START,DBD_JOB_COMPLETE,DBD_STEP_STARTo.DBD_STEP_COMPLETESe il cluster non fornisce i log dello scheduler, configura la consegna dei log. Ciò consente di confermare la causa se la condizione si ripresenta. Per ulteriori informazioni, consulta Registri dell'utilità di pianificazione in PCS AWS. -
Imposta il
CommitDelayparametro su1nella configurazione slurmdbd del cluster. Con questa impostazione,slurmdbdraggruppa i commit del database anziché eseguire il commit di ogni record singolarmente, il che aumenta la velocità di esaurimento della coda. Usa laSlurmdbdCustomSettingsproprietà del cluster per applicare l'impostazione. Per ulteriori informazioni, consulta Configurazione delle impostazioni personalizzate di SlurMDBD in AWS 2 PEZZI e CommitDelaynella Slurm documentazione. Importante
SlurmdbdCustomSettingssostituisce le impostazioni slurmdbd del cluster invece di aggiungerle. Qualsiasi impostazione omessa dalla richiesta di aggiornamento viene rimossa. Se il cluster potrebbe già avere le impostazioni slurmdbd, eseguiaws pcs get-clusterprima, aggiungile{parameterName=CommitDelay,parameterValue="1"}all'elenco recuperato, quindi invia l'elenco completo.Esempio— Impostazione su un cluster
CommitDelayaws pcs update-cluster --cluster-identifiermy-cluster\ --slurm-configuration \ 'SlurmdbdCustomSettings=[{parameterName=CommitDelay,parameterValue="1"}]' -
Conferma che l'impostazione sia attiva. In Console di gestione AWS, visualizza Impostazioni aggiuntive dello scheduler per il cluster. In AWS CLI, esegui il comando seguente e controlla il
slurmConfigurationcampo della risposta.aws pcs get-cluster --cluster-identifiermy-cluster
Nota
I record contabili slurmctld scartati non possono essere recuperati. I lavori eseguiti durante la finestra interessata rimangono assenti dai report contabili.
Prevenzione
Per rilevare la saturazione della coda mentre si verifica invece di trovare i record mancanti in un secondo momento, invia slurmctld i log ad Amazon Logs, Amazon CloudWatch Simple Storage Service (Amazon S3) o Amazon Data Firehose e monitorali per eventuali inserimenti. agent queue is full Per ulteriori informazioni, consulta Registri dell'utilità di pianificazione in PCS AWS.
CommitDelayMantieniti aggiornato 1 sui cluster che eseguono carichi di lavoro con un elevato tasso di invio dei lavori.