View a markdown version of this page

Solução de problemas de rede - AWS ParallelCluster

As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.

Solução de problemas de rede

Esta seção fornece uma dica de solução de problemas para quando você encontrar problemas de rede, especificamente ao lidar com um cluster em um único problema de sub-rede pública.

Problemas de cluster em uma única sub-rede pública

Na AWS ParallelCluster versão 3.16.0 e versões posteriores, verifique se um /var/log/chef-client.log nó de computação falhou. Se você encontrar um erro semelhante ao seguinte, o nó não conseguiu acessar o DynamoDB durante a inicialização:

INFO: Retrying execution of ruby_block[retrieve compute node info], 0 attempt left ================================================================================ Error executing action `run` on resource 'ruby_block[retrieve compute node info]' ================================================================================ RuntimeError ------------ Failed to query DynamoDB for compute node info: the aws cli call did not return in time and was terminated. This usually means the compute node cannot reach DynamoDB. If the compute subnet has no internet egress (NAT/IGW), ensure a DynamoDB VPC gateway endpoint is configured and attached to the subnet's route table.

Nas AWS ParallelCluster versões anteriores à 3.16.0, os nós de computação podem travar silenciosamente durante a inicialização em vez de falhar rapidamente. Verifique cloud-init-output.log em um nó de computação uma entrada de registro como a abaixo, que indica que o nó está preso ao recuperar informações do DynamoDB:

ruby_block[retrieve compute node info] action run[2022-03-11T17:47:11+00:00] INFO: Processing ruby_block[retrieve compute node info] action run (aws-parallelcluster-slurm::init line 31)

A causa mais comum é a falta de um endpoint VPC do DynamoDB, pois AWS ParallelCluster lê as informações dos nós de computação do DynamoDB durante a inicialização. Para ver a lista completa dos endpoints necessários, consulteAWS ParallelCluster em uma única sub-rede sem acesso à Internet.

Para resolver, adicione o endpoint VPC ausente (normalmente o DynamoDB) à tabela de rotas da sub-rede computacional. Se o cluster tiver entrado no modo protegido, consulte Slurm modo protegido por cluster como se recuperar.