View a markdown version of this page

Estratégias para ajustar a performance de trabalho do Spark -

As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.

Estratégias para ajustar a performance de trabalho do Spark

Quando for ajustar os parâmetros, observe as seguintes práticas recomendadas:

  • Determine suas metas de performance antes de começar a identificar os problemas.

  • Use as métricas para identificar os problemas antes de tentar alterar os parâmetros de ajuste.

Para obter os resultados mais consistentes ao ajustar um trabalho, desenvolva uma estratégia de linha de base para fazer os ajustes.

Estratégia de linha de base para ajuste de performance

Geralmente, o ajuste de performance é feito no seguinte fluxo de trabalho:

  1. Determine as metas de performance.

  2. Meça as métricas.

  3. Identifique os gargalos.

  4. Reduza o impacto dos gargalos.

  5. Repita as etapas de 2 a 4 até atingir a meta pretendida.

Primeiro, determine suas metas de performance. Por exemplo, uma de suas metas pode ser concluir a execução de um AWS Glue trabalho em 3 horas. Depois de definir suas metas, avalie as métricas de performance do trabalho. Identifique tendências em métricas e gargalos para atingir as metas. Em particular, identificar gargalos é muito importante para solucionar problemas, depurar e ajustar a performance. Durante a execução de uma aplicação do Spark, ele registra o status e as estatísticas de cada tarefa no log de eventos do Spark.

Em AWS Glue, você pode visualizar as métricas do Spark por meio da interface de usuário da Web do Spark, fornecida pelo servidor de histórico do Spark. AWS Glue para trabalhos do Spark, você pode enviar registros de eventos do Spark para um local especificado no Amazon S3. AWS Glue também fornece um AWS CloudFormation modelo de exemplo e um Dockerfile para iniciar o servidor de histórico do Spark em uma instância do Amazon EC2 ou em seu computador local, para que você possa usar a interface do usuário do Spark com registros de eventos.

Depois de determinar suas metas de performance e identificar métricas para avaliá-las, você pode começar a identificar e remediar gargalos usando as estratégias nas seções a seguir.

Práticas de ajuste da performance de trabalho do Spark

Você pode usar as seguintes estratégias AWS Glue para ajustar o desempenho das tarefas do Spark:

Antes de usar essas estratégias, você deve ter acesso às métricas e à configuração do seu trabalho do Spark. Você pode encontrar essas informações na documentação do AWS Glue.

Do ponto de vista dos AWS Glue recursos, você pode obter melhorias de desempenho adicionando AWS Glue trabalhadores e usando a AWS Glue versão mais recente.

Sob a perspectiva das aplicações do Apache Spark, você tem acesso a várias estratégias que podem melhorar a performance. Se dados desnecessários forem carregados no cluster do Spark, você poderá removê-los para reduzir a quantidade de dados carregados. Se você tiver recursos de cluster Spark subutilizados e tiver poucos dados I/O, poderá identificar tarefas para paralelizar. Você também pode querer otimizar as operações pesadas de transferência de dados, como junções, se elas estiverem demorando muito. Você também pode otimizar o plano de consulta do seu trabalho ou reduzir a complexidade computacional de tarefas individuais do Spark.

Para aplicar essas estratégias com eficiência, você deve identificar quando elas são aplicáveis consultando suas métricas. Para obter mais detalhes, consulte todas as seções a seguir. Essas técnicas funcionam não apenas para ajuste de performance, mas também para resolver problemas típicos, como erros de memória insuficiente (OOM).