View a markdown version of this page

OpenTelemetry referência de métricas - SageMaker IA da Amazon

As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.

OpenTelemetry referência de métricas

Esta seção fornece uma lista abrangente (não exaustiva) de OpenTelemetry métricas emitidas pela SageMaker Amazon AI, observabilidade detalhada e disponíveis no AI Insights. SageMaker

OpenTelemetry rótulos métricos

OpenTelemetry as métricas incluem rótulos (atributos) que identificam o recurso associado a cada ponto de dados. Use esses rótulos para filtrar e agrupar métricas em consultas.

OpenTelemetry rótulo Description
aws.sagemaker.endpoint.name Nome do endpoint
aws.sagemaker.variant.name Nome da variante de produção
aws.sagemaker.inference_component.name Nome do componente de inferência
@resource.host.id IDs de instância EC2
aws.sagemaker.container.id ID do contêiner
@resource.cloud.availability_zone Zona de disponibilidade
@resource.host.type Tipo de instância

Account-level métricas agregadas

Essas métricas estão no nível da conta.

# Métrica Description
1 TotalEndpoints Número total de endpoints ativos na conta
2 TotalICs Número total de componentes de inferência implantados em todos os endpoints
3 TotalInvocations Número total de solicitações de inferência em todos os endpoints

Métricas de GPU (DCGM)

Essas métricas são coletadas do exportador do Data Center GPU Manager (DCGM) e estão disponíveis em todos os endpoints da GPU, independentemente da estrutura de inferência.

Pode ser agregado no nível do componente de inferência, instância ou endpoint.

# Métrica Métrica (s) de origem Description
4 Utilização da GPU (%) DCGM_FI_DEV_GPU_UTIL Porcentagem de tempo em que a GPU estava executando cargas de trabalho ativamente
5 Utilização da memória da GPU (%) DCGM_FI_DEV_MEM_COPY_UTIL Porcentagem de tempo em que o controlador de memória estava movendo dados ativamente de ou para a memória da GPU

Métricas de nós (instância)

Essas métricas são coletadas do exportador de nós e fornecem visibilidade em nível de instância sobre a utilização da CPU, da memória e do disco.

Pode ser agregado no nível da instância ou do endpoint.

# Métrica Métrica (s) de origem Description
6 Utilização da CPU (%) node_cpu_seconds_total Um contador cumulativo que mede o total de segundos de CPU gastos em cada modo de execução (inativo, usuário, sistema, iowait) desde a inicialização. Derive a porcentagem de utilização da taxa do modo inativo.
7 Utilização da memória (%) node_memory_MemAvailable_bytes, node_memory_MemTotal_bytes Porcentagem de memória física em uso. Derivado da memória total menos a memória disponível.
8 Utilização do disco (%) node_filesystem_avail_bytes, node_filesystem_size_bytes Porcentagem do espaço do sistema de arquivos em uso. Derivado do tamanho total menos o espaço disponível.

Métricas da estrutura de inferência (vLLM/SGlang)

As métricas da estrutura de inferência são emitidas nativamente pelo mecanismo de serviço executado dentro do contêiner do modelo. SageMaker A IA coleta automaticamente essas métricas das estruturas suportadas (vLLM e SGlang) quando a observabilidade detalhada é ativada. Essas métricas fornecem visibilidade da taxa de transferência do token, da latência, da pressão do cache KV e do enfileiramento de solicitações no nível do componente de inferência.

Essas métricas podem ser atribuídas no nível do endpoint, do componente de inferência ou da instância.

# Métrica Métrica (s) de origem Description
9 Tokens de entrada por segundo vllm:prompt_tokens_total Número total de tokens de alerta processados por segundo
10 Tokens de saída por segundo vllm:generation_tokens_total Número total de tokens gerados por segundo
11 Total de TPS Derivado de #9 + #10 Tokens combinados de entrada e saída por segundo
12 % de utilização do TPS Derivado de #11 Taxa de transferência atual do token como uma porcentagem do pico observado
13 TTFT vllm:time_to_first_token_seconds Tempo desde a chegada da solicitação até o primeiro token gerado (histograma)
14 Inter-Token Latência vllm:inter_token_latency_seconds Tempo médio entre tokens gerados consecutivamente (histograma)
15 Utilização do cache KV vllm:gpu_cache_usage_perc Porcentagem da KV-cache memória da GPU atualmente em uso
16 Profundidade da fila vllm:num_requests_waiting Número de solicitações aguardando na fila para serem processadas
17 Tamanho do lote vllm:num_requests_running Número de solicitações atualmente em execução (em andamento)
18 Latência do modelo vllm:e2e_request_latency_seconds End-to-end latência da solicitação desde a chegada até o token final (histograma)
nota

As métricas prefixadas com vllm: têm sglang: equivalentes para endpoints SGlang.

Operations-driven métricas

Essas métricas são orientadas por eventos e emitidas por suas operações de criação, atualização ou escala para um endpoint ou componente de inferência. Eles não são afetados porMetricPublishFrequencyInSeconds.

Essas métricas podem ser atribuídas no nível do endpoint e do componente de inferência.

# Métrica Métrica (s) de origem Description
19 Evento de escalonamento e2e_duration Indica que uma ação de escalonamento automático ou manual ocorreu em seu endpoint. Filtre por etiqueta aws.sagemaker.scaling.direction (ScaleOutouScaleIn) para identificar a direção.
20 Latência de escalabilidade E2E e2e_duration End-to-end escalando a duração do gatilho até a conclusão (segundos). Filtrar por rótulo aws.sagemaker.operation.type (por exemplo,UpdateWCEndpoint).
21 Contagem de ICE ice_count Número de eventos de erro de capacidade insuficiente por AZ por tipo de instância
22 Tipo de evento de rebalanceamento rebalancing_blocked Tipo de evento de rebalanceamento e seu estado atual
23 Duração do rebalanceamento rebalancing_duration Duração do rebalanceamento do início até a conclusão (segundos)
24 Cópias do IC movidas ic_copy_moved Número de cópias do componente de inferência movidas durante o rebalanceamento
25 Instâncias lançadas instances_released Número de instâncias do EC2 liberadas pela consolidação durante o rebalanceamento
26 Duração do download do modelo model_download_time Tempo para baixar artefatos do modelo do S3 para a instância (segundos)
27 Duração do carregamento da GPU gpu_load_time Tempo para carregar os pesos do modelo na memória da GPU (segundos)
28 Duração do início do contêiner container_start_time Tempo desde o início do contêiner até a aprovação na verificação de saúde (segundos)

Métricas derivadas de posicionamento da frota

Além das métricas listadas acima, o painel do SageMaker AI Insights calcula métricas derivadas dos dados de posicionamento do plano de controle. Essas são visualizações agregadas visíveis no painel e não são nomes de métricas que podem ser consultados individualmente no Amazon CloudWatch Query Studio.

As métricas derivadas de posicionamento da frota incluem:

  • Contagem de instâncias por zona de disponibilidade

  • Contagem de cópias do IC por zona de disponibilidade

  • Inclinação de AZ (porcentagem de desequilíbrio de distribuição em toda a sua frota)

  • Cópias de IC por instância

Esses valores são visíveis na guia Confiabilidade do painel do SageMaker AI Insights.