View a markdown version of this page

Observabilidade detalhada da Amazon SageMaker AI para endpoints de inferência - SageMaker IA da Amazon

As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.

Observabilidade detalhada da Amazon SageMaker AI para endpoints de inferência

A observabilidade detalhada é uma experiência métrica de próxima geração para endpoints de SageMaker inferência em tempo real da Amazon AI. Baseado no OpenTelemetry (OTel), ele coleta métricas operacionais refinadas de camadas de GPU, nó e estrutura de inferência e as publica na Amazon CloudWatch com rótulos avançados, incluindo nome do endpoint, nome do componente de inferência, ID da instância, zona de disponibilidade e tipo de instância.

Capacidades gerais

  • OpenTelemetry-native coleção. As métricas são coletadas usando um coletor OTel que extrai os endpoints do Prometheus a partir de DCGM (métricas de GPU), exportadores de nós (CPU, memória, disco) e contêineres de estrutura de inferência (vLLM, SGlang).

  • Rótulos dimensionais ricos. Cada métrica é publicada com rótulos comoaws.sagemaker.endpoint.name,aws.sagemaker.inference_component.name,, @resource.host.id@resource.cloud.availability_zone, e @resource.host.type para filtragem e agregação precisas.

  • Per-GPU atribuição. As métricas de GPU (DCGM) incluem atribuição por componente de inferência, permitindo identificar qual modelo está consumindo recursos de GPU em instâncias multilocatárias.

  • Métricas da estrutura de inferência. As métricas nativas de vLLM e sgLang — incluindo tokens por segundo, tempo até o primeiro token (TTFT), latência entre tokens, utilização do cache KV, profundidade da fila e tamanho do lote — estão disponíveis sem instrumentação personalizada.

  • Suporte a consultas PromQL. Consulte métricas usando a sintaxe PromQL na Amazon CloudWatch, no CloudWatch Query Studio ou no Amazon Managed Grafana.

  • Frequência de raspagem configurável. Controle a frequência com que as métricas são coletadas usando MetricPublishFrequencyInSeconds (valores válidos: 10, 30, 60, 120, 180, 240, 300 segundos). O padrão é 60 segundos. As métricas do plano de controle, como ciclo de vida, escalonamento automático e diagnósticos ICE, são orientadas por eventos e não são afetadas por essa configuração.

nota

A observabilidade detalhada publica métricas OpenTelemetry (OTel) na Amazon CloudWatch via OTLP. Essas não são métricas do Prometheus. As métricas são armazenadas nativamente na Amazon CloudWatch como dados métricos do OTel e podem ser consultadas usando a sintaxe do ProMQL. O PromQL é suportado somente como uma linguagem de consulta — nenhum servidor Prometheus-compatible ou back-end do Prometheus está envolvido.

O que está incluído

Categorias métricas de observabilidade detalhadas
Categoria Metrics Escopo Frequência
Estrutura de inferência () vLLM/SGLang TTFT, ITL, cache KV, profundidade da fila, tamanho do lote, TPS, solicitações simultâneas Per-IC para endpoints de componentes de inferência, por endpoint para instance/per SME Configurável
Integridade da GPU (DCGM) Utilização da GPU, utilização da cópia da memória, temperatura da GPU Per-instance, Por GPU Configurável
Integridade de nós CPU, memória, disco, sistema de arquivos Per-instance Configurável
Posicionamento e alta disponibilidade dos componentes de inferência Contagem de cópias de IC, cópias por AZ, distorção de AZ, IC por instância, instâncias por AZ Per-endpoint Periódico
Ciclo de vida Tempo de download do modelo, tempo de carregamento da GPU, início do contêiner, partida a frio Per-IC, por endpoint Event-driven
Ajuste de escala automático Eventos de escalabilidade, latência E2E, rebalanceamento Per-endpoint Event-driven
Diagnóstico ICE Contagem de ICE, tipo com falha, AZ com falha Per-endpoint Event-driven

Para obter a lista completa, consulte OpenTelemetry referência de métricas.

Arquitetura e fluxo de dados

Diagrama de arquitetura mostrando o pipeline de coleta de métricas para uma observabilidade detalhada.

Cada instância de endpoint expõe métricas de várias fontes. O OTel Collector coleta essas fontes, enriquece os dados com rótulos de contexto e os exporta para sua conta da Amazon. CloudWatch

  1. O contêiner de modelo, o exportador DCGM e o exportador de nós expõem Prometheus-compatible métricas na instância (métricas da estrutura de inferência, métricas de GPU e métricas, respectivamente). CPU/memory/disk

  2. O OTel Collector coleta esses endpoints e enriquece cada métrica com rótulos como nome do endpoint, nome do componente de inferência, ID da instância e zona de disponibilidade.

  3. Métricas aprimoradas são exportadas via OTLP para a Amazon CloudWatch em sua conta.

  4. As métricas podem ser consultadas via PromQL na Amazon em. CloudWatch https://monitoring.region.amazonaws.com

Preços

Métricas detalhadas de observabilidade estão incluídas sem custo adicional. Para obter informações sobre os custos de ingestão de CloudWatch dados da Amazon relacionados ao enriquecimento do OTel, consulte Amazon Pricing. CloudWatch