As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.
Observabilidade detalhada da Amazon SageMaker AI para endpoints de inferência
A observabilidade detalhada é uma experiência métrica de próxima geração para endpoints de SageMaker inferência em tempo real da Amazon AI. Baseado no OpenTelemetry (OTel), ele coleta métricas operacionais refinadas de camadas de GPU, nó e estrutura de inferência e as publica na Amazon CloudWatch com rótulos avançados, incluindo nome do endpoint, nome do componente de inferência, ID da instância, zona de disponibilidade e tipo de instância.
Capacidades gerais
-
OpenTelemetry-native coleção. As métricas são coletadas usando um coletor OTel que extrai os endpoints do Prometheus a partir de DCGM (métricas de GPU), exportadores de nós (CPU, memória, disco) e contêineres de estrutura de inferência (vLLM, SGlang).
-
Rótulos dimensionais ricos. Cada métrica é publicada com rótulos como
aws.sagemaker.endpoint.name,aws.sagemaker.inference_component.name,,@resource.host.id@resource.cloud.availability_zone, e@resource.host.typepara filtragem e agregação precisas. -
Per-GPU atribuição. As métricas de GPU (DCGM) incluem atribuição por componente de inferência, permitindo identificar qual modelo está consumindo recursos de GPU em instâncias multilocatárias.
-
Métricas da estrutura de inferência. As métricas nativas de vLLM e sgLang — incluindo tokens por segundo, tempo até o primeiro token (TTFT), latência entre tokens, utilização do cache KV, profundidade da fila e tamanho do lote — estão disponíveis sem instrumentação personalizada.
-
Suporte a consultas PromQL. Consulte métricas usando a sintaxe PromQL na Amazon CloudWatch, no CloudWatch Query Studio ou no Amazon Managed Grafana.
-
Frequência de raspagem configurável. Controle a frequência com que as métricas são coletadas usando
MetricPublishFrequencyInSeconds(valores válidos: 10, 30, 60, 120, 180, 240, 300 segundos). O padrão é 60 segundos. As métricas do plano de controle, como ciclo de vida, escalonamento automático e diagnósticos ICE, são orientadas por eventos e não são afetadas por essa configuração.
nota
A observabilidade detalhada publica métricas OpenTelemetry (OTel) na Amazon CloudWatch via OTLP. Essas não são métricas do Prometheus. As métricas são armazenadas nativamente na Amazon CloudWatch como dados métricos do OTel e podem ser consultadas usando a sintaxe do ProMQL. O PromQL é suportado somente como uma linguagem de consulta — nenhum servidor Prometheus-compatible ou back-end do Prometheus está envolvido.
O que está incluído
| Categoria | Metrics | Escopo | Frequência |
|---|---|---|---|
| Estrutura de inferência () vLLM/SGLang | TTFT, ITL, cache KV, profundidade da fila, tamanho do lote, TPS, solicitações simultâneas | Per-IC para endpoints de componentes de inferência, por endpoint para instance/per SME | Configurável |
| Integridade da GPU (DCGM) | Utilização da GPU, utilização da cópia da memória, temperatura da GPU | Per-instance, Por GPU | Configurável |
| Integridade de nós | CPU, memória, disco, sistema de arquivos | Per-instance | Configurável |
| Posicionamento e alta disponibilidade dos componentes de inferência | Contagem de cópias de IC, cópias por AZ, distorção de AZ, IC por instância, instâncias por AZ | Per-endpoint | Periódico |
| Ciclo de vida | Tempo de download do modelo, tempo de carregamento da GPU, início do contêiner, partida a frio | Per-IC, por endpoint | Event-driven |
| Ajuste de escala automático | Eventos de escalabilidade, latência E2E, rebalanceamento | Per-endpoint | Event-driven |
| Diagnóstico ICE | Contagem de ICE, tipo com falha, AZ com falha | Per-endpoint | Event-driven |
Para obter a lista completa, consulte OpenTelemetry referência de métricas.
Arquitetura e fluxo de dados
Cada instância de endpoint expõe métricas de várias fontes. O OTel Collector coleta essas fontes, enriquece os dados com rótulos de contexto e os exporta para sua conta da Amazon. CloudWatch
-
O contêiner de modelo, o exportador DCGM e o exportador de nós expõem Prometheus-compatible métricas na instância (métricas da estrutura de inferência, métricas de GPU e métricas, respectivamente). CPU/memory/disk
-
O OTel Collector coleta esses endpoints e enriquece cada métrica com rótulos como nome do endpoint, nome do componente de inferência, ID da instância e zona de disponibilidade.
-
Métricas aprimoradas são exportadas via OTLP para a Amazon CloudWatch em sua conta.
-
As métricas podem ser consultadas via PromQL na Amazon em. CloudWatch
https://monitoring.region.amazonaws.com
Preços
Métricas detalhadas de observabilidade estão incluídas sem custo adicional. Para obter informações sobre os custos de ingestão de CloudWatch dados da Amazon relacionados ao enriquecimento do OTel, consulte Amazon Pricing. CloudWatch