기계 번역으로 제공되는 번역입니다. 제공된 번역과 원본 영어의 내용이 상충하는 경우에는 영어 버전이 우선합니다.
추론 엔드포인트에 대한 Amazon SageMaker AI 세부 관찰성
세부 관찰성은 Amazon SageMaker AI 실시간 추론 엔드포인트에 대한 차세대 지표 경험입니다. OpenTelemetry(OTel)를 기반으로 GPU, 노드 및 추론 프레임워크 계층에서 세분화된 운영 지표를 수집하여 엔드포인트 이름, 추론 구성 요소 이름, 인스턴스 ID, 가용 영역, 인스턴스 유형 등 풍부한 레이블을 사용하여 Amazon CloudWatch에 게시합니다.
주요 기능
-
OpenTelemetry 네이티브 컬렉션. 지표는 DCGM(GPU 지표), 노드 내보내기(CPU, 메모리, 디스크), 추론 프레임워크 컨테이너(vLLM, SGLang)에서 Prometheus 엔드포인트를 스크레이프하는 OTel Collector를 사용하여 수집됩니다.
-
풍부한 차원 레이블. 모든 지표는 정확한 필터링 및 집계를
@resource.host.type위해aws.sagemaker.endpoint.name,aws.sagemaker.inference_component.name,@resource.cloud.availability_zone,@resource.host.id, 등의 레이블과 함께 게시됩니다. -
GPU당 어트리뷰션. GPU 지표(DCGM)에는 per-inference-component 속성이 포함되어 있으므로 다중 테넌트 인스턴스에서 GPU 리소스를 사용하는 모델을 식별할 수 있습니다.
-
추론 프레임워크 지표. 초당 토큰 수, 첫 번째 토큰까지의 시간(TTFT), 토큰 간 지연 시간, KV 캐시 사용률, 대기열 깊이, 배치 크기를 포함한 기본 vLLM 및 SGLang 지표는 사용자 지정 계측 없이 사용할 수 있습니다.
-
PromQL 쿼리 지원. Amazon CloudWatch, CloudWatch Query Studio 또는 Amazon Managed Grafana에서 PromQL 구문CloudWatch 사용하여 지표를 쿼리합니다.
-
구성 가능한 스크레이프 빈도입니다. 를 사용하여 지표를 수집하는 빈도를 제어합니다
MetricPublishFrequencyInSeconds(유효 값: 10, 30, 60, 120, 180, 240, 300초). 기본값은 60초입니다. 수명 주기, Auto Scaling 및 ICE 진단과 같은 컨트롤 플레인 지표는 이벤트 기반이며이 설정의 영향을 받지 않습니다.
참고
세부 관찰성은 OTLP를 통해 Amazon CloudWatch에 OpenTelemetry(OTel) 지표를 게시합니다.OTel 이는 Prometheus 지표가 아닙니다. 지표는 기본적으로 Amazon CloudWatch에 OTel 지표 데이터로 저장되며 PromQL 구문을 사용하여 쿼리할 수 있습니다. PromQL은 쿼리 언어로만 지원됩니다. Prometheus 서버 또는 Prometheus 호환 백엔드는 관여하지 않습니다.
포함 내용
| 카테고리 | 측정치 | Scope | 빈도 |
|---|---|---|---|
| 추론 프레임워크(vLLM/SGLang) | TTFT, ITL, KV 캐시, 대기열 깊이, 배치 크기, TPS, 동시 요청 | 추론 구성 요소 엔드포인트의 IC별, SME의 인스턴스별/엔드포인트별 | 구성 가능 |
| GPU 상태(DCGM) | GPU 사용률, 메모리 복사 사용률, GPU 온도 | 인스턴스당, GPU당 | 구성 가능 |
| 노드 상태 | CPU, 메모리, 디스크, 파일 시스템 | 인스턴스당 | 구성 가능 |
| 추론 구성 요소 배치 및 고가용성 | IC 복사본 수, AZ당 복사본, AZ 스큐, 인스턴스당 IC, AZ당 인스턴스 | 엔드포인트별 | 주기적 |
| 수명 주기 | 모델 다운로드 시간, GPU 로드 시간, 컨테이너 시작, 콜드 스타트 | IC별, 엔드포인트별 | 이벤트 기반 |
| AutoScaling | 이벤트 조정, E2E 지연 시간, 리밸런싱 | 엔드포인트별 | 이벤트 기반 |
| ICE 진단 | ICE 수, 실패한 유형, 실패한 AZ | 엔드포인트별 | 이벤트 기반 |
완전한 목록은 OpenTelemetry 지표 참조 섹션을 참조하세요.
아키텍처 및 데이터 흐름
각 엔드포인트 인스턴스는 여러 소스의 지표를 노출합니다. OTel Collector는 이러한 소스를 스크레이프하고 컨텍스트 레이블로 데이터를 보강한 다음 Amazon CloudWatch 계정으로 내보냅니다.
-
모델 컨테이너, DCGM Exporter 및 노드 Exporter는 인스턴스에서 Prometheus 호환 지표(각각 추론 프레임워크 지표, GPU 지표 및 CPU/memory/disk 지표)를 노출합니다.
-
OTel Collector는 이러한 엔드포인트를 스크레이프하고 엔드포인트 이름, 추론 구성 요소 이름, 인스턴스 ID 및 가용 영역과 같은 레이블로 각 지표를 보강합니다.
-
강화된 지표는 OTLP를 통해 계정의 Amazon CloudWatch로 내보내집니다.
-
지표는의 Amazon CloudWatch에서 PromQL을 통해 쿼리할 수 있습니다
https://monitoring..region.amazonaws.com
가격 책정
자세한 관찰성 지표는 추가 비용 없이 포함됩니다. OTel 보강과 관련된 Amazon CloudWatch 데이터 수집 비용에 대한 자세한 내용은 Amazon CloudWatch 요금을