View a markdown version of this page

Log dan Metrik Pipeline Inferensi - Amazon SageMaker AI

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Log dan Metrik Pipeline Inferensi

Pemantauan penting untuk menjaga keandalan, ketersediaan, dan kinerja sumber daya SageMaker AI Amazon. Untuk memantau dan memecahkan masalah kinerja pipeline inferensi, gunakan CloudWatch log Amazon dan pesan kesalahan. Untuk informasi tentang alat pemantauan yang SageMaker disediakan AI, lihatMemantau AWS sumber daya di Amazon SageMaker AI.

Gunakan Metrik untuk Memantau Multi-container Model

Untuk memantau model multi-kontainer di Inference Pipelines, gunakan Amazon. CloudWatch CloudWatchmengumpulkan data mentah dan memprosesnya menjadi metrik yang dapat dibaca dan hampir real-time. SageMaker Pekerjaan pelatihan AI dan titik akhir menulis CloudWatch metrik dan log di AWS/SageMaker namespace.

Tabel berikut mencantumkan metrik dan dimensi untuk berikut ini:

  • Pemanggilan titik akhir

  • Pekerjaan pelatihan, pekerjaan transformasi batch, dan instans titik akhir

Dimensi adalah name/value pasangan yang secara unik mengidentifikasi metrik. Anda dapat menetapkan hingga 10 dimensi ke metrik. Untuk informasi lebih lanjut tentang pemantauan dengan CloudWatch, lihatMetrik SageMaker AI Amazon di Amazon CloudWatch.

Metrik Pemanggilan Titik Akhir

AWS/SageMakerNamespace menyertakan metrik permintaan berikut dari panggilan ke InvokeEndpoint.

Metrik dilaporkan pada interval 1 menit.

Metrik Deskripsi
Invocation4XXErrors

Jumlah InvokeEndpoint permintaan yang dikembalikan oleh model kode respons 4xx HTTP. Untuk setiap 4xx respons, SageMaker AI mengirimkan a1.

Satuan: Tidak ada

Statistik yang valid: Average, Sum

Invocation5XXErrors

Jumlah InvokeEndpoint permintaan yang dikembalikan oleh model kode respons 5xx HTTP. Untuk setiap 5xx respons, SageMaker AI mengirimkan a1.

Satuan: Tidak ada

Statistik yang valid: Average, Sum

Invocations

Per number of InvokeEndpoint mintaan dikirim ke titik akhir model.

Untuk mendapatkan jumlah total permintaan yang dikirim ke titik akhir model, gunakan Sum statistik.

Satuan: Tidak ada

Statistik yang valid: Sum, Sample Count

InvocationsPerInstance

Jumlah pemanggilan titik akhir yang dikirim ke model, dinormalisasi oleh masing-masingInstanceCount. ProductionVariant SageMaker AI mengirimkan 1/ numberOfInstances sebagai nilai untuk setiap permintaan, di mana numberOfInstances jumlah instance aktif untuk titik akhir pada saat permintaan. ProductionVariant

Satuan: Tidak ada

Statistik valid: Sum

ModelLatency Waktu yang dibutuhkan model atau model untuk merespons. Ini termasuk waktu yang dibutuhkan untuk mengirim permintaan, untuk mengambil respons dari wadah model, dan untuk menyelesaikan inferensi dalam wadah. ModelLatencyadalah total waktu yang dibutuhkan oleh semua kontainer dalam pipa inferensi.

Satuan: Mikrodetik

Statistik yang valid:Average,Sum,Min,Max, Jumlah Sampel

OverheadLatency

Waktu ditambahkan ke waktu yang dibutuhkan untuk menanggapi permintaan klien oleh SageMaker AI untuk overhead. OverheadLatencydiukur dari saat SageMaker AI menerima permintaan hingga mengembalikan respons ke klien, dikurangiModelLatency. Latensi overhead dapat bervariasi tergantung pada ukuran muatan permintaan dan respons, frekuensi permintaan, dan otentikasi atau otorisasi permintaan, di antara faktor-faktor lainnya.

Satuan: Mikrodetik

Statistik yang valid:Average,Sum,Min,Max, Sample Count

ContainerLatency Waktu yang dibutuhkan wadah Inference Pipelines untuk merespons seperti yang dilihat dari SageMaker AI. ContainerLatencytermasuk waktu yang dibutuhkan untuk mengirim permintaan, untuk mengambil respons dari wadah model, dan untuk menyelesaikan inferensi dalam wadah.

Satuan: Mikrodetik

Statistik yang valid:Average,Sum,Min,Max, Sample Count

Dimensi untuk Metrik Pemanggilan Titik Akhir

Dimensi Deskripsi
EndpointName, VariantName, ContainerName

Memfilter metrik pemanggilan titik akhir untuk a ProductionVariant di titik akhir yang ditentukan dan untuk varian yang ditentukan.

Untuk titik akhir pipeline inferensi, CloudWatch daftarkan metrik latensi per kontainer di akun Anda sebagai Metrik Kontainer T itik Akhir dan Metrik Var ian Titik Ak hir di namespace SageMaker AI, sebagai berikut. Met ContainerLatency rik hanya muncul untuk pipeline inferensi.

CloudWatch Dasbor untuk pipeline inferensi.

Untuk setiap titik akhir dan setiap wadah, metrik latensi menampilkan nama untuk wadah, titik akhir, varian, dan metrik.

Metrik latensi untuk titik akhir.

Pekerjaan Pelatihan, Pekerjaan Transformasi Batch, dan Metrik Instans Titik Akhir

Ruang nama, /aws/sagemaker/TrainingJobs/aws/sagemaker/TransformJobs, dan menyer /aws/sagemaker/Endpoints takan metrik berikut untuk pekerjaan pelatihan dan instance titik akhir.

Metrik dilaporkan pada interval 1 menit.

Metrik Deskripsi
CPUUtilization

Persentase unit CPU yang digunakan oleh kontainer yang berjalan pada instance. Nilainya berkisar dari 0% hingga 100%, dan dikalikan dengan jumlah CPU. Misalnya, jika ada empat CPU, CPUUtilization dapat berkisar dari 0% hingga 400%.

Untuk pekerjaan pelatihan, CPUUtilization adalah pemanfaatan CPU dari wadah algoritma yang berjalan pada instance.

Untuk pekerjaan transformasi batch, CPUUtilization adalah pemanfaatan CPU dari wadah transformasi yang berjalan pada instance.

Untuk model multi-container, CPUUtilization adalah jumlah pemanfaatan CPU oleh semua container yang berjalan pada instance.

Untuk varian titik akhir, CPUUtilization adalah jumlah pemanfaatan CPU oleh semua container yang berjalan pada instance.

Unit: Persen

MemoryUtilization

Persentase memori yang digunakan oleh kontainer yang berjalan pada sebuah instance. Nilai ini berkisar dari 0% hingga 100%.

Untuk pekerjaan pelatihan, MemoryUtilization adalah memori yang digunakan oleh wadah algoritma yang berjalan pada instance.

Untuk pekerjaan transformasi batch, MemoryUtilization adalah memori yang digunakan oleh wadah transformasi yang berjalan pada instance.

Untuk model multi-container, MemoryUtilization adalah jumlah memori yang digunakan oleh semua container yang berjalan pada instance.

Untuk varian titik akhir, MemoryUtilization adalah jumlah memori yang digunakan oleh semua wadah yang berjalan pada instance.

Unit: Persen

GPUUtilization

Persentase unit GPU yang digunakan oleh kontainer yang berjalan pada instance. GPUUtilizationberkisar dari 0% hingga 100% dan dikalikan dengan jumlah GPU. Misalnya, jika ada empat GPU, GPUUtilization dapat berkisar dari 0% hingga 400%.

Untuk pekerjaan pelatihan, GPUUtilization adalah GPU yang digunakan oleh wadah algoritma yang berjalan pada instance.

Untuk pekerjaan transformasi batch, GPUUtilization adalah GPU yang digunakan oleh wadah transformasi yang berjalan pada instance.

Untuk model multi-container, GPUUtilization adalah jumlah GPU yang digunakan oleh semua container yang berjalan pada instance.

Untuk varian titik akhir, GPUUtilization adalah jumlah GPU yang digunakan oleh semua container yang berjalan pada instance.

Unit: Persen

GPUMemoryUtilization

Persentase memori GPU yang digunakan oleh kontainer yang berjalan pada instance. GPUMemoryUtilization berkisar dari 0% hingga 100% dan dikalikan dengan jumlah GPU. Misalnya, jika ada empat GPU, GPUMemoryUtilization dapat berkisar dari 0% hingga 400%.

Untuk pekerjaan pelatihan, GPUMemoryUtilization adalah memori GPU yang digunakan oleh wadah algoritma yang berjalan pada instance.

Untuk pekerjaan transformasi batch, GPUMemoryUtilization adalah memori GPU yang digunakan oleh wadah transformasi yang berjalan pada instance.

Untuk model multi-kontainer, GPUMemoryUtilization adalah jumlah GPU yang digunakan oleh semua kontainer yang berjalan pada instance.

Untuk varian titik akhir, GPUMemoryUtilization adalah jumlah memori GPU yang digunakan oleh semua wadah yang berjalan pada instance.

Unit: Persen

DiskUtilization

Persentase ruang disk yang digunakan oleh kontainer yang berjalan pada sebuah instance. DiskUtilization berkisar dari 0% hingga 100%. Metrik ini tidak didukung untuk pekerjaan transformasi batch.

Untuk pekerjaan pelatihan, DiskUtilization adalah ruang disk yang digunakan oleh wadah algoritma yang berjalan pada instance.

Untuk varian titik akhir, DiskUtilization adalah jumlah ruang disk yang digunakan oleh semua wadah yang disediakan yang berjalan pada instance.

Unit: Persen

Dimensi untuk Pekerjaan Pelatihan, Pekerjaan Transformasi Batch, dan Metrik Instans Titik Akhir

Dimensi Deskripsi
Host

Untuk pekerjaan pelatihan, Host memiliki format[training-job-name]/algo-[instance-number-in-cluster]. Gunakan dimensi ini untuk memfilter metrik instans untuk pekerjaan dan instance pelatihan yang ditentukan. Format dimensi ini hanya ada di /aws/sagemaker/TrainingJobs namespace.

Untuk pekerjaan transformasi batch, Host memiliki format[transform-job-name]/[instance-id]. Gunakan dimensi ini untuk memfilter metrik instans untuk pekerjaan dan instance transformasi batch yang ditentukan. Format dimensi ini hanya ada di /aws/sagemaker/TransformJobs namespace.

Untuk titik akhir, Host memiliki format[endpoint-name]/[ production-variant-name ]/[instance-id]. Gunakan dimensi ini untuk memfilter metrik instance untuk titik akhir, varian, dan instance yang ditentukan. Format dimensi ini hanya ada di /aws/sagemaker/Endpoints namespace.

Untuk membantu Anda men-debug pekerjaan pelatihan, titik akhir, dan konfigurasi siklus hidup instans notebook, SageMaker AI juga mengirimkan apa pun yang dikirim oleh wadah algoritma, wadah model, atau konfigurasi siklus hidup instance notebook ke stdout atau stderr ke Amazon CloudWatch Logs. Anda dapat menggunakan informasi ini untuk debugging dan untuk menganalisis kemajuan.

Gunakan Log untuk Memantau Pipeline Inferensi

Tabel berikut mencantumkan grup log dan aliran log SageMaker AI. dikirim ke Amazon CloudWatch

Pengaliran log adalah urutan log acara yang berbagi sumber yang sama. Setiap sumber log yang terpisah CloudWatch membentuk aliran log terpisah. Grup log adalah grup log stream yang berbagi pengaturan retensi, pemantauan, dan kontrol akses yang sama.

Log

Catat Nama Grup Nama Stream Log
/aws/sagemaker/TrainingJobs

[training-job-name]/algo-[instance-number-in-cluster]-[epoch_timestamp]

/aws/sagemaker/Endpoints/[EndpointName]

[production-variant-name]/[instance-id]

[production-variant-name]/[instance-id]

[production-variant-name]/[instance-id]/[container-name provided in the SageMaker AI model] (For Inference Pipelines)Untuk log Inference Pipelines, jika Anda tidak memberikan nama wadah, gunakan ** CloudWatch container-1, container-2**, dan seterusnya, sesuai urutan wadah yang disediakan dalam model.

/aws/sagemaker/NotebookInstances

[notebook-instance-name]/[LifecycleConfigHook]

/aws/sagemaker/TransformJobs

[transform-job-name]/[instance-id]-[epoch_timestamp]

[transform-job-name]/[instance-id]-[epoch_timestamp]/data-log

[transform-job-name]/[instance-id]-[epoch_timestamp]/[container-name provided in the SageMaker AI model] (For Inference Pipelines)Untuk log Inference Pipelines, jika Anda tidak memberikan nama wadah, gunakan ** CloudWatch container-1, container-2**, dan seterusnya, sesuai urutan wadah yang disediakan dalam model.

catatan

SageMaker AI membuat grup /aws/sagemaker/NotebookInstances log saat Anda membuat instance notebook dengan konfigurasi siklus hidup. Untuk informasi selengkapnya, lihat Kustomisasi instance SageMaker notebook menggunakan skrip LCC.

Untuk informasi selengkapnya tentang SageMaker pencatatan AI, lihatCloudWatch Log untuk Amazon SageMaker AI.