Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Log dan Metrik Pipeline Inferensi
Pemantauan penting untuk menjaga keandalan, ketersediaan, dan kinerja sumber daya SageMaker AI Amazon. Untuk memantau dan memecahkan masalah kinerja pipeline inferensi, gunakan CloudWatch log Amazon dan pesan kesalahan. Untuk informasi tentang alat pemantauan yang SageMaker disediakan AI, lihatMemantau AWS sumber daya di Amazon SageMaker AI.
Gunakan Metrik untuk Memantau Multi-container Model
Untuk memantau model multi-kontainer di Inference Pipelines, gunakan Amazon. CloudWatch CloudWatchmengumpulkan data mentah dan memprosesnya menjadi metrik yang dapat dibaca dan hampir real-time. SageMaker Pekerjaan pelatihan AI dan titik akhir menulis CloudWatch metrik dan log di AWS/SageMaker namespace.
Tabel berikut mencantumkan metrik dan dimensi untuk berikut ini:
-
Pemanggilan titik akhir
-
Pekerjaan pelatihan, pekerjaan transformasi batch, dan instans titik akhir
Dimensi adalah name/value pasangan yang secara unik mengidentifikasi metrik. Anda dapat menetapkan hingga 10 dimensi ke metrik. Untuk informasi lebih lanjut tentang pemantauan dengan CloudWatch, lihatMetrik SageMaker AI Amazon di Amazon CloudWatch.
Metrik Pemanggilan Titik Akhir
AWS/SageMakerNamespace menyertakan metrik permintaan berikut dari panggilan ke InvokeEndpoint.
Metrik dilaporkan pada interval 1 menit.
| Metrik | Deskripsi |
|---|---|
Invocation4XXErrors |
Jumlah Satuan: Tidak ada Statistik yang valid: |
Invocation5XXErrors |
Jumlah Satuan: Tidak ada Statistik yang valid: |
Invocations |
Per Untuk mendapatkan jumlah total permintaan yang dikirim ke titik akhir model, gunakan Satuan: Tidak ada Statistik yang valid: |
InvocationsPerInstance |
Jumlah pemanggilan titik akhir yang dikirim ke model, dinormalisasi oleh masing-masing Satuan: Tidak ada Statistik valid: |
ModelLatency |
Waktu yang dibutuhkan model atau model untuk merespons. Ini termasuk waktu yang dibutuhkan untuk mengirim permintaan, untuk mengambil respons dari wadah model, dan untuk menyelesaikan inferensi dalam wadah. ModelLatencyadalah total waktu yang dibutuhkan oleh semua kontainer dalam pipa inferensi.Satuan: Mikrodetik Statistik yang valid: |
OverheadLatency |
Waktu ditambahkan ke waktu yang dibutuhkan untuk menanggapi permintaan klien oleh SageMaker AI untuk overhead. Satuan: Mikrodetik Statistik yang valid: |
ContainerLatency |
Waktu yang dibutuhkan wadah Inference Pipelines untuk merespons seperti yang dilihat dari SageMaker AI. ContainerLatencytermasuk waktu yang dibutuhkan untuk mengirim permintaan, untuk mengambil respons dari wadah model, dan untuk menyelesaikan inferensi dalam wadah.Satuan: Mikrodetik Statistik yang valid: |
Dimensi untuk Metrik Pemanggilan Titik Akhir
| Dimensi | Deskripsi |
|---|---|
EndpointName, VariantName, ContainerName |
Memfilter metrik pemanggilan titik akhir untuk a |
Untuk titik akhir pipeline inferensi, CloudWatch daftarkan metrik latensi per kontainer di akun Anda sebagai Metrik Kontainer T itik Akhir dan Metrik Var ian Titik Ak hir di namespace SageMaker AI, sebagai berikut. Met ContainerLatency rik hanya muncul untuk pipeline inferensi.
Untuk setiap titik akhir dan setiap wadah, metrik latensi menampilkan nama untuk wadah, titik akhir, varian, dan metrik.
Pekerjaan Pelatihan, Pekerjaan Transformasi Batch, dan Metrik Instans Titik Akhir
Ruang nama, /aws/sagemaker/TrainingJobs/aws/sagemaker/TransformJobs, dan menyer /aws/sagemaker/Endpoints takan metrik berikut untuk pekerjaan pelatihan dan instance titik akhir.
Metrik dilaporkan pada interval 1 menit.
| Metrik | Deskripsi |
|---|---|
CPUUtilization |
Persentase unit CPU yang digunakan oleh kontainer yang berjalan pada instance. Nilainya berkisar dari 0% hingga 100%, dan dikalikan dengan jumlah CPU. Misalnya, jika ada empat CPU, Untuk pekerjaan pelatihan, Untuk pekerjaan transformasi batch, Untuk model multi-container, Untuk varian titik akhir, Unit: Persen |
MemoryUtilization |
Persentase memori yang digunakan oleh kontainer yang berjalan pada sebuah instance. Nilai ini berkisar dari 0% hingga 100%. Untuk pekerjaan pelatihan, Untuk pekerjaan transformasi batch, MemoryUtilization adalah jumlah memori yang digunakan oleh semua container yang berjalan pada instance.Untuk varian titik akhir, Unit: Persen |
GPUUtilization |
Persentase unit GPU yang digunakan oleh kontainer yang berjalan pada instance. Untuk pekerjaan pelatihan, Untuk pekerjaan transformasi batch, Untuk model multi-container, Untuk varian titik akhir, Unit: Persen |
GPUMemoryUtilization |
Persentase memori GPU yang digunakan oleh kontainer yang berjalan pada instance. GPUMemoryUtilization berkisar dari 0% hingga 100% dan dikalikan dengan jumlah GPU. Misalnya, jika ada empat GPU, Untuk pekerjaan pelatihan, Untuk pekerjaan transformasi batch, Untuk model multi-kontainer, Untuk varian titik akhir, Unit: Persen |
DiskUtilization |
Persentase ruang disk yang digunakan oleh kontainer yang berjalan pada sebuah instance. DiskUtilization berkisar dari 0% hingga 100%. Metrik ini tidak didukung untuk pekerjaan transformasi batch. Untuk pekerjaan pelatihan, Untuk varian titik akhir, Unit: Persen |
Dimensi untuk Pekerjaan Pelatihan, Pekerjaan Transformasi Batch, dan Metrik Instans Titik Akhir
| Dimensi | Deskripsi |
|---|---|
Host |
Untuk pekerjaan pelatihan, Untuk pekerjaan transformasi batch, Untuk titik akhir, |
Untuk membantu Anda men-debug pekerjaan pelatihan, titik akhir, dan konfigurasi siklus hidup instans notebook, SageMaker AI juga mengirimkan apa pun yang dikirim oleh wadah algoritma, wadah model, atau konfigurasi siklus hidup instance notebook ke stdout atau stderr ke Amazon CloudWatch Logs. Anda dapat menggunakan informasi ini untuk debugging dan untuk menganalisis kemajuan.
Gunakan Log untuk Memantau Pipeline Inferensi
Tabel berikut mencantumkan grup log dan aliran log SageMaker AI. dikirim ke Amazon CloudWatch
Pengaliran log adalah urutan log acara yang berbagi sumber yang sama. Setiap sumber log yang terpisah CloudWatch membentuk aliran log terpisah. Grup log adalah grup log stream yang berbagi pengaturan retensi, pemantauan, dan kontrol akses yang sama.
Log
| Catat Nama Grup | Nama Stream Log |
|---|---|
/aws/sagemaker/TrainingJobs |
|
/aws/sagemaker/Endpoints/[EndpointName] |
|
|
|
|
|
|
|
/aws/sagemaker/NotebookInstances |
|
/aws/sagemaker/TransformJobs |
|
|
|
|
|
|
catatan
SageMaker AI membuat grup /aws/sagemaker/NotebookInstances log saat Anda membuat instance notebook dengan konfigurasi siklus hidup. Untuk informasi selengkapnya, lihat Kustomisasi instance SageMaker notebook menggunakan skrip LCC.
Untuk informasi selengkapnya tentang SageMaker pencatatan AI, lihatCloudWatch Log untuk Amazon SageMaker AI.