Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Perubahan ketersediaan Amazon SageMaker Model Monitor
catatan
Amazon SageMaker Model Monitor tidak lagi terbuka untuk pelanggan baru. Pelanggan yang sudah ada dapat terus menggunakan layanan seperti biasa. AWS terus berinvestasi dalam peningkatan keamanan dan ketersediaan untuk Model Monitor, tetapi kami tidak berencana untuk memperkenalkan fitur baru.
Open-source SageMaker Solusi pemantauan QuickSight AI+Amazon+Amazon CloudWatch
Kombinasi solusi pemantauan Amazon SageMaker AI sumber terbuka, dasbor QuickSight tata kelola Amazon, dan Amazon CloudWatch berfungsi sebagai pengganti Amazon SageMaker Model Monitor.
Solusi pemantauan Amazon SageMaker AI sumber terbuka (diterbitkan dalam aws-samples GitHub organisasi
Pemantauan inferensi dengan Amazon QuickSight menambahkan lapisan tata kelola di atas jalur inferensi produksi Anda untuk pemantauan waktu nyata dan prediktif. Ini terus melacak prediksi dan metrik kualitas data, menangani kebenaran dasar yang tertunda, dan memvisualisasikan tren drift dan model-kinerja di dasbor eksekutif. Solusi ini menggabungkan Aplikasi SageMaker AI MLFlow dan Evidently AI untuk analisis penyimpangan statistik dengan data lake Athena Iceberg, EventBridge-triggered Lambda untuk analisis terjadwal, peringatan SNS, dan dasbor. QuickSight
Amazon CloudWatch menyediakan pemantauan tingkat sistem dan tingkat inferensi dengan metrik yang disempurnakan untuk SageMaker titik akhir, termasuk latensi pemanggilan, kesalahan model, pemanfaatan, dan metrik khusus dengan alarm deteksi anomali. CPU/GPU
Mengganti Amazon SageMaker Model Monitor dengan solusi sumber terbuka, QuickSight, dan CloudWatch
Bagian ini memandu Anda untuk mengganti penerapan Amazon SageMaker Model Monitor yang ada menggunakan solusi pemantauan Amazon SageMaker AI sumber terbuka (AI MLFlow Apps + Jelas SageMaker AI), QuickSight dasbor tata kelola Amazon, dan Amazon. CloudWatch Solusi ini mendukung fungsionalitas yang setara dan diperluas untuk pemantauan kualitas data, pemantauan kualitas model, deteksi penyimpangan bias, deteksi drift atribusi fitur, dan pemantauan kinerja sistem untuk model yang digunakan di Amazon AI. SageMaker
Menghapus Monitor Model
Hentikan Model Monitor untuk jadwal pemantauan baru
Jika alur kerja Anda termasuk membuat jadwal pemantauan menggunakanDefaultModelMonitor,, ModelQualityMonitorModelBiasMonitor, atau ModelExplainabilityMonitor kelas dari SDK SageMaker Python, atau CreateMonitoringSchedule API, transisi ke alternatif yang dijelaskan di bagian Mengonfigurasi Penggantian di bawah ini.
Hapus jadwal pemantauan yang ada
Jadwal pemantauan berputar Processing Job instance (contoh:ml.m5.xlarge) pada jadwal berulang. Menghapusnya membantu menghilangkan biaya komputasi yang sedang berlangsung.
Menggunakan SageMaker Python SDK:
import sagemaker from sagemaker.model_monitor import DefaultModelMonitor session = sagemaker.Session() # List all monitoring schedules schedules = session.sagemaker_client.list_monitoring_schedules() # Delete each schedule for schedule in schedules['MonitoringScheduleSummaries']: schedule_name = schedule['MonitoringScheduleName'] print(f"Deleting monitoring schedule: {schedule_name}") session.sagemaker_client.delete_monitoring_schedule( MonitoringScheduleName=schedule_name )
Menggunakan AWS CLI:
# List all monitoring schedules aws sagemaker list-monitoring-schedules # Delete a specific monitoring schedule aws sagemaker delete-monitoring-schedule \ --monitoring-schedule-name "my-data-quality-monitor"
catatan
Menghapus jadwal pemantauan juga menghentikan jadwal jika belum dihentikan. Ini tidak menghapus riwayat pelaksanaan pekerjaan dari jadwal pemantauan.
Mengkonfigurasi penggantian
Memilih solusi pemantauan
Repositori solusi pemantauan Amazon SageMaker AI sumber terbuka menyediakan tujuh solusi pemantauan
| Solusi | Jenis inferensi | Deployment | Fokus pemantauan | Terbaik untuk |
|---|---|---|---|---|
| Pipa Pemantauan Batch ML Prediktif | Transformasi Batch | 2 notebook ( SageMaker eksperimen+Pipeline) | Data + model penyimpangan kualitas | Prediksi batch berkala |
| Pemantauan Titik Akhir ML Prediktif | Real-time titik akhir (Pengambilan Data) | Notebook+CDK Lambda | Data + model penyimpangan kualitas | Real-time titik akhir diskalakan dengan CDK |
| Real-Time Pemantauan Inferensi dengan Terbukti AI + SNS | Real-time titik akhir (Pengambilan Data) | Notebook lokakarya (rujukan) | Data + model penyimpangan kualitas | Peringatan email ringan pada titik akhir yang ada |
| Real-Time Pemantauan Inferensi dengan Dasbor QuickSight | Real-time titik akhir | Notebook+skrip (Athena Iceberg lake) | Drift+kinerja+kebenaran dasar yang tertunda | Dasbor tata kelola produksi (lihat meta-monitoring di bawah) |
| Pemantauan Inferensi LLM | Real-time titik akhir (Pengambilan Data) | CDK (Step Functions+Lambda) | Evaluasi AI generatif (keamanan, relevansi, kelancaran, dll.) | Pemantauan keamanan dan kualitas LLM |
| SageMaker Observabilitas Sumber Daya dengan Grafana | Real-time titik akhir | Notebook tunggal (Grafana yang Dikelola Amazon) | GPU/CPU/memory + biaya | Multi-model optimalisasi biaya dan kapasitas |
| Pengamatan Kualitas LLM dengan Grafana | Real-time titik akhir | Notebook (Grafana Terkelola +) CloudWatch | Keamanan, relevansi, nada, kualitas komposit | Deteksi regresi kualitas keluaran LLM |
Memulai dengan solusi pemantauan
Titik awal yang direkomendasikan untuk mengganti data Model Monitor dan pemantauan kualitas model adalah Pipeline Pemantauan Batch Prediktif (untuk beban kerja batch/Batch Transform) dan solusi Pemantauan Titik Akhir Prediktif (untuk titik akhir waktu nyata). Keduanya menggunakan kumpulan data Pemasaran Bank UCI di luar kotak, sehingga Anda dapat menjalankannya dari ujung ke ujung sebelum mengadaptasinya dengan model Anda sendiri.
Pipa Pemantauan Batch ML Prediktif (dua notebook, dijalankan secara berurutan):
-
Experimentation (
predictive_ml_experimentation_data_model_monitoring_evidently.ipynb): melatih model XGBoost dengan pelacakan MLFlow, menjalankan inferensi Batch Transform, lalu berjalan EvidentlyDataDriftPreset,, danDataSummaryPreset, mencatat semua metrik danClassificationPresetlaporan ke Aplikasi MLFlow Anda. HTML/JSON -
Otomatisasi pipa (
batch_monitoring_pipeline.ipynb): mengoperasionalkan alur kerja ke dalam SageMaker Pipeline denganTransformStepdan TerbuktiProcessingSteps, topik SNS untuk peringatan, dan jadwal. EventBridge Di Bagian 2, aturbaseline_s3_uri,,production_s3_urimlflow_app_name,mlflow_experiment_name(cocokkan Notebook 1)notification_email,, danschedule_expression(misalnya,rate(1 day)). Konfirmasikan langganan email SNS sebelum menjalankan pertama. Ambang batas drift hidupscripts/monitoring_processor.py(default: peringatan ketika lebih dari 30% fitur melayang).
Pemantauan Titik Akhir ML Prediktif (notebook, lalu CDK opsional untuk skala): Bukaml_experimentation_with_data_model_monitoring_evidently_realtime.ipynb, atur mlflow_app_name di Bagian 2, dan jalankan Bagian 1-8. Ini melatih model, menyebarkan titik akhir real-time dengan Pengambilan Data, dan berjalan dengan jelas DataDriftPreset melawan garis dasar dan melawan kebenaran dasar. ClassificationPreset
Untuk menskalakan, gunakan dua fungsi Docker-based Lambda (penyimpangan data dan kualitas model) dengan CDK. Daricdk/, jalankannpm install, ekspor variabel yang dicetak di Bagian 9 (ENDPOINT_NAME,BUCKET,PREFIX,BASELINE_KEY,CAPTURE_PREFIX,GROUND_TRUTH_KEY, MLFLOW_TRACKING_URI MLFLOW_EXPERIMENTFEATURE_COLUMNS, opsionalSNS_TOPIC_ARN), lalu jalankan bash scripts/deploy.sh (berjalan cdk bootstrap secara otomatis).
Aktifkan EventBridge notifikasi S3 di bucket dan tambahkan pemicu S3: penyimpangan data di s3:ObjectCreated:* bawah${PREFIX}/data-capture/, kualitas model di bawah. ${PREFIX}/data/ground_truth/
aws s3api put-bucket-notification-configuration \ --bucket <your-sagemaker-bucket> \ --notification-configuration '{"EventBridgeConfiguration": {}}'
Kualitas model Lambda memperingatkan melalui SNS ketika metrik jatuh di bawah ambang batasnya (default: F1 0.70, Akurasi 0.80, ROC AUC 0.75; ganti dengan,,). THRESHOLD_F1 THRESHOLD_ACCURACY THRESHOLD_ROC_AUC
Kualitas model Lambda memperingatkan melalui SNS ketika metrik jatuh di bawah ambang batasnya (default: F1 0.70, Akurasi 0.80, ROC AUC 0.75; ganti dengan,,). THRESHOLD_F1 THRESHOLD_ACCURACY THRESHOLD_ROC_AUC
Untuk alternatif ringan pada titik akhir yang ada, Pemantauan Real-Time Inferensi dengan solusi Evidently AI + SNS menambahkan satu langkah FrameworkProcessor Pemrosesan (EvidentlyMonitoring) ditambah topik EventBridge Scheduler dan SNS, tanpa data lake atau dasbor. Ini adalah rujukan ke Bagian 8 Notebook 06 di bengkel amazon-sagemaker-dari-idea-ke-produksidrifted_columns_share melebihi DriftThreshold (default0.05) atau saat dikonfigurasi CriticalFeatures drift.
Mengganti pemantauan kualitas data
Pemantauan kualitas data Model Monitor mendeteksi penyimpangan statistik dalam fitur input dengan membandingkan data inferensi langsung dengan baseline data pelatihan. Ini menghitung statistik (rata-rata, standar deviasi, min, maks, hitungan unik) dan memeriksa kendala (tipe data, kelengkapan, rentang nilai) menggunakan mesin yang berjalan pada Pekerjaan Pemrosesan terjadwal. Deequ-based
Opsi 1: Open-source solusi dengan Evidently AI
Solusi pemantauan menggunakan Evidently AI DataDriftPreset untuk mendeteksi penyimpangan fitur, komputasi PSI (Population Stability Index) dan statistik KS untuk setiap fitur. Garis dasar pelatihan dibaca sebagai kumpulan data referensi dan data inferensi terbaru sebagai kumpulan data saat ini. Solusi batch dan endpoint juga dijalankan DataSummaryPreset untuk memunculkan masalah kualitas data (nilai yang hilang, outlier, pemeriksaan integritas), yang sangat cocok dengan pemeriksaan kendala Model Monitor. Skor drift dibandingkan dengan ambang batas yang dapat dikonfigurasi, dicatat ke Aplikasi SageMaker AI MLFlow bersama metrik pelatihan, dan muncul sebagai laporan HTML interaktif.
Penggantian ini sangat skalabel dan dapat disesuaikan sepenuhnya:
-
Scalable: Hitung skala ke nol saat idle. EventBridge-triggered Lambda menjalankan analisis drift sesuai jadwal, dan partisi tabel Athena Iceberg membuat biaya pemindaian tetap rendah seiring bertambahnya volume data. High-volume penerapan diskalakan secara linier tanpa kapasitas cadangan.
-
Dapat disesuaikan: Anda mengontrol preset drift, ambang batas per fitur, jendela lookback, dan jadwal melalui pusat.
config.yamlAnda dapat menambahkan pengujian drift khusus domain di luar PSI (misalnya, KPI bisnis seperti pergeseran tingkat persetujuan). -
Garis keturunan terpadu: Metrik drift ditempatkan bersama dengan metrik pelatihan di Aplikasi SageMaker AI MLFlow yang sama, memberikan garis keturunan model lengkap dan analisis tren drift.
Lihat solusi pemantauan Amazon SageMaker AI sumber terbuka
Opsi 2: Metrik CloudWatch kustom Amazon+deteksi anomali
Untuk pemantauan kualitas data ringan tanpa saluran pemantauan penuh, publikasikan metrik khusus ke CloudWatch dan gunakan alarm deteksi anomali. Lihat Menggunakan deteksi CloudWatch anomali untuk langkah-langkah rinci.
Mengganti pemantauan kualitas model
Pemantauan kualitas model Model Monitor melacak akurasi prediksi dengan menggabungkan label kebenaran dasar dari S3 dengan prediksi titik akhir dan metrik komputasi (akurasi, presisi, ingatan, F1, AUC, RMSE, MAE) sesuai jadwal.
Opsi 1: Open-source solusi dengan Evidently AI
Solusi pemantauan menggunakan Evidently AI ClassificationPreset untuk menghitungROC-AUC, presisi, mengingat, F1, dan matriks kebingungan setiap kali kebenaran dasar tersedia. Solusinya mencakup pola untuk merekonsiliasi kebenaran dasar yang tertunda dengan prediksi dengan ID inferensi, yang membahas latensi label dunia nyata yang membuat pemantauan kualitas model menjadi sulit.
Opsi 2: metrik CloudWatch khusus
Publikasikan metrik kualitas model CloudWatch saat kebenaran dasar tersedia.
Mengganti pemantauan penyimpangan bias
Pemantauan penyimpangan bias Model Monitor mendeteksi perubahan metrik keadilan dari waktu ke waktu dengan membandingkan prediksi langsung terhadap garis dasar bias di seluruh atribut yang dilindungi.
Segment-sliced metrik dengan Evidently AI, masuk ke MLFlow dan QuickSight
Lacak bias dengan menghitung kinerja dan metrik hasil per segmen atribut yang dilindungi (misalnya, oleh, genderage_band, atauregion) dan membandingkannya dengan baseline pelatihan. Hal yang sama Jelas ClassificationPreset digunakan untuk kualitas model dijalankan per segmen, dan metrik per segmen yang dihasilkan (tingkat pemilihan, tarif true/false positif, precision/recall) dicatat ke Aplikasi SageMaker AI MLFlow dan muncul di dasbor tata kelola. QuickSight
Tentukan ambang keadilan Anda sendiri (misalnya, kesenjangan maksimum yang dapat diterima dalam tingkat seleksi atau tingkat positif sejati antar segmen) dan waspadai melalui Amazon SNS ketika celah melewati ambang batas, menggunakan EventBridge pola+Lambda yang sama dengan monitor kualitas data dan model. Karena semuanya open-source dan berjalan di akun Anda, Anda mengontrol atribut mana yang dipantau dan definisi keadilan mana yang berlaku.
Inferensi meta-monitoring dengan Amazon QuickSight (real-time dan pemantauan prediktif)
Model prediktif dapat secara diam-diam menurun dalam produksi. Penangan penipuan mulai melihat lonjakan positif palsu, petugas pinjaman melihat aplikasi yang seharusnya ditandai, dan perencana berakhir dengan persediaan berlebih dari permintaan yang terlalu tinggi. Meta-monitoring memberikan umpan balik berkelanjutan kepada tim tentang kinerja model produksi dan memberi tahu mereka segera setelah kualitas model atau penyimpangan data muncul, sehingga mereka dapat meningkatkan model secara proaktif.
Solusi ini menggabungkan layanan AWS terkelola (Amazon SageMaker AI, Amazon Athena, AWS
Lambda, Amazon SQS, Amazon SNS, Amazon, QuickSight Amazon) dengan alat MLFlow sumber terbuka SageMaker (AI MLFlow Apps EventBridge, Evidently AI) untuk membuat sistem pemantauan siap produksi. Dalam repositori solusi pemantauan, ini adalah solusi Pemantauan Real-Time Inferensi dengan QuickSight Dasbor; implementasi referensi lengkap berada di sample-mlops-bestpractices
Prasyarat:
-
Domain SageMaker AI dengan server pelacak MLFlow.
-
Peran SageMaker eksekusi dengan izin untuk S3, Athena, Lambda, SQS, SNS, EventBridge dan (repo menyertakan kebijakan IAM sebaris yang tepat dan/pembantu).
create_or_update_sagemaker_rolecreate_lambda_role -
Bucket S3 untuk penyimpanan data.
-
Python 3.12+ dan manajer
uvpaket (untuk script/CLI jalur); langganan QuickSight Enterprise untuk dasbor tata kelola.
Pilih jalur penyiapan:
Opsi A (direkomendasikan untuk pengguna baru): Jika Anda tidak memiliki SageMaker domain, gunakan CloudFormation template dicloudformation/. Ini menyediakan SageMaker domain, profil pengguna, JupyterLab ruang, server pelacakan MLFlow, bucket S3, dan VPC pendukung, mengkloning repo secara otomatis, dan menulis populated pada peluncuran pertama. .env
Opsi B (domain yang ada): Jika Anda sudah memiliki SageMaker domain dengan server pelacak MLFlow, kloning repo dan isi secara JupyterLab manual. .env
Pengaturan
Siapkan pelatihan untuk mempersiapkan pemantauan. Anda dapat mengarahkan semuanya dari tiga notebook di SageMaker Studio, atau menggunakan perintah CLI yang setara (setiap peta sel notebook ke perintah CI/CD untukpython main.py ...). Jika Anda menjalankan sampel ujung ke ujung, Anda tidak perlu mengeditconfig.yaml; mengisi .env dan menggunakan default berfungsi. Jika Anda sudah menerapkan model, sesuaikan pipeline pelatihan dengan langkah Anda sendiri dan pastikan titik akhir inferensi mendorong catatan prediksi ke Amazon SQS.