

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

# Perubahan ketersediaan Amazon SageMaker Model Monitor
<a name="model-monitor-availability-change"></a>

**catatan**  
Amazon SageMaker Model Monitor tidak lagi terbuka untuk pelanggan baru. Pelanggan yang sudah ada dapat terus menggunakan layanan seperti biasa. AWS terus berinvestasi dalam peningkatan keamanan dan ketersediaan untuk Model Monitor, tetapi kami tidak berencana untuk memperkenalkan fitur baru.

## Open-source SageMaker Solusi pemantauan QuickSight AI\+Amazon\+Amazon CloudWatch
<a name="model-monitor-open-source-solutions"></a>

Kombinasi solusi pemantauan Amazon SageMaker AI sumber terbuka, dasbor QuickSight tata kelola [Amazon](https://docs.aws.amazon.com/quick/latest/userguide/quick-sight-getting-started.html), dan [Amazon CloudWatch](https://docs.aws.amazon.com/cloudwatch/) berfungsi sebagai pengganti Amazon SageMaker Model Monitor.

**Solusi pemantauan Amazon SageMaker AI sumber terbuka** (diterbitkan dalam [`aws-samples` GitHub organisasi](https://github.com/aws-samples/sample-aiops-on-amazon-sagemakerai/tree/main)) memberikan fondasi yang sangat skalabel dan dapat disesuaikan untuk pemantauan kualitas data dan model yang komprehensif. Mereka dibangun di atas layanan AWS terkelola (Amazon SageMaker AI, Amazon Athena, Amazon, AWS Lambda Amazon SQS EventBridge, Amazon SNS, QuickSight Amazon) dikombinasikan dengan alat MLFlow sumber terbuka SageMaker (AI MLFlow Apps dan Evidently AI). Solusi berjalan sepenuhnya di dalam Anda Akun AWS dan skala dari beban kerja batch volume rendah hingga titik akhir real-time throughput tinggi. Mereka mencakup inferensi batch, titik akhir waktu nyata, evaluasi LLM, dan observabilitas sumber daya GPU, dan Anda menyesuaikannya dengan kumpulan data, model, dan ambang batas drift Anda sendiri.

**Pemantauan inferensi dengan Amazon QuickSight** menambahkan lapisan tata kelola di atas jalur inferensi produksi Anda untuk pemantauan waktu nyata dan prediktif. Ini terus melacak prediksi dan metrik kualitas data, menangani kebenaran dasar yang tertunda, dan memvisualisasikan tren drift dan model-kinerja di dasbor eksekutif. Solusi ini menggabungkan Aplikasi SageMaker AI MLFlow dan Evidently AI untuk analisis penyimpangan statistik dengan data lake Athena Iceberg, EventBridge-triggered Lambda untuk analisis terjadwal, peringatan SNS, dan dasbor. QuickSight 

**Amazon CloudWatch** menyediakan pemantauan tingkat sistem dan tingkat inferensi dengan metrik yang disempurnakan untuk SageMaker titik akhir, termasuk latensi pemanggilan, kesalahan model, pemanfaatan, dan metrik khusus dengan alarm deteksi anomali. CPU/GPU 

## Mengganti Amazon SageMaker Model Monitor dengan solusi sumber terbuka, QuickSight, dan CloudWatch
<a name="model-monitor-replacing"></a>

Bagian ini memandu Anda untuk mengganti penerapan Amazon SageMaker Model Monitor yang ada menggunakan solusi pemantauan Amazon SageMaker AI sumber terbuka (AI MLFlow Apps \+ Jelas SageMaker AI), QuickSight dasbor tata kelola Amazon, dan Amazon. CloudWatch Solusi ini mendukung fungsionalitas yang setara dan diperluas untuk pemantauan kualitas data, pemantauan kualitas model, deteksi penyimpangan bias, deteksi drift atribusi fitur, dan pemantauan kinerja sistem untuk model yang digunakan di Amazon AI. SageMaker 

### Menghapus Monitor Model
<a name="model-monitor-removing"></a>

#### Hentikan Model Monitor untuk jadwal pemantauan baru
<a name="model-monitor-discontinue-new-schedules"></a>

Jika alur kerja Anda termasuk membuat jadwal pemantauan menggunakan`DefaultModelMonitor`,, `ModelQualityMonitor``ModelBiasMonitor`, atau `ModelExplainabilityMonitor` kelas dari SDK SageMaker Python, atau `CreateMonitoringSchedule` API, transisi ke alternatif yang dijelaskan di bagian Mengonfigurasi Penggantian di bawah ini.

#### Hapus jadwal pemantauan yang ada
<a name="model-monitor-delete-existing-schedules"></a>

Jadwal pemantauan berputar Processing Job instance (contoh:`ml.m5.xlarge`) pada jadwal berulang. Menghapusnya membantu menghilangkan biaya komputasi yang sedang berlangsung.

**Menggunakan SageMaker Python SDK:**

```
import sagemaker
from sagemaker.model_monitor import DefaultModelMonitor

session = sagemaker.Session()
# List all monitoring schedules
schedules = session.sagemaker_client.list_monitoring_schedules()
# Delete each schedule
for schedule in schedules['MonitoringScheduleSummaries']:
    schedule_name = schedule['MonitoringScheduleName']
    print(f"Deleting monitoring schedule: {schedule_name}")
    session.sagemaker_client.delete_monitoring_schedule(
        MonitoringScheduleName=schedule_name
    )
```

**Menggunakan AWS CLI:**

```
# List all monitoring schedules
aws sagemaker list-monitoring-schedules
# Delete a specific monitoring schedule
aws sagemaker delete-monitoring-schedule \
    --monitoring-schedule-name "my-data-quality-monitor"
```

**catatan**  
Menghapus jadwal pemantauan juga menghentikan jadwal jika belum dihentikan. Ini tidak menghapus riwayat pelaksanaan pekerjaan dari jadwal pemantauan.

### Mengkonfigurasi penggantian
<a name="model-monitor-configuring-replacements"></a>

#### Memilih solusi pemantauan
<a name="model-monitor-choosing-solution"></a>

Repositori [solusi pemantauan Amazon SageMaker AI sumber terbuka menyediakan tujuh solusi pemantauan](https://github.com/aws-samples/sample-aiops-on-amazon-sagemakerai/tree/main/monitoring) siap produksi yang dibangun di atas AI MLFlow Apps dan Evidently SageMaker AI. Pilih salah satu yang sesuai dengan pola inferensi dan kebutuhan operasional Anda. Semuanya open-source, berjalan di dalam Anda Akun AWS, dan dirancang untuk disesuaikan untuk kumpulan data, model, dan ambang batas drift Anda.


| Solusi | Jenis inferensi | Deployment | Fokus pemantauan | Terbaik untuk | 
| --- | --- | --- | --- | --- | 
| Pipa Pemantauan Batch ML Prediktif | Transformasi Batch | 2 notebook ( SageMaker eksperimen\+Pipeline) | Data \+ model penyimpangan kualitas | Prediksi batch berkala | 
| Pemantauan Titik Akhir ML Prediktif | Real-time titik akhir (Pengambilan Data) | Notebook\+CDK Lambda | Data \+ model penyimpangan kualitas | Real-time titik akhir diskalakan dengan CDK | 
| Real-Time Pemantauan Inferensi dengan Jelas AI \+ SNS | Real-time titik akhir (Pengambilan Data) | Notebook lokakarya (rujukan) | Data \+ model penyimpangan kualitas | Peringatan email ringan pada titik akhir yang ada | 
| Real-Time Pemantauan Inferensi dengan Dasbor QuickSight  | Real-time titik akhir | Notebook\+skrip (Athena Iceberg lake) | Drift\+kinerja\+kebenaran dasar yang tertunda | Dasbor tata kelola produksi (lihat meta-monitoring di bawah) | 
| Pemantauan Inferensi LLM | Real-time titik akhir (Pengambilan Data) | CDK (Step Functions\+Lambda) | Evaluasi AI generatif (keamanan, relevansi, kelancaran, dll.) | Pemantauan keamanan dan kualitas LLM | 
| SageMaker Observabilitas Sumber Daya dengan Grafana | Real-time titik akhir | Notebook tunggal (Grafana yang Dikelola Amazon) | GPU/CPU/memory \+ biaya | Multi-model optimalisasi biaya dan kapasitas | 
| Pengamatan Kualitas LLM dengan Grafana | Real-time titik akhir | Notebook (Grafana Terkelola \+) CloudWatch | Keamanan, relevansi, nada, kualitas komposit | Deteksi regresi kualitas keluaran LLM | 

#### Memulai dengan solusi pemantauan
<a name="model-monitor-getting-started-solutions"></a>

Titik awal yang direkomendasikan untuk mengganti data Model Monitor dan pemantauan kualitas model adalah **Pipeline Pemantauan Batch Prediktif** (untuk beban kerja batch/Batch Transform) dan solusi **Pemantauan Titik Akhir Prediktif (untuk titik akhir** waktu nyata). Keduanya menggunakan kumpulan data Pemasaran Bank UCI di luar kotak, sehingga Anda dapat menjalankannya dari ujung ke ujung sebelum mengadaptasinya dengan model Anda sendiri.

**Pipa Pemantauan Batch ML Prediktif** (dua notebook, dijalankan secara berurutan):

1. **Experimentation** (`predictive_ml_experimentation_data_model_monitoring_evidently.ipynb`): melatih model XGBoost dengan pelacakan MLFlow, menjalankan inferensi Batch Transform, lalu berjalan Evidently`DataDriftPreset`,, dan`DataSummaryPreset`, mencatat semua metrik dan `ClassificationPreset` laporan ke Aplikasi MLFlow Anda. HTML/JSON 

1. **Otomatisasi pipa** (`batch_monitoring_pipeline.ipynb`): mengoperasionalkan alur kerja ke dalam SageMaker Pipeline dengan `TransformStep` dan Terbukti `ProcessingStep` s, topik SNS untuk peringatan, dan jadwal. EventBridge Di Bagian 2, atur`baseline_s3_uri`,, `production_s3_uri``mlflow_app_name`, `mlflow_experiment_name` (cocokkan Notebook 1)`notification_email`,, dan `schedule_expression` (misalnya,`rate(1 day)`). Konfirmasikan langganan email SNS sebelum menjalankan pertama. Ambang batas drift hidup `scripts/monitoring_processor.py` (default: peringatan ketika lebih dari 30% fitur melayang).

**Pemantauan Titik Akhir ML Prediktif** (notebook, lalu CDK opsional untuk skala): Buka`ml_experimentation_with_data_model_monitoring_evidently_realtime.ipynb`, atur `mlflow_app_name` di Bagian 2, dan jalankan Bagian 1-8. Ini melatih model, menyebarkan titik akhir real-time dengan Pengambilan Data, dan berjalan dengan jelas `DataDriftPreset` melawan garis dasar dan melawan kebenaran dasar. `ClassificationPreset`

Untuk menskalakan, gunakan dua fungsi Docker-based Lambda (penyimpangan data dan kualitas model) dengan CDK. Dari`cdk/`, jalankan`npm install`, ekspor variabel yang dicetak di Bagian 9 (`ENDPOINT_NAME`,`BUCKET`,`PREFIX`,`BASELINE_KEY`,`CAPTURE_PREFIX`,`GROUND_TRUTH_KEY`, `MLFLOW_TRACKING_URI` `MLFLOW_EXPERIMENT``FEATURE_COLUMNS`, opsional`SNS_TOPIC_ARN`), lalu jalankan `bash scripts/deploy.sh` (berjalan `cdk bootstrap` secara otomatis).

Aktifkan EventBridge notifikasi S3 di bucket dan tambahkan pemicu S3: penyimpangan data di `s3:ObjectCreated:*` bawah`${PREFIX}/data-capture/`, kualitas model di bawah. `${PREFIX}/data/ground_truth/`

```
aws s3api put-bucket-notification-configuration \
  --bucket <your-sagemaker-bucket> \
  --notification-configuration '{"EventBridgeConfiguration": {}}'
```

Kualitas model Lambda memperingatkan melalui SNS ketika metrik jatuh di bawah ambang batasnya (default: F1 0.70, Akurasi 0.80, ROC AUC 0.75; ganti dengan,,). `THRESHOLD_F1` `THRESHOLD_ACCURACY` `THRESHOLD_ROC_AUC`

Kualitas model Lambda memperingatkan melalui SNS ketika metrik jatuh di bawah ambang batasnya (default: F1 0.70, Akurasi 0.80, ROC AUC 0.75; ganti dengan,,). `THRESHOLD_F1` `THRESHOLD_ACCURACY` `THRESHOLD_ROC_AUC`

Untuk alternatif ringan pada titik akhir yang ada, **Pemantauan Real-Time Inferensi dengan solusi Evidently AI \+ SNS** menambahkan satu langkah `FrameworkProcessor` Pemrosesan (`EvidentlyMonitoring`) ditambah topik EventBridge Scheduler dan SNS, tanpa data lake atau dasbor. Ini adalah rujukan ke Bagian 8 [Notebook 06 di bengkel amazon-sagemaker-dari-idea-ke-produksi](https://github.com/aws-samples/amazon-sagemaker-from-idea-to-production/blob/master/06-monitoring-with-evidently.ipynb). Peringatan menyala saat `drifted_columns_share` melebihi `DriftThreshold` (default`0.05`) atau saat dikonfigurasi `CriticalFeatures` drift.

### Mengganti pemantauan kualitas data
<a name="model-monitor-replacing-data-quality"></a>

Pemantauan kualitas data Model Monitor mendeteksi penyimpangan statistik dalam fitur input dengan membandingkan data inferensi langsung dengan baseline data pelatihan. Ini menghitung statistik (rata-rata, standar deviasi, min, maks, hitungan unik) dan memeriksa kendala (tipe data, kelengkapan, rentang nilai) menggunakan mesin yang berjalan pada Pekerjaan Pemrosesan terjadwal. Deequ-based 

#### Opsi 1: Open-source solusi dengan Evidently AI
<a name="model-monitor-data-quality-evidently"></a>

Solusi pemantauan menggunakan Evidently AI `DataDriftPreset` untuk mendeteksi penyimpangan fitur, komputasi PSI (Population Stability Index) dan statistik KS untuk setiap fitur. Garis dasar pelatihan dibaca sebagai kumpulan data referensi dan data inferensi terbaru sebagai kumpulan data saat ini. Solusi batch dan endpoint juga dijalankan `DataSummaryPreset` untuk memunculkan masalah kualitas data (nilai yang hilang, outlier, pemeriksaan integritas), yang sangat cocok dengan pemeriksaan kendala Model Monitor. Skor drift dibandingkan dengan ambang batas yang dapat dikonfigurasi, dicatat ke Aplikasi SageMaker AI MLFlow bersama metrik pelatihan, dan muncul sebagai laporan HTML interaktif.

Penggantian ini sangat skalabel dan dapat disesuaikan sepenuhnya:
+ **Scalable**: Hitung skala ke nol saat idle. EventBridge-triggered Lambda menjalankan analisis drift sesuai jadwal, dan partisi tabel Athena Iceberg membuat biaya pemindaian tetap rendah seiring bertambahnya volume data. High-volume penerapan diskalakan secara linier tanpa kapasitas cadangan.
+ **Dapat disesuaikan**: Anda mengontrol preset drift, ambang batas per fitur, jendela lookback, dan jadwal melalui pusat. `config.yaml` Anda dapat menambahkan pengujian drift khusus domain di luar PSI (misalnya, KPI bisnis seperti pergeseran tingkat persetujuan).
+ **Garis keturunan terpadu**: Metrik drift ditempatkan bersama dengan metrik pelatihan di Aplikasi SageMaker AI MLFlow yang sama, memberikan garis keturunan model lengkap dan analisis tren drift.

Lihat [solusi pemantauan Amazon SageMaker AI sumber terbuka](https://github.com/aws-samples/sample-aiops-on-amazon-sagemakerai/tree/main/monitoring) untuk langkah-langkah penyiapan terperinci. Solusi QuickSight-based real-time dijelaskan di Meta-Monitoring bagian Inferensi di bawah ini.

#### Opsi 2: Metrik CloudWatch kustom Amazon\+deteksi anomali
<a name="model-monitor-data-quality-cloudwatch"></a>

Untuk pemantauan kualitas data ringan tanpa saluran pemantauan penuh, publikasikan metrik khusus ke CloudWatch dan gunakan alarm deteksi anomali. Lihat [Menggunakan deteksi CloudWatch anomali untuk langkah-langkah](https://docs.aws.amazon.com/AmazonCloudWatch/latest/monitoring/CloudWatch_Anomaly_Detection.html) rinci.

### Mengganti pemantauan kualitas model
<a name="model-monitor-replacing-model-quality"></a>

Pemantauan kualitas model Model Monitor melacak akurasi prediksi dengan menggabungkan label kebenaran dasar dari S3 dengan prediksi titik akhir dan metrik komputasi (akurasi, presisi, ingatan, F1, AUC, RMSE, MAE) sesuai jadwal.

#### Opsi 1: Open-source solusi dengan Evidently AI
<a name="model-monitor-model-quality-evidently"></a>

Solusi pemantauan menggunakan Evidently AI `ClassificationPreset` untuk menghitungROC-AUC, presisi, mengingat, F1, dan matriks kebingungan setiap kali kebenaran dasar tersedia. Solusinya mencakup pola untuk merekonsiliasi kebenaran dasar yang tertunda dengan prediksi dengan ID inferensi, yang membahas latensi label dunia nyata yang membuat pemantauan kualitas model menjadi sulit.

#### Opsi 2: metrik CloudWatch khusus
<a name="model-monitor-model-quality-cloudwatch"></a>

Publikasikan metrik kualitas model CloudWatch saat kebenaran dasar tersedia.

### Mengganti pemantauan penyimpangan bias
<a name="model-monitor-replacing-bias-drift"></a>

Pemantauan penyimpangan bias Model Monitor mendeteksi perubahan metrik keadilan dari waktu ke waktu dengan membandingkan prediksi langsung terhadap garis dasar bias di seluruh atribut yang dilindungi.

#### Segment-sliced metrik dengan Evidently AI, masuk ke MLFlow dan QuickSight
<a name="model-monitor-bias-drift-evidently"></a>

Lacak bias dengan menghitung kinerja dan metrik hasil per segmen atribut yang dilindungi (misalnya, oleh, `gender``age_band`, atau`region`) dan membandingkannya dengan baseline pelatihan. Hal yang sama Jelas `ClassificationPreset` digunakan untuk kualitas model dijalankan per segmen, dan metrik per segmen yang dihasilkan (tingkat pemilihan, tarif true/false positif, precision/recall) dicatat ke Aplikasi SageMaker AI MLFlow dan muncul di dasbor tata kelola. QuickSight 

Tentukan ambang keadilan Anda sendiri (misalnya, kesenjangan maksimum yang dapat diterima dalam tingkat seleksi atau tingkat positif sejati antar segmen) dan waspadai melalui Amazon SNS ketika celah melewati ambang batas, menggunakan EventBridge pola\+Lambda yang sama dengan monitor kualitas data dan model. Karena semuanya open-source dan berjalan di akun Anda, Anda mengontrol atribut mana yang dipantau dan definisi keadilan mana yang berlaku.

### Inferensi meta-monitoring dengan Amazon QuickSight (real-time dan pemantauan prediktif)
<a name="model-monitor-meta-monitoring"></a>

Model prediktif dapat secara diam-diam menurun dalam produksi. Penangan penipuan mulai melihat lonjakan positif palsu, petugas pinjaman melihat aplikasi yang seharusnya ditandai, dan perencana berakhir dengan persediaan berlebih dari permintaan yang terlalu tinggi. Meta-monitoring memberikan umpan balik berkelanjutan kepada tim tentang kinerja model produksi dan memberi tahu mereka segera setelah kualitas model atau penyimpangan data muncul, sehingga mereka dapat meningkatkan model secara proaktif.

Solusi ini menggabungkan layanan AWS terkelola (Amazon SageMaker AI, Amazon Athena, AWS Lambda, Amazon SQS, Amazon SNS, Amazon, QuickSight Amazon) dengan alat MLFlow sumber terbuka SageMaker (AI MLFlow Apps EventBridge, Evidently AI) untuk membuat sistem pemantauan siap produksi. Dalam repositori solusi pemantauan, ini adalah solusi **Pemantauan Real-Time Inferensi dengan QuickSight Dasbor**; implementasi referensi lengkap berada di [sample-mlops-bestpractices](https://github.com/aws-samples/sample-mlops-bestpractices) dan menggunakan model deteksi penipuan kartu kredit (XGBoost) sebagai contoh yang dikerjakan. Ini mengimplementasikan arsitektur 11 langkah yang mencakup jalur pelatihan, pemantauan inferensi, dan dasbor tata kelola, dengan tiga notebook terpandu yang mendorong alur kerja.

**Prasyarat:**
+ Domain SageMaker AI dengan server pelacak MLFlow.
+ Peran SageMaker eksekusi dengan izin untuk S3, Athena, Lambda, SQS, SNS, EventBridge dan (repo menyertakan kebijakan IAM sebaris yang tepat dan/pembantu). `create_or_update_sagemaker_role` `create_lambda_role`
+ Bucket S3 untuk penyimpanan data.
+ Python 3.12\+ dan manajer `uv` paket (untuk script/CLI jalur); langganan QuickSight Enterprise untuk dasbor tata kelola.

**Pilih jalur penyiapan:**

**Opsi A (direkomendasikan untuk pengguna baru):** Jika Anda tidak memiliki SageMaker domain, gunakan CloudFormation template di`cloudformation/`. Ini menyediakan SageMaker domain, profil pengguna, JupyterLab ruang, server pelacakan MLFlow, bucket S3, dan VPC pendukung, mengkloning repo secara otomatis, dan menulis populated pada peluncuran pertama. `.env`

**Opsi B (domain yang ada):** Jika Anda sudah memiliki SageMaker domain dengan server pelacak MLFlow, kloning repo dan isi secara JupyterLab manual. `.env`

#### Pengaturan
<a name="model-monitor-meta-monitoring-setup"></a>

Siapkan pelatihan untuk mempersiapkan pemantauan. Anda dapat mengarahkan semuanya dari tiga notebook di SageMaker Studio, atau menggunakan perintah CLI yang setara (setiap peta sel notebook ke perintah CI/CD untuk`python main.py ...`). Jika Anda menjalankan sampel ujung ke ujung, Anda tidak perlu mengedit`config.yaml`; mengisi `.env` dan menggunakan default berfungsi. Jika Anda sudah menerapkan model, sesuaikan pipeline pelatihan dengan langkah Anda sendiri dan pastikan titik akhir inferensi mendorong catatan prediksi ke Amazon SQS.