View a markdown version of this page

Dapatkan rekomendasi inferensi untuk titik akhir yang ada - Amazon SageMaker AI

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Dapatkan rekomendasi inferensi untuk titik akhir yang ada

Pekerjaan rekomendasi inferensi menjalankan serangkaian uji beban pada jenis instans yang direkomendasikan dan titik akhir yang ada. Pekerjaan rekomendasi inferensi menggunakan metrik kinerja yang didasarkan pada uji beban menggunakan data sampel yang Anda berikan selama pendaftaran versi model.

Anda dapat membandingkan dan mendapatkan rekomendasi inferensi untuk titik akhir Inferensi SageMaker AI yang ada untuk membantu Anda meningkatkan kinerja titik akhir Anda. Prosedur mendapatkan rekomendasi untuk titik akhir Inferensi SageMaker AI yang ada mirip dengan prosedur untuk mendapatkan rekomendasi inferensi tanpa titik akhir. Ada beberapa pengecualian fitur yang perlu diperhatikan saat membandingkan titik akhir yang ada:

  • Anda hanya dapat menggunakan satu titik akhir yang ada per pekerjaan Rekomendasi Inferensi.

  • Anda hanya dapat memiliki satu varian pada titik akhir Anda.

  • Anda tidak dapat menggunakan titik akhir yang mengaktifkan penskalaan otomatis.

  • Fungsi ini hanya didukung untuk Real-Time Inferensi.

  • Fungsi ini tidak mendukung Real-Time Multi-Model Endpoint.

Awas

Kami sangat menyarankan agar Anda tidak menjalankan pekerjaan Rekomendasi Inferensi pada titik akhir produksi yang menangani lalu lintas langsung. Beban sintetis selama benchmarking dapat memengaruhi titik akhir produksi Anda dan menyebabkan pelambatan atau memberikan hasil benchmark yang tidak akurat. Sebaiknya gunakan titik akhir non-produksi atau pengembang untuk tujuan perbandingan.

Bagian berikut menunjukkan cara menggunakan Amazon SageMaker Inference Recommender untuk membuat rekomendasi inferensi untuk titik akhir yang ada berdasarkan jenis model Anda menggunakan AWS SDK untuk Python (Boto3) dan. AWS CLI

catatan

Sebelum Anda membuat pekerjaan rekomendasi Inferensi Recommender, pastikan Anda telah memenuhinya. Prasyarat untuk menggunakan Amazon SageMaker Inference Recommender

Prasyarat

Jika Anda belum memiliki titik akhir Inferensi SageMaker AI, Anda bisa mendapatkan rekomendasi inferensi tanpa titik akhir, atau Anda dapat membuat titik akhir Real-Time Inferensi dengan mengikuti instruksi di Buat titik akhir dan terapkan model Anda.

Membuat pekerjaan rekomendasi inferensi untuk titik akhir yang ada

Buat rekomendasi inferensi secara terprogram menggunakan AWS SDK untuk Python (Boto3), atau. AWS CLI Tentukan nama pekerjaan untuk rekomendasi inferensi Anda, nama titik akhir Inferensi SageMaker AI yang ada, ARN peran AWS IAM, konfigurasi input, dan paket model ARN Anda sejak Anda mendaftarkan model Anda dengan registri model.

AWS SDK untuk Python (Boto3)

Gunakan CreateInferenceRecommendationsJob API untuk mendapatkan rekomendasi inferensi. Setel JobType bidang 'Default' untuk pekerjaan rekomendasi inferensi. Selain itu, berikan yang berikut:

  • Berikan nama untuk pekerjaan rekomendasi Inferensi Rekomendasi Anda untuk bidang tersebutJobName. Nama pekerjaan Inferensi Recommender harus unik di dalam Wil AWS ayah dan di dalam akun Anda AWS .

  • Nama Sumber Daya Amazon (ARN) dari peran IAM yang memungkinkan Inferensi Rekomendasi untuk melakukan tugas atas nama Anda. Definisikan ini untuk RoleArn lapangan.

  • ARN dari paket model berversi yang Anda buat saat Anda mendaftarkan model Anda dengan registri model. Definisikan ini untuk ModelPackageVersionArn di InputConfig lapangan.

  • Berikan nama titik akhir Inferensi SageMaker AI yang ada yang ingin Anda tolok ukur di Inferensi Recommender Endpoints di lapangan. InputConfig

Impor AWS SDK untuk Python (Boto3) paket dan buat objek klien SageMaker AI menggunakan kelas klien. Jika Anda mengikuti langkah-langkah di bagian Prasyarat, grup paket model ARN disimpan dalam variabel bernamamodel_package_arn.

# Create a low-level SageMaker service client. import boto3 aws_region = '<region>' sagemaker_client = boto3.client('sagemaker', region_name=aws_region) # Provide your model package ARN that was created when you registered your # model with Model Registry model_package_arn = '<model-package-arn>' # Provide a unique job name for SageMaker Inference Recommender job job_name = '<job-name>' # Inference Recommender job type. Set to Default to get an initial recommendation job_type = 'Default' # Provide an IAM Role that gives SageMaker Inference Recommender permission to # access AWS services role_arn = '<arn:aws:iam::<account>:role/*>' # Provide endpoint name for your endpoint that want to benchmark in Inference Recommender endpoint_name = '<existing-endpoint-name>' sagemaker_client.create_inference_recommendations_job( JobName = job_name, JobType = job_type, RoleArn = role_arn, InputConfig = { 'ModelPackageVersionArn': model_package_arn, 'Endpoints': [{'EndpointName': endpoint_name}] } )

Lihat Panduan Refer SageMaker ensi API Amazon untuk daftar lengkap argumen opsional dan wajib yang dapat Anda sampaikan CreateInferenceRecommendationsJob.

AWS CLI

Gunakan create-inference-recommendations-job API untuk mendapatkan rekomendasi titik akhir instans. Setel job-type bidang 'Default' untuk misalnya pekerjaan rekomendasi titik akhir. Selain itu, berikan yang berikut:

  • Berikan nama untuk pekerjaan rekomendasi Inferensi Rekomendasi Anda untuk bidang tersebutjob-name. Nama pekerjaan Inferensi Recommender harus unik di dalam Wil AWS ayah dan di dalam akun Anda AWS .

  • Nama Sumber Daya Amazon (ARN) dari peran IAM yang memungkinkan Amazon SageMaker Inference Recommender melakukan tugas atas nama Anda. Definisikan ini untuk role-arn lapangan.

  • ARN dari paket model berversi yang Anda buat saat mendaftarkan model Anda dengan Model Registry. Definisikan ini untuk ModelPackageVersionArn di input-config lapangan.

  • Berikan nama titik akhir Inferensi SageMaker AI yang ada yang ingin Anda tolok ukur di Inferensi Recommender Endpoints di lapangan. input-config

aws sagemaker create-inference-recommendations-job --region <region>\ --job-name <job_name>\ --job-type Default\ --role-arn arn:aws:iam::<account:role/*>\ --input-config "{ \"ModelPackageVersionArn\": \"arn:aws:sagemaker:<region:account:role/*>\", \"Endpoints\": [{\"EndpointName\": <endpoint_name>}] }"

Dapatkan hasil pekerjaan rekomendasi inferensi Anda

Anda dapat mengumpulkan hasil pekerjaan rekomendasi inferensi Anda secara terprogram dengan prosedur yang sama untuk pekerjaan rekomendasi inferensi standar. Untuk informasi selengkapnya, lihat Dapatkan hasil pekerjaan rekomendasi inferensi Anda.

Saat Anda mendapatkan hasil pekerjaan rekomendasi inferensi untuk titik akhir yang ada, Anda akan menerima respons JSON yang serupa dengan berikut ini:

{ "JobName": "job-name", "JobType": "Default", "JobArn": "arn:aws:sagemaker:region:account-id:inference-recommendations-job/resource-id", "RoleArn": "iam-role-arn", "Status": "COMPLETED", "CreationTime": 1664922919.2, "LastModifiedTime": 1664924208.291, "InputConfig": { "ModelPackageVersionArn": "arn:aws:sagemaker:region:account-id:model-package/resource-id", "Endpoints": [ { "EndpointName": "endpoint-name" } ] }, "InferenceRecommendations": [ { "Metrics": { "CostPerHour": 0.7360000014305115, "CostPerInference": 7.456940238625975e-06, "MaxInvocations": 1645, "ModelLatency": 171 }, "EndpointConfiguration": { "EndpointName": "sm-endpoint-name", "VariantName": "variant-name", "InstanceType": "ml.g4dn.xlarge", "InitialInstanceCount": 1 }, "ModelConfiguration": { "EnvironmentParameters": [ { "Key": "TS_DEFAULT_WORKERS_PER_MODEL", "ValueType": "string", "Value": "4" } ] } } ], "EndpointPerformances": [ { "Metrics": { "MaxInvocations": 184, "ModelLatency": 1312 }, "EndpointConfiguration": { "EndpointName": "endpoint-name" } } ] }

Beberapa baris pertama memberikan informasi tentang pekerjaan rekomendasi inferensi itu sendiri. Ini termasuk nama pekerjaan, peran ARN, dan waktu pembuatan dan modifikasi terbaru.

Kam InferenceRecommendations us berisi daftar rekomendasi inferensi Inferensi Recommender.

Kam EndpointConfiguration us bersarang berisi rekomendasi instance type (InstanceType) bersama dengan titik akhir dan nama varian (model pembelajaran AWS mesin yang digunakan) yang digunakan selama pekerjaan rekomendasi.

Kam Metrics us bersarang berisi informasi tentang perkiraan biaya per jam (CostPerHour) untuk titik akhir real-time Anda dalam dolar AS, perkiraan biaya per inferensi (CostPerInference) dalam dolar AS untuk titik akhir real-time Anda, jumlah maksimum InvokeEndpoint permintaan per menit yang diharapkan dikirim ke titik akhir (MaxInvocations), dan latensi model (ModelLatency), yang merupakan interval waktu (dalam milidetik) yang diambil model Anda untuk merespons AI. SageMaker Latensi model mencakup waktu komunikasi lokal yang diperlukan untuk mengirim permintaan dan mengambil respons dari wadah model dan waktu yang dibutuhkan untuk menyelesaikan inferensi dalam wadah.

Kam EndpointPerformances us bersarang berisi nama titik akhir yang ada tempat pekerjaan rekomendasi dijalankan (EndpointName) dan metrik kinerja untuk titik akhir Anda (MaxInvocationsdanModelLatency).