View a markdown version of this page

Praktik terbaik pengoptimalan biaya inferensi - Amazon SageMaker AI

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Praktik terbaik pengoptimalan biaya inferensi

Konten berikut memberikan teknik dan pertimbangan untuk mengoptimalkan biaya titik akhir. Anda dapat menggunakan rekomendasi ini untuk mengoptimalkan biaya untuk titik akhir baru dan yang sudah ada.

Praktik terbaik

Untuk mengoptimalkan biaya Inferensi SageMaker AI Anda, ikuti praktik terbaik berikut.

SageMaker AI menawarkan 4 opsi inferensi berbeda untuk memberikan opsi inferensi terbaik untuk pekerjaan itu. Anda mungkin dapat menghemat biaya dengan memilih opsi inferensi yang paling sesuai dengan beban kerja Anda.

  • Gunakan inferensi real-time untuk beban kerja latensi rendah dengan pola lalu lintas yang dapat diprediksi yang perlu memiliki karakteristik latensi yang konsisten dan selalu tersedia. Anda membayar untuk menggunakan contoh.

  • Gunakan inferensi tanpa server untuk beban kerja sinkron yang memiliki pola lalu lintas runcing dan dapat menerima variasi latensi p99. Inferensi tanpa server secara otomatis menskalakan untuk memenuhi lalu lintas beban kerja Anda sehingga Anda tidak membayar sumber daya idle apa pun. Anda hanya membayar untuk durasi permintaan inferensi. Model dan wadah yang sama dapat digunakan dengan inferensi real-time dan tanpa server sehingga Anda dapat beralih di antara kedua mode ini jika kebutuhan Anda berubah.

  • Gunakan inferensi asinkron untuk beban kerja asinkron yang memproses data hingga 1 GB (seperti korpus teks, gambar, video, dan audio) yang tidak sensitif terhadap latensi dan peka biaya. Dengan inferensi asinkron, Anda dapat mengontrol biaya dengan menentukan jumlah instans tetap untuk tingkat pemrosesan optimal alih-alih menyediakan untuk puncak. Anda juga dapat menurunkan skala hingga nol untuk menghemat biaya tambahan.

  • Gunakan inferensi batch untuk beban kerja yang memerlukan inferensi untuk kumpulan data besar untuk proses yang terjadi secara offline (yaitu, Anda tidak memerlukan titik akhir yang persisten). Anda membayar instans selama durasi pekerjaan inferensi batch.

  • Jika Anda memiliki tingkat penggunaan yang konsisten di semua layanan SageMaker AI, Anda dapat memilih R SageMaker encana Penghematan AI untuk membantu mengurangi biaya hingga 64%.

  • Amazon SageMaker AI Savings Pl ans menyediakan model harga yang fleksibel untuk Amazon SageMaker AI, dengan imbalan komitmen terhadap jumlah penggunaan yang konsisten (diukur dalam $/jam) untuk jangka waktu satu tahun atau tiga tahun. Paket ini secara otomatis berlaku untuk penggunaan instans SageMaker AI ML yang memenuhi syarat termasuk SageMaker Studio Classic Notebook, SageMaker On-Demand Notebook, Proc SageMaker essing, SageMaker Data Wrangler, Tra SageMaker ining, SageMaker Real-Time Inference, dan SageMaker Batch Transform terlepas dari keluarga instans, ukuran, atau Wilayah. Misalnya, Anda dapat mengubah penggunaan dari instance CPU ml.c5.xlarge yang berjalan di AS Timur (Ohio) ke instans ML.inf1 di AS Barat (Oregon) untuk beban kerja inferensi kapan saja dan secara otomatis terus membayar harga Paket Tabungan.

  • Model yang tidak dioptimalkan dapat menyebabkan waktu berjalan yang lebih lama dan menggunakan lebih banyak sumber daya. Anda dapat memilih untuk menggunakan instans yang lebih banyak atau lebih besar untuk meningkatkan kinerja; Namun, ini menyebabkan biaya yang lebih tinggi.

  • Dengan mengoptimalkan model Anda agar lebih berkinerja, Anda mungkin dapat menurunkan biaya dengan menggunakan instans yang lebih sedikit atau lebih kecil sambil mempertahankan karakteristik kinerja yang sama atau lebih baik. Anda dapat menggunakan SageMaker Neo dengan SageMaker AI Inference untuk mengoptimalkan model secara otomatis. Untuk detail dan sampel lebih lanjut, lihatOptimalisasi kinerja model dengan SageMaker Neo.

  • SageMaker Inferensi memiliki lebih dari 70 jenis dan ukuran instance yang dapat digunakan untuk menerapkan model ML termasuk chipset AWS Inferentia dan Graviton yang dioptimalkan untuk ML. Memilih instance yang tepat untuk model Anda membantu memastikan Anda memiliki instans berkinerja paling tinggi dengan biaya terendah untuk model Anda.

  • Dengan menggunakan Inference Recommender, Anda dapat dengan cepat membandingkan berbagai contoh untuk memahami kinerja model dan biayanya. Dengan hasil ini, Anda dapat memilih instans yang akan digunakan dengan laba atas investasi terbaik.

  • Tanpa penskalaan otomatis, Anda perlu menyediakan lalu lintas puncak atau ketidaktersediaan model risiko. Kecuali lalu lintas ke model Anda stabil sepanjang hari, akan ada kelebihan kapasitas yang tidak terpakai. Hal ini menyebabkan pemanfaatan rendah dan sumber daya yang terbuang.

  • Penskalaan otomatis adalah fitur out-of-the-box yang memantau beban kerja Anda dan secara dinamis menyesuaikan kapasitas untuk mempertahankan kinerja yang stabil dan dapat diprediksi dengan biaya serendah mungkin. Saat beban kerja meningkat, penskalaan otomatis membawa lebih banyak instans online. Saat beban kerja berkurang, penskalaan otomatis menghapus instans yang tidak perlu, membantu Anda mengurangi biaya komputasi. Untuk mempelajari selengkapnya, lihat Meng onfigurasi titik akhir inferensi penskalaan otomatis di Amazon SageMaker AI di blog AWS Machine Learning.