Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
K-Means Algoritma
K-means adalah algoritma pembelajaran tanpa pengawasan. Ini mencoba untuk menemukan pengelompokan diskrit dalam data, di mana anggota kelompok semirip mungkin satu sama lain dan seberbeda mungkin dari anggota kelompok lain. Anda menentukan atribut yang ingin digunakan algoritma untuk menentukan kesamaan.
Amazon SageMaker AI menggunakan versi modifikasi dari algoritma pengelompokan k-mean skala web. Dibandingkan dengan versi asli algoritma, versi yang digunakan oleh Amazon SageMaker AI lebih akurat. Seperti algoritma aslinya, algoritma ini menskalakan ke kumpulan data besar dan memberikan peningkatan dalam waktu pelatihan. Untuk melakukan ini, versi yang digunakan oleh Amazon SageMaker AI mengalirkan batch mini (subset kecil dan acak) dari data pelatihan. Untuk informasi lebih lanjut tentang mini-batch k-mean, lihat Web-scale k-mean Clustering.
Algoritma k-mean mengharapkan data tabular, di mana baris mewakili pengamatan yang ingin Anda mengelompokkan, dan kolom mewakili atribut pengamatan. Atribut n di setiap baris mewakili titik dalam ruang n-dimensi. Jarak Euclidean antara titik-titik ini mewakili kesamaan pengamatan yang sesuai. Algoritma mengelompokkan pengamatan dengan nilai atribut yang serupa (titik-titik yang sesuai dengan pengamatan ini lebih dekat satu sama lain). Untuk informasi selengkapnya tentang cara kerja k-mean di Amazon SageMaker AI, lihatBagaimana Pengel K-Means ompokan Bekerja.
Topik
Input/Output Antarmuka untuk K-Means Algoritma
Untuk pelatihan, algoritma k-mean mengharapkan data disediakan di saluran kereta api (disarankanS3DataDistributionType=ShardedByS3Key), dengan saluran uji opsional (disarankanS3DataDistributionType=FullyReplicated) untuk menilai data. K recordIO-wrapped-protobuf edu CSV anya dan format didukung untuk pelatihan. Anda dapat menggunakan mode File atau mode Pipe untuk melatih model pada data yang diformat sebagai recordIO-wrapped-protobuf atau sebagaiCSV.
Untuk inferensi,text/csv,application/json, dan application/x-recordio-protobuf didukung. k-mean mengembalikan closest_cluster label dan distance_to_cluster untuk setiap pengamatan.
Untuk informasi lebih lanjut tentang format file input dan output, lihat K-Means Format Respons untuk inferensi dan. K-Means Contoh Notebook Algoritma k-mean tidak mendukung pembelajaran beberapa contoh, di mana set pelatihan terdiri dari “tas” berlabel, yang masing-masing merupakan kumpulan instance tanpa label.
Rekomendasi Instans EC2 untuk Algoritma K-Means
Kami merekomendasikan pelatihan k-mean pada instans CPU. Anda dapat melatih pada instans GPU, tetapi harus membatasi pelatihan GPU ke instans GPU tunggal (seperti ml.g4dn.xlarge) karena hanya satu GPU yang digunakan per instance. Algoritma k-mean mendukung instans P2, P3, G4dn, dan G5 untuk pelatihan dan inferensi.
K-Means Contoh Notebook
Untuk contoh notebook yang menggunakan K-means algoritma SageMaker AI untuk mengelompokkan populasi kabupaten di Amerika Serikat berdasarkan atribut yang diidentifikasi menggunakan analisis komponen prinsip, lihat Meng analisis data sensus AS untuk segmentasi populasi menggunakan Amazon SageMaker AI