Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Akses tabel HBase dengan Hive
HBase dan Apache Hive terintegrasi erat, memungkinkan Anda menjalankan beban kerja pemrosesan paralel besar-besaran langsung pada data yang disimpan di HBase. Untuk menggunakan Hive dengan HBase, Anda dapat meluncurkannya pada klaster yang sama. Bagaimanapun juga, Anda dapat meluncurkan Hive dan HBase pada klaster terpisah. Menjalankan HBase dan Hive secara terpisah pada klaster yang berbeda dapat meningkatkan performa karena memungkinkan setiap aplikasi untuk menggunakan sumber daya klaster lebih efisien.
Prosedur berikut menunjukkan cara menghubungkan ke HBase pada klaster menggunakan Hive.
catatan
Anda hanya dapat menghubungkan klaster Hive untuk klaster HBase tunggal.
Menghubungkan Hive ke HBase
-
Buat klaster terpisah dengan Hive dan HBase yang diinstal atau buat klaster tunggal dengan kedua HBase dan Hive yang diinstal.
-
Jika Anda menggunakan cluster terpisah, modifikasi grup keamanan Anda sehingga port HBase dan Hive terbuka di antara dua node utama ini.
-
Gunakan SSH untuk terhubung ke node utama untuk cluster dengan Hive diinstal. Untuk informasi selengkapnya, lihat Connect ke node utama menggunakan SSH di Amazon EMR Management Guide.
-
Luncurkan shell Hive dengan perintah berikut.
hive -
(Opsional) Anda tidak perlu melakukan hal ini jika HBase dan Hive terletak di klaster yang sama. Connect klien HBase pada cluster Hive Anda untuk klaster HBase yang berisi data Anda. Dalam contoh berikut,
public-DNS-namediganti dengan nama DNS publik dari simpul utama cluster HBase, misalnya:.ec2-50-19-76-67.compute-1.amazonaws.com.rproxy.govskope.caset hbase.zookeeper.quorum=public-DNS-name; -
Lanjutkan untuk menjalankan kueri Hive pada data HBase Anda seperti yang diinginkan atau lihat prosedur berikutnya.
Untuk mengakses data HBase dari Hive
-
Setelah hubungan antara klaster Hive dan HBase dibuat (seperti yang ditunjukkan dalam prosedur sebelumnya), Anda dapat mengakses data yang disimpan pada klaster HBase dengan membuat tabel eksternal di Hive.
Contoh berikut, ketika dijalankan dari prompt Hive pada node utama, membuat tabel eksternal yang referensi data yang disimpan dalam tabel HBase disebut.
inputTableOleh sebab itu, Anda dapat mereferensikaninputTabledalam pernyataan Hive untuk mengkueri dan memodifikasi data yang disimpan dalam klaster HBase.set hbase.zookeeper.quorum=ec2-107-21-163-157.compute-1.amazonaws.com; create external table inputTable (key string, value string) stored by 'org.apache.hadoop.hive.hbase.HBaseStorageHandler' with serdeproperties ("hbase.columns.mapping" = ":key,f1:col1") tblproperties ("hbase.table.name" = "t1"); select count(key) from inputTable ;
Untuk kasus penggunaan yang lebih canggih dan contoh menggabungkan HBase dan Hive, lihat posting AWS Big Data Blog, Menggabungkan NoSQL dan analisis paralel besar-besaran menggunakan Apache HBase dan Apache