View a markdown version of this page

Menyalin data CSV skala besar menggunakan Peta Terdistribusi di Fungsi Langkah - AWS Step Functions

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Menyalin data CSV skala besar menggunakan Peta Terdistribusi di Fungsi Langkah

Tutorial ini membantu Anda mulai menggunakan Map status dalam mode Terdistribusi. MapStatus yang disetel ke Distributed dikenal sebagai status Peta Terdistribusi. Anda menggunakan status Peta Terdistribusi dalam alur kerja untuk mengulangi sumber data Amazon S3 skala besar. MapStatus menjalankan setiap iterasi sebagai eksekusi alur kerja anak, yang memungkinkan konkurensi tinggi. Untuk informasi selengkapnya tentang mode Terdistribusi, lihat Status peta dalam mode Terdistribusi.

Dalam tutorial ini, Anda menggunakan status Peta Ter distribusi untuk mengulangi file CSV dalam bucket Amazon S3. Anda kemudian mengembalikan isinya, bersama dengan ARN dari eksekusi alur kerja anak, di bucket Amazon S3 lainnya. Anda mulai dengan membuat prototipe alur kerja di Workflow Studio. Selanjutnya, Anda mengatur mode pemrosesan Map negara bagian ke Terdistribusi, tentukan file CSV sebagai dataset, dan berikan lokasinya ke Map negara. Anda juga menentukan jenis alur kerja untuk eksekusi alur kerja anak yang dimulai dengan status Peta Terdistribusi sebagai Ek spres.

Selain pengaturan ini, Anda juga menentukan konfigurasi lain, seperti jumlah maksimum eksekusi alur kerja anak bersamaan dan lokasi untuk mengekspor Map hasilnya, untuk contoh alur kerja yang digunakan dalam tutorial ini.

Prasyarat

  • Unggah file CSV ke bucket Amazon S3. Anda harus menentukan baris header dalam file CSV Anda. Untuk informasi tentang batas ukuran yang dikenakan pada file CSV dan cara menentukan baris header, lihatFile CSV dalam ember Amazon S3.

  • Buat bucket Amazon S3 lain dan folder di dalam bucket itu untuk mengekspor hasil Map status.

Persyaratan untuk akun dan wilayah

Bucket Amazon S3 Anda harus berada di mesin Akun AWS status yang Wilayah AWS sama dan sama.

Perhatikan bahwa meskipun mesin status Anda mungkin dapat mengakses file dalam bucket yang berbeda Akun AWS yang berada di tempat yang sama Wilayah AWS, Step Functions hanya mendukung daftar objek di bucket Amazon S3 yang sama Akun AWS dan Wilayah AWS sama dengan mesin status.

Langkah 1: Buat prototipe alur kerja

Pada langkah ini, Anda membuat prototipe untuk alur kerja Anda menggunakan Workflow Studio. Workflow Studio adalah perancang alur kerja visual yang tersedia di konsol Step Functions. Anda memilih status yang diperlukan dan tindakan API dari tab Flow dan Ac tions masing-masing. Anda akan menggunakan fitur drag and drop Workflow Studio untuk membuat prototipe alur kerja.

  1. Buka konsol Step Func tions, pilih State machines dari menu, lalu pilih Create state machine.

  2. Pilih Buat dari kosong.

  3. Beri nama mesin status Anda, lalu pilih Lanjutkan untuk mengedit mesin status Anda di Workflow Studio.

  4. Dari tab Flow, seret status Peta dan jatuhkan ke status kosong berlabel Drag first state di sini.

  5. Di tab Konfigurasi, untuk Nama negara, masukkanProcess data.

  6. Dari tab Actions, seret tindakan AWS Lambda Invoke API dan letakkan di dalam status data Proses.

  7. Ganti nama AWS Lambda status Invoke Process CSV data menjadi.

Langkah 2: Konfigurasikan bidang yang diperlukan untuk status Peta

Pada langkah ini, Anda mengonfigurasi bidang wajib berikut dari status Peta Terdistribusi:

  • ItemReader— Menentukan dataset dan lokasinya dari mana Map negara dapat membaca input.

  • ItemProcessor- Menentukan nilai-nilai berikut:

    • ProcessorConfig— Atur Mode dan ExecutionType ke DISTRIBUTED dan EXPRESS masing-masing. Ini menetapkan mode pemrosesan Map status dan jenis alur kerja untuk eksekusi alur kerja anak yang dimulai oleh status Peta Terdistribusi.

    • StartAt— Status pertama dalam alur kerja Peta.

    • States— Mendefinisikan alur kerja Peta, yang merupakan serangkaian langkah untuk diulang dalam setiap eksekusi alur kerja anak.

  • ResultWriter— Menentukan lokasi Amazon S3 tempat Step Functions menulis hasil status Peta Terdistribusi.

    penting

    Pastikan bucket Amazon S3 yang Anda gunakan untuk mengekspor hasil Map Run berada di bawah mesin status yang sama Akun AWS . Wilayah AWS Jika tidak, eksekusi mesin status Anda akan gagal dengan States.ResultWriterFailed kesalahan.

Untuk mengkonfigurasi bidang yang diperlukan:
  1. Pilih status data proses dan, di tab Konfigurasi, lakukan hal berikut:

    1. Untuk mode Pemrosesan, pilih Didistribusikan.

    2. Untuk Sumber item, pilih Amazon S3, lalu pilih file CSV di S3 dari daftar dropdown sumber item S3.

    3. Lakukan hal berikut untuk menentukan lokasi Amazon S3 file CSV Anda:

      1. Untuk objek S3, pilih Masukkan bucket dan kunci dari daftar dropdown.

      2. Untuk Bucket, masukkan nama bucket Amazon S3, yang berisi file CSV. Misalnya, amzn-s3-demo-source-bucket.

      3. Untuk K unci, masukkan nama objek Amazon S3 tempat Anda menyimpan file CSV. Anda juga harus menentukan nama file CSV di bidang ini. Misalnya, csvDataset/ratings.csv.

    4. Untuk file CSV, Anda juga harus menentukan lokasi header kolom. Untuk melakukan ini, pilih Konfigurasi tambahan, dan kemudian untuk lokasi header CSV per tahankan pilihan default Bar is pertama jika baris pertama file CSV Anda adalah header. Jika tidak, pilih Given untuk menentukan header dalam definisi mesin status. Untuk informasi selengkapnya, lihat ReaderConfig.

    5. Untuk Jenis eksekusi Anak, pilih Ekspres.

  2. Di Lokasi Ek spor, untuk mengekspor hasil Map Run ke lokasi Amazon S3 tertentu, pilih Ekspor output status Peta ke Amazon S3.

  3. Lakukan hal-hal berikut:

    1. Untuk bucket S3, pilih Masukkan nama dan awalan bucket dari daftar dropdown.

    2. Untuk Bucket, masukkan nama bucket Amazon S3 tempat Anda ingin mengekspor hasilnya. Misalnya, mapOutputs.

    3. Untuk A walan, masukkan nama folder tempat Anda ingin menyimpan hasilnya. Misalnya, resultData.

Langkah 3: Konfigurasikan opsi tambahan

Selain pengaturan yang diperlukan untuk status Peta Terdistribusi, Anda juga dapat menentukan opsi lain. Ini dapat mencakup jumlah maksimum eksekusi alur kerja anak secara bersamaan dan lokasi untuk mengekspor hasil Map status.

  1. Pilih status data proses. Kemudian, di Sumber item, pilih Konfigur asi tambahan.

  2. Lakukan hal-hal berikut:

    1. Pilih Ubah item dengan ItemSelector untuk menentukan input JSON khusus untuk setiap eksekusi alur kerja anak.

    2. Masukkan input JSON berikut:

      { "index.$": "$$.Map.Item.Index", "value.$": "$$.Map.Item.Value" }

      Untuk informasi tentang cara membuat input kustom, lihatItemSelector (Peta).

  3. Dalam pengaturan Runtime, untuk Batas konkurensi, tentukan jumlah eksekusi alur kerja anak bersamaan yang dapat dimulai oleh status Peta Terdistribusi. Misalnya, masukkan 100.

  4. Buka jendela atau tab baru di browser Anda dan selesaikan konfigurasi fungsi Lambda yang akan Anda gunakan dalam alur kerja ini, seperti yang dijelaskan diLangkah 4: Konfigurasikan fungsi Lambda.

Langkah 4: Konfigurasikan fungsi Lambda

penting

Pastikan fungsi Lambda Anda Wilayah AWS sama dengan mesin status Anda.

  1. Buka konsol Lambda dan pilih Create function.

  2. Pilih halaman Buat fungsi, pilih Penulis dari scratch.

  3. Di bagian Informasi dasar, konfigurasikan fungsi Lambda Anda:

    1. Untuk Nama fungsi, masukkan distributedMapLambda.

    2. Untuk Runtime, pilih Node.js.

    3. Simpan semua pilihan default dan pilih Create function.

    4. Setelah Anda membuat fungsi Lambda, salin Nama Sumber Daya Amazon (ARN) fungsi yang ditampilkan. Anda harus menyediakan ini dalam prototipe alur kerja Anda. Berikut ini adalah contoh ARN:

      arn:aws:lambda:us-east-2:123456789012:function:distributedMapLambda
  4. Salin kode berikut untuk fungsi Lambda dan tempelkan ke bagian sumber Kode dari MapLambda halaman yang didistribusikan.

    exports.handler = async function(event, context) { console.log("Received Input:\n", event); return { 'statusCode' : 200, 'inputReceived' : event //returns the input that it received } };
  5. Pilih Deploy. Setelah fungsi Anda diterapkan, pilih U ji untuk melihat output dari fungsi Lambda Anda.

Langkah 5: Perbarui prototipe alur kerja

Di konsol Step Functions, Anda akan memperbarui alur kerja Anda untuk menambahkan ARN fungsi Lambda.

  1. Kembali ke tab atau jendela tempat Anda membuat prototipe alur kerja.

  2. Pilih langkah Proses data CSV, dan di tab Konfigurasi, lakukan hal berikut:

    1. Untuk Jenis Integrasi, pilih Di optimalkan.

    2. Untuk Nama fungsi, mulailah memasukkan nama fungsi Lambda Anda. Pilih fungsi dari daftar dropdown yang muncul, atau pilih Masukkan nama fungsi dan berikan fungsi Lambda ARN.

Langkah 6: Tinjau definisi Bahasa Negara Bagian Amazon yang dibuat secara otomatis dan simpan alur kerja

Saat Anda menyeret dan melepas status dari tab Action dan Flow ke kanvas, Workflow Studio secara otomatis menyusun definisi Bahasa Amazon States dari alur kerja Anda secara real-time. Anda dapat mengedit definisi ini sesuai kebutuhan.

  1. (Opsional) Pilih Definisi pada Panel inspektur panel dan lihat definisi mesin status.

    Tip

    Anda juga dapat melihat definisi ASL di Editor kode Workflow Studio. Di editor kode, Anda juga dapat mengedit definisi ASL alur kerja Anda.

    Kode contoh berikut menunjukkan definisi Bahasa Negara Bagian Amazon yang dibuat secara otomatis untuk alur kerja Anda.

    { "Comment": "Using Map state in Distributed mode", "StartAt": "Process data", "States": { "Process data": { "Type": "Map", "MaxConcurrency": 100, "ItemReader": { "ReaderConfig": { "InputType": "CSV", "CSVHeaderLocation": "FIRST_ROW" }, "Resource": "arn:aws:states:::s3:getObject", "Parameters": { "Bucket": "amzn-s3-demo-source-bucket", "Key": "csvDataset/ratings.csv" } }, "ItemProcessor": { "ProcessorConfig": { "Mode": "DISTRIBUTED", "ExecutionType": "EXPRESS" }, "StartAt": "Process CSV data", "States": { "Process CSV data": { "Type": "Task", "Resource": "arn:aws:states:::lambda:invoke", "OutputPath": "$.Payload", "Parameters": { "Payload.$": "$", "FunctionName": "arn:aws:lambda:us-east-2:account-id:function:distributedMapLambda" }, "End": true } } }, "Label": "Processdata", "End": true, "ResultWriter": { "Resource": "arn:aws:states:::s3:putObject", "Parameters": { "Bucket": "mapOutputs", "Prefix": "resultData" } }, "ItemSelector": { "index.$": "$$.Map.Item.Index", "value.$": "$$.Map.Item.Value" } } } }
  2. Tentukan nama untuk mesin status Anda. Untuk melakukan ini, pilih ikon edit di sebelah nama mesin status default MyStateMachine. Kemudian, di Konfigurasi mesin negara, tentukan nama di kotak nama mesin negara.

    Untuk tutorial ini, masukkan nama DistributedMapDemo.

  3. (Opsional) Dalam konfigurasi mesin status, tentukan pengaturan alur kerja lainnya, seperti jenis mesin status dan peran eksekusinya.

    Untuk tutorial ini, simpan semua pilihan default di konfigurasi mesin State.

  4. Di kotak dialog Kon firmasi pembuatan peran, pilih Kon firmasi untuk melanjutkan.

    Anda juga dapat memilih Lihat pengaturan peran untuk kembali ke konfigurasi mesin Status.

    catatan

    Jika Anda menghapus IAM role yang Step Functions buat, Step Functions tidak dapat membuatnya kembali nanti. Demikian pula, jika Anda mengubah peran (misalnya, dengan menghapus Step Functions dari principal dalam kebijakan IAM), Step Functions tidak dapat memulihkan pengaturan aslinya nanti.

Langkah 7: Jalankan mesin status

Ek sekusi adalah contoh mesin status Anda tempat Anda menjalankan alur kerja untuk melakukan tugas.

  1. Pada DistributedMapDemo halaman, pilih Mulai eksekusi.

  2. Di kotak dialog Mulai eksekusi, lakukan hal berikut:

    1. (Opsional) Masukkan nama eksekusi khusus untuk mengganti default yang dihasilkan.

      Non-ASCII nama dan pencatatan

      Fungsi Langkah menerima nama untuk mesin status, eksekusi, aktivitas, dan label yang berisi karakter non-ASCII. Karena karakter tersebut akan CloudWatch mencegah Amazon mencatat data, sebaiknya gunakan hanya karakter ASCII sehingga Anda dapat melacak metrik Fungsi Langkah.

    2. (Opsional) Di kotak Input, masukkan nilai input dalam format JSON untuk menjalankan alur kerja Anda.

    3. Pilih Mulai Eksekusi.

    4. Konsol Fungsi Langkah mengarahkan Anda ke halaman yang diberi judul dengan ID eksekusi Anda, yang dikenal sebagai halaman Detail Eksekusi. Anda dapat meninjau hasil eksekusi saat alur kerja berlangsung dan setelah selesai.

      Untuk meninjau hasil eksekusi, pilih status individual pada tampilan Grafik, lalu pilih tab individual pada Detail langkah panel untuk melihat detail setiap negara termasuk masukan, keluaran, dan definisi masing-masing. Untuk detail tentang informasi eksekusi yang dapat Anda lihat di halaman Detail Eksekusi, lihatIkhtisar detail eksekusi.

    Misalnya, pilih Map status, lalu pilih Map Run untuk membuka halaman Detail Jalankan Peta. Di halaman ini, Anda dapat melihat semua detail eksekusi status Peta Terdistribusi dan eksekusi alur kerja anak yang dimulai. Untuk informasi tentang halaman ini, lihatMelihat Peta Berjalan.