View a markdown version of this page

Menganalisis Dokumen - Amazon Textract

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Menganalisis Dokumen

Amazon Textract menganalisis dokumen dan formulir untuk hubungan di antara teks yang terdeteksi. Operasi analisis Amazon Textract mengembalikan 5 kategori ekstraksi dokumen — teks, formulir, tabel, respons kueri, dan tanda tangan. Analisis faktur dan tanda terima ditangani melalui proses yang berbeda, untuk informasi lebih lanjut lihat. Menganalisis Faktur dan Tanda Terima

Ekstraksi Teks

Teks mentah diekstraksi dari dokumen. Untuk informasi selengkapnya, lihat Garis dan kata-kata teks.

Formulir Ekstraksi

Data formulir ditautkan ke item teks yang diekstrak dari dokumen. Amazon Ttract mewakili data formulir sebagai pasangan nilai kunci.

Dalam contoh berikut, salah satu baris teks yang terdeteksi oleh Amazon Textract adalah Nama: Jane Doe. Amazon Textract juga mengidentifikasi kunci (Nama:) dan nilai (Jane Doe). Untuk informasi selengkapnya, lihat Formulir data (Key-valuepasangan).

Nama: Jane Doe

Alamat: 123 Any Street, Anytown, AS

Tanggal lahir: 12-26-1980

Key-value pasangan juga digunakan untuk mewakili kotak centang atau tombol opsi (tombol radio) yang diekstraksi dari formulir.

Pria:

Untuk informasi selengkapnya, lihat Elemen pemilihan.

Ekstraksi Tabel

Amazon Textract dapat mengekstrak tabel, sel tabel, item dalam sel tabel, judul tabel dan footer, dan jenis tabel. Amazon Textract juga dapat diprogram untuk mengembalikan hasil dalam file JSON, CSV, atau TXT.

Nama Alamat

Ana Karolina

123 Kota Apa Saja

Untuk informasi selengkapnya, lihat Tabel. Elemen seleksi juga dapat diekstraksi dari tabel. Untuk informasi selengkapnya, lihat Elemen pemilihan.

Tanda Tangan dalam Analisis Dokumen

Amazon Textract dapat mendeteksi lokasi tanda tangan dalam dokumen teks. Ini dikembalikan sebagai objek geometri dengan kotak pembatas yang menyediakan lokasi tanda tangan pada halaman, di samping keyakinan bahwa tanda tangan ada di lokasi itu. Jika fitur tanda tangan digunakan sendiri, Amazon Textract akan mengembalikan tanda tangan dan hasil deteksi teks standar. Deteksi tanda tangan dapat digunakan bersama dengan jenis fitur lain seperti formulir, tabel, dan kueri. Saat menggunakannya dengan formulir dan tabel, tanda tangan dapat dideteksi sebagai bagian dari pasangan nilai kunci atau masing-masing dalam sel tabel.

Kueri dalam Analisis Dokumen

Saat memproses dokumen dengan Amazon Ttract, Anda dapat menambahkan kueri ke analisis untuk menentukan informasi apa yang Anda butuhkan. Ini melibatkan mengajukan pertanyaan, seperti “Berapa nomor jaminan sosial pelanggan?” ke Amazon Texttract. Amazon Textract kemudian akan menemukan informasi dalam dokumen untuk pertanyaan itu dan mengembalikannya dalam struktur respons yang terpisah dari informasi dokumen lainnya. Untuk informasi selengkapnya tentang struktur respons ini, lihat Struktur Respons Kueri. Untuk informasi selengkapnya tentang praktik terbaik untuk penggunaan kueri, lihatPraktik Terbaik untuk Pertanyaan. Kueri dapat diproses sendiri, atau dikombinasikan dengan yang lainFeatureType, seperti Tabel atau Formulir.

Contoh Query: Apa SSN pelanggan?

Contoh Jawaban: 111-xx-333

Untuk item yang dianalisis, Amazon Ttract mengembalikan yang berikut ini di beberapa objek Blok:

  • Garis dan kata-kata dari teks yang terdeteksi

  • Isi item yang terdeteksi

  • Hubungan antara item yang terdeteksi

  • Halaman tempat item terdeteksi

  • Lokasi item pada halaman dokumen

Kueri Kustom

Dengan analisis dokumen Amazon Textract, Anda dapat menyesuaikan output model melalui adaptor yang dilatih pada dokumen Anda sendiri. Adaptor adalah komponen yang terhubung ke model pembelajaran mendalam Amazon Textract yang telah dilatih sebelumnya, menyesuaikan outputnya untuk dokumen spesifik bisnis Anda. Anda membuat adaptor untuk kasus penggunaan spesifik Anda dengan dokumen sampel annotating/labeling Anda dan melatih adaptor pada sampel beranotasi.

Setelah Anda membuat adaptor, Amazon Texttract memberi Anda file. AdapterId Anda dapat memiliki beberapa versi adaptor dalam satu adaptor. Anda dapat memberikan AdapterId, bersama dengan AdapterVersion, ke operasi untuk menentukan bahwa Anda ingin menggunakan adaptor yang Anda buat. Misalnya, Anda memberikan dua parameter ke AnalyzeDocumentAPI untuk analisis dokumen sinkron, atau StartDocumentAnalysisoperasi untuk analisis asinkron. Menyediakan AdapterId sebagai bagian dari permintaan akan secara otomatis mengintegrasikan adaptor ke dalam proses analisis dan menggunakannya untuk meningkatkan prediksi untuk dokumen Anda. Dengan cara ini, Anda dapat memanfaatkan kemampuan AnalyzeDocument sambil menyesuaikan model agar sesuai dengan kasus penggunaan Anda sendiri.

Untuk informasi selengkapnya tentang membuat dan menggunakan adaptor, lihatMenyesuaikan Tanggapan Kueri. Untuk tutorial tentang cara membuat, melatih, dan menggunakan adaptor dengan Konsol Manajemen AWS, lihatTutorial Kueri Kustom.

Tata Letak dalam Analisis Dokumen

Amazon Textract dapat digunakan untuk mendeteksi tata letak dokumen dengan menemukan lokasi elemen yang berbeda dan baris teks yang terkait. Elemen-elemen ini adalah paragraf, daftar, header, footer, nomor halaman, gambar, tabel, judul, dan header bagian. Saat menganalisis tata letak dokumen, Amazon Textract mengembalikan lokasi kotak pembatas elemen tata letak serta teks dalam elemen tersebut. Informasi ini dikembalikan dalam urutan pembacaan tersirat dokumen, mencantumkan elemen dari atas ke bawah, kiri ke kanan.

Anda dapat menggunakan operasi sinkron atau asinkron untuk menganalisis teks dalam dokumen. Untuk menganalisis teks secara sinkron, gunakan AnalyzeDocumentoperasi, dan berikan dokumen sebagai input. AnalyzeDocumentmengembalikan seluruh rangkaian hasil. Untuk informasi selengkapnya, lihat Menganalisis Teks Dokumen dengan Amazon Textract.

Untuk mendeteksi teks secara asinkron, gunakan StartDocumentAnalysisuntuk mulai memproses. Untuk mendapatkan hasilnya, hubungi GetDocumentAnalysis. Hasilnya dikembalikan dalam satu atau lebih tanggapan dariGetDocumentAnalysis. Untuk informasi lebih lanjut dan contoh, lihat Mendeteksi atau Menganalisis Teks dalam Dokumen Multipage.

Untuk menentukan jenis analisis yang akan dilakukan, Anda dapat menggunakan parameter input FeatureTypes daftar. Tambahkan TABLES ke daftar untuk menampilkan informasi tentang tabel yang terdeteksi dalam dokumen input—misalnya, sel tabel, teks sel, dan elemen pemilihan dalam sel. Tambahkan FORMULIR untuk mengembalikan hubungan kata, seperti pasangan kunci-nilai dan elemen seleksi. Tambahkan KUERI untuk menentukan informasi yang ingin dicari Amazon Textract dalam dokumen dan dapatkan respons kembali dalam bentuk pasangan tanya jawab. Tambahkan LAYOUT untuk menentukan tata letak dokumen. Untuk melakukan semua jenis analisis, tambahkan TABEL, FORMULIR, KUERI, dan TATA LETAK keFeatureTypes.

Semua baris dan kata yang terdeteksi dalam dokumen disertakan dalam respons (termasuk teks yang tidak terkait dengan nilaiFeatureTypes).