Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Menganalisis Dokumen
Amazon Textract menganalisis dokumen dan formulir untuk hubungan di antara teks yang terdeteksi. Operasi analisis Amazon Textract mengembalikan 5 kategori ekstraksi dokumen — teks, formulir, tabel, respons kueri, dan tanda tangan. Analisis faktur dan tanda terima ditangani melalui proses yang berbeda, untuk informasi lebih lanjut lihat. Menganalisis Faktur dan Tanda Terima
Ekstraksi Teks
Teks mentah diekstraksi dari dokumen. Untuk informasi selengkapnya, lihat Garis dan kata-kata teks.
Formulir Ekstraksi
Data formulir ditautkan ke item teks yang diekstrak dari dokumen. Amazon Ttract mewakili data formulir sebagai pasangan nilai kunci.
Dalam contoh berikut, salah satu baris teks yang terdeteksi oleh Amazon Textract adalah Nama: Jane Doe. Amazon Textract juga mengidentifikasi kunci (Nama:) dan nilai (Jane Doe). Untuk informasi selengkapnya, lihat Formulir data (Key-valuepasangan).
Nama: Jane Doe
Alamat: 123 Any Street, Anytown, AS
Tanggal lahir: 12-26-1980
Key-value pasangan juga digunakan untuk mewakili kotak centang atau tombol opsi (tombol radio) yang diekstraksi dari formulir.
Pria: ☑
Untuk informasi selengkapnya, lihat Elemen pemilihan.
Ekstraksi Tabel
Amazon Textract dapat mengekstrak tabel, sel tabel, item dalam sel tabel, judul tabel dan footer, dan jenis tabel. Amazon Textract juga dapat diprogram untuk mengembalikan hasil dalam file JSON, CSV, atau TXT.
| Nama | Alamat |
|---|---|
|
Ana Karolina |
123 Kota Apa Saja |
Untuk informasi selengkapnya, lihat Tabel. Elemen seleksi juga dapat diekstraksi dari tabel. Untuk informasi selengkapnya, lihat Elemen pemilihan.
Tanda Tangan dalam Analisis Dokumen
Amazon Textract dapat mendeteksi lokasi tanda tangan dalam dokumen teks. Ini dikembalikan sebagai objek geometri dengan kotak pembatas yang menyediakan lokasi tanda tangan pada halaman, di samping keyakinan bahwa tanda tangan ada di lokasi itu. Jika fitur tanda tangan digunakan sendiri, Amazon Textract akan mengembalikan tanda tangan dan hasil deteksi teks standar. Deteksi tanda tangan dapat digunakan bersama dengan jenis fitur lain seperti formulir, tabel, dan kueri. Saat menggunakannya dengan formulir dan tabel, tanda tangan dapat dideteksi sebagai bagian dari pasangan nilai kunci atau masing-masing dalam sel tabel.
Kueri dalam Analisis Dokumen
Saat memproses dokumen dengan Amazon Ttract, Anda dapat menambahkan kueri ke analisis untuk menentukan informasi apa yang Anda butuhkan. Ini melibatkan mengajukan pertanyaan, seperti “Berapa nomor jaminan sosial pelanggan?” ke Amazon Texttract. Amazon Textract kemudian akan menemukan informasi dalam dokumen untuk pertanyaan itu dan mengembalikannya dalam struktur respons yang terpisah dari informasi dokumen lainnya. Untuk informasi selengkapnya tentang struktur respons ini, lihat Struktur Respons Kueri. Untuk informasi selengkapnya tentang praktik terbaik untuk penggunaan kueri, lihatPraktik Terbaik untuk Pertanyaan. Kueri dapat diproses sendiri, atau dikombinasikan dengan yang lainFeatureType, seperti Tabel atau Formulir.
Contoh Query: Apa SSN pelanggan?
Contoh Jawaban: 111-xx-333
Untuk item yang dianalisis, Amazon Ttract mengembalikan yang berikut ini di beberapa objek Blok:
-
Garis dan kata-kata dari teks yang terdeteksi
-
Isi item yang terdeteksi
-
Hubungan antara item yang terdeteksi
-
Halaman tempat item terdeteksi
-
Lokasi item pada halaman dokumen
Kueri Kustom
Dengan analisis dokumen Amazon Textract, Anda dapat menyesuaikan output model melalui adaptor yang dilatih pada dokumen Anda sendiri. Adaptor adalah komponen yang terhubung ke model pembelajaran mendalam Amazon Textract yang telah dilatih sebelumnya, menyesuaikan outputnya untuk dokumen spesifik bisnis Anda. Anda membuat adaptor untuk kasus penggunaan spesifik Anda dengan dokumen sampel annotating/labeling Anda dan melatih adaptor pada sampel beranotasi.
Setelah Anda membuat adaptor, Amazon Texttract memberi Anda file. AdapterId Anda dapat memiliki beberapa versi adaptor dalam satu adaptor. Anda dapat memberikan AdapterId, bersama dengan AdapterVersion, ke operasi untuk menentukan bahwa Anda ingin menggunakan adaptor yang Anda buat. Misalnya, Anda memberikan dua parameter ke AnalyzeDocumentAPI untuk analisis dokumen sinkron, atau StartDocumentAnalysisoperasi untuk analisis asinkron. Menyediakan AdapterId sebagai bagian dari permintaan akan secara otomatis mengintegrasikan adaptor ke dalam proses analisis dan menggunakannya untuk meningkatkan prediksi untuk dokumen Anda. Dengan cara ini, Anda dapat memanfaatkan kemampuan AnalyzeDocument sambil menyesuaikan model agar sesuai dengan kasus penggunaan Anda sendiri.
Untuk informasi selengkapnya tentang membuat dan menggunakan adaptor, lihatMenyesuaikan Tanggapan Kueri. Untuk tutorial tentang cara membuat, melatih, dan menggunakan adaptor dengan Konsol Manajemen AWS, lihatTutorial Kueri Kustom.
Tata Letak dalam Analisis Dokumen
Amazon Textract dapat digunakan untuk mendeteksi tata letak dokumen dengan menemukan lokasi elemen yang berbeda dan baris teks yang terkait. Elemen-elemen ini adalah paragraf, daftar, header, footer, nomor halaman, gambar, tabel, judul, dan header bagian. Saat menganalisis tata letak dokumen, Amazon Textract mengembalikan lokasi kotak pembatas elemen tata letak serta teks dalam elemen tersebut. Informasi ini dikembalikan dalam urutan pembacaan tersirat dokumen, mencantumkan elemen dari atas ke bawah, kiri ke kanan.
Anda dapat menggunakan operasi sinkron atau asinkron untuk menganalisis teks dalam dokumen. Untuk menganalisis teks secara sinkron, gunakan AnalyzeDocumentoperasi, dan berikan dokumen sebagai input. AnalyzeDocumentmengembalikan seluruh rangkaian hasil. Untuk informasi selengkapnya, lihat Menganalisis Teks Dokumen dengan Amazon Textract.
Untuk mendeteksi teks secara asinkron, gunakan StartDocumentAnalysisuntuk mulai memproses. Untuk mendapatkan hasilnya, hubungi GetDocumentAnalysis. Hasilnya dikembalikan dalam satu atau lebih tanggapan dariGetDocumentAnalysis. Untuk informasi lebih lanjut dan contoh, lihat Mendeteksi atau Menganalisis Teks dalam Dokumen Multipage.
Untuk menentukan jenis analisis yang akan dilakukan, Anda dapat menggunakan parameter input FeatureTypes daftar. Tambahkan TABLES ke daftar untuk menampilkan informasi tentang tabel yang terdeteksi dalam dokumen input—misalnya, sel tabel, teks sel, dan elemen pemilihan dalam sel. Tambahkan FORMULIR untuk mengembalikan hubungan kata, seperti pasangan kunci-nilai dan elemen seleksi. Tambahkan KUERI untuk menentukan informasi yang ingin dicari Amazon Textract dalam dokumen dan dapatkan respons kembali dalam bentuk pasangan tanya jawab. Tambahkan LAYOUT untuk menentukan tata letak dokumen. Untuk melakukan semua jenis analisis, tambahkan TABEL, FORMULIR, KUERI, dan TATA LETAK keFeatureTypes.
Semua baris dan kata yang terdeteksi dalam dokumen disertakan dalam respons (termasuk teks yang tidak terkait dengan nilaiFeatureTypes).