View a markdown version of this page

Seiten - Amazon Textract

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Seiten

Ein Dokument besteht aus einer oder mehreren Seiten. Für jede Seite des Dokuments ist ein Block-Objekt des Typs PAGE vorhanden. Ein PAGE Blockobjekt enthält eine Liste der untergeordneten IDs für die Textzeilen, Schlüssel-Wert-Paare, Tabellen, Abfragen und Abfrageergebnisse, die auf der Dokumentseite erkannt wurden.

Strukturdiagramm des Dokuments, das die Seite mit den Komponenten Zeilen-, Tabellen-, Key-Value Satz-, Abfrage- und Abfrageergebnis zeigt.

Das JSON-Format für einen PAGE Block sieht wie folgt aus.

{ "Geometry": .... "Relationships": [ { "Type": "CHILD", "Ids": [ "2602b0a6-20e3-4e6e-9e46-3be57fd0844b", // Line - Hello, world. "82aedd57-187f-43dd-9eb1-4f312ca30042", // Line - How are you? "52be1777-53f7-42f6-a7cf-6d09bdc15a30", "7ca7caa6-00ef-4cda-b1aa-5571dfed1a7c" ] } ], "BlockType": "PAGE", "Id": "8136b2dc-37c1-4300-a9da-6ed8b276ea97" // Page identifier },

Wenn Sie asynchrone Operationen mit einem mehrseitigen Dokument im PDF-Format verwenden, können Sie anhand des Page Felds des Objekts ermitteln, auf welcher Seite sich ein Block befindet. Block Ein gescanntes Bild (ein Bild im JPEG-, PNG-, PDF- oder TIFF-Format) wird als einseitiges Dokument betrachtet, auch wenn das Bild mehr als eine Dokumentseite enthält. Asynchrone Operationen geben für gescannte Bilder immer den Page Wert 1 zurück.

Die Gesamtzahl der Seiten wird im Pages Feld von DocumentMetadata zurückgegeben. DocumentMetadatawird mit jeder Liste von Block Objekten zurückgegeben, die von einem Amazon Textract Textract-Vorgang zurückgegeben wurden.