View a markdown version of this page

頁面 - Amazon Textract

本文為英文版的機器翻譯版本,如內容有任何歧義或不一致之處,概以英文版為準。

頁面

文件包含一或多個頁面。文件的每個頁面PAGE都有 類型的區塊物件。PAGE 區塊物件包含文件頁面上偵測到的文字行、鍵值對、資料表、查詢和查詢結果的子 IDs 清單。

文件結構圖顯示包含折線、資料表、鍵值集、查詢和查詢結果元件的頁面。

PAGE 區塊的 JSON 看起來類似以下內容。

{ "Geometry": .... "Relationships": [ { "Type": "CHILD", "Ids": [ "2602b0a6-20e3-4e6e-9e46-3be57fd0844b", // Line - Hello, world. "82aedd57-187f-43dd-9eb1-4f312ca30042", // Line - How are you? "52be1777-53f7-42f6-a7cf-6d09bdc15a30", "7ca7caa6-00ef-4cda-b1aa-5571dfed1a7c" ] } ], "BlockType": "PAGE", "Id": "8136b2dc-37c1-4300-a9da-6ed8b276ea97" // Page identifier },

如果您使用非同步操作搭配 PDF 格式的多頁文件,您可以透過檢查Block物件Page的欄位來判斷區塊所在的頁面。掃描的影像 (JPEG、PNG、PDF 或 TIFF 格式的影像) 被視為單頁文件,即使影像上有多個文件頁面。非同步操作一律會傳回掃描影像Page的值 1。

在 的 Pages欄位中傳回的頁面總數DocumentMetadata。 DocumentMetadata 會隨 Amazon Textract 操作傳回的每個Block物件清單傳回。