本文属于机器翻译版本。若本译文内容与英语原文存在差异,则一律以英文原文为准。
分析文档
Amazon Textract 会分析文档和表单,了解检测到的文本之间的关系。Amazon Textract 分析操作会返回 5 类文档提取:文本、表单、表格、查询响应和签名。发票和收据的分析通过不同的流程处理,有关更多信息,请参阅分析发票和收据。
文本提取
从文档中提取的原始文本。有关更多信息,请参阅文本的行和字。
表格提取
表单数据链接到从文档中提取的文本项目。Amazon Textract 将表单数据表示为键值对。
在以下示例中,Amazon Textract 检测到的一行文本是 “姓名:Jane Doe”。Amazon Textract 还标识了一个密钥(名称:)和一个值(Jane Doe)。有关更多信息,请参阅表单数据(Key-value成对)。
姓名:Jane Doe
地址:美国 Anytown Any Street 123
出生日期:1980 年 12 月 26 日
Key-value 对还用于表示从表单中提取的复选框或选项按钮(单选按钮)。
男性:☑
有关更多信息,请参阅选择元素。
表格提取
Amazon Textract 可以提取表格、表格单元格、表格单元格内的项目、表格标题和页脚以及表格的类型。还可以对 Amazon Textract 进行编程,使其以 JSON、CSV 或 TXT 文件形式返回结果。
| Name | 地址 |
|---|---|
|
安娜卡罗来纳 |
123 任何城镇 |
有关更多信息,请参阅表。也可以从表格中提取选择元素。有关更多信息,请参阅选择元素。
文档分析中的签名
Amazon Textract 可以检测文本文档中签名的位置。它们以几何对象的形式返回,其边界框提供签名在页面上的位置,以及签名在该位置的置信度。如果单独使用签名功能,Amazon Textract 将返回签名和标准文本检测结果。签名检测可以与其他功能类型(例如表单、表格和查询)结合使用。将其用于表单和表格时,签名可以分别作为键值对的一部分或在表格单元格中进行检测。
文档分析中的查询
使用 Amazon Textract 处理文档时,您可以在分析中添加查询,以指定所需的信息。这涉及通过一个问题,比如 “客户的社会安全号码是多少?” 到亚马逊 Textract。然后,Amazon Textract 将在文档中找到该问题的信息,并以与文档其余信息分开的回复结构将其返回。有关此响应结构的更多信息,请参阅查询响应结构。有关使用查询的最佳做法的更多信息,请参阅查询的最佳实践。可以单独处理查询,也可以与任何其他FeatureType查询(例如表格或表单)组合处理。
查询示例:客户的 SSN 是什么?
示例答案:111-xx-333
对于分析过的商品,Amazon Textract 会以多个区块对象的形式返回以下内容:
-
检测到的文本的行和字
-
检测到的物品的内容
-
检测到的项目之间的关系
-
在哪个页面上检测到该项目
-
项目在文档页面上的位置
自定义查询
借助 Amazon Textract 文档分析,您可以通过在自己的文档上训练过的适配器自定义模型输出。适配器是插入 Amazon Textract 预训练深度学习模型的组件,可根据您的业务特定文档自定义其输出。您可以通过 annotating/labeling 示例文档为特定用例创建适配器,并在带注释的示例上训练适配器。
在您创建适配器后,Amazon Textract 会为您提供一个。 AdapterId一个适配器中可以有多个适配器版本。您可以为 AdapterId操作提供和 AdapterVersion,以指定要使用您创建的适配器。例如,您可以向 AnalyzeDocumentAPI 提供两个参数以进行同步文档分析,或者为异步分析提供StartDocumentAnalysis操作。 AdapterId 作为请求的一部分提供会自动将适配器集成到分析流程中,并使用它来增强对文档的预测。这样,您就可以在自定义模型 AnalyzeDocument 时利用的功能,使其适合自己的用例。
有关创建和使用适配器的更多信息,请参阅自定义您的查询和回复。有关如何创建、训练和使用适配器的教程 AWS 管理控制台,请参阅自定义查询教程。
文档分析中的布局
Amazon Textract 可用于通过查找不同元素的位置及其关联的文本行来检测文档的布局。这些元素包括段落、列表、页眉、页脚、页码、数字、表格、标题和章节标题。在分析文档的布局时,Amazon Textract 会返回布局元素以及这些元素中的文本的边界框位置。此信息按文档的隐含阅读顺序返回,从上到下、从左到右列出元素。
您可以使用同步或异步操作来分析文档中的文本。要同步分析文本,请使用AnalyzeDocument操作并将文档作为输入传递。 AnalyzeDocument返回整组结果。有关更多信息,请参阅 使用亚马逊 Textract 分析文档文本。
要异步检测文本,请使用StartDocumentAnalysis开始处理。要获得结果,请致电GetDocumentAnalysis。结果将在来自的一个或多个响应中返回GetDocumentAnalysis。有关更多信息以及示例,请参阅 检测或分析多页文档中的文本。
要指定要执行哪种类型的分析,可以使用FeatureTypes列表输入参数。向列表中添加表格以返回有关在输入文档中检测到的表的信息,例如表格单元格、单元格文本和单元格中的选择元素。添加 FORMS 以返回单词关系,例如键值对和选择元素。添加查询以指定您希望 Amazon Textract 在文档中查找的信息,并以问答对的形式获得回复。添加布局以确定文档的布局。要执行所有类型的分析,请向中添加表、表单、查询和布局FeatureTypes。
在文档中检测到的所有行和单词都包含在响应中(包括与的值无关的文本FeatureTypes)。