View a markdown version of this page

亚马逊 Textract 自定义查询的最佳实践 - Amazon Textract

本文属于机器翻译版本。若本译文内容与英语原文存在差异,则一律以英文原文为准。

亚马逊 Textract 自定义查询的最佳实践

Amazon Textract 允许您通过训练和使用适配器作为其基本模型来自定义其预训练查询功能的输出。借助 Amazon Textract Custom Queries,您可以使用自己的文档并训练适配器自定义基本模型,同时保持对专有文档的控制。为适配器创建查询时,请使用以下最佳实践。有关适配器的更多信息,请参阅自定义您的查询和回复

  1. 样本数据应包含代表制作中使用的文档的版面变体和图像变体。

  2. 训练或测试至少需要五个样本(每个查询级别)。用于训练的样本越多越好。

  3. 带注释的查询应该有各种各样的答案。例如,如果查询的答案是 “是” 或 “否”,则带注释的样本应同时出现 “是” 和 “否”,

  4. 组合查询应具有逻辑含义和结构。例如,要提取支票上的收款人姓名,查询应为 “谁是收款人?” 而不是 “叫什么名字?”。

  5. 如果需要提取的值具有关联的键,请在查询中包含该键以获得更好的结果。如果密钥多次出现,请使用分层问题,例如 “借款人的名字是什么?” 和 “共同借款人的名字是什么?”

  6. 保持注释风格的一致性。如果某个字段出现在文档的多个位置,而您决定只为一个匹配项添加批注,请遵循相同的指导方针,在所有文档中仅为一个匹配项添加注释。或者,如果您选择为某个值的所有出现处添加注释,请对所有文档执行相同的过程。

  7. 使用空格注释字段时保持一致性。如果字段的值为 “123 456 78”,并且您选择将其注释为 “12345678”,请遵循所有文档的相同准则。不要在将值注释为 “123 456 78” 和 “12345678” 之间切换。

  8. 对文档中所有页面的数据进行注释,即使您可能只对其中几个页面进行推理。如果无法为所有页面添加注释,请拆分文档,仅使用您能够在数据集中注释的页面。

  9. 自定义查询不支持与签名相关的问题(例如 “文档是否已签名?”)。要知道文档是否已签名,请使用 API 请求中的签名功能。

  10. 在更正预先标记的响应时,您可以对文档中显示的文本进行少量修改,例如更正一些字符错误或删除空格和标点符号。但是,如果文档中未显示文本,请不要将其作为回复输入。

  11. 使用训练中使用的确切查询进行推理。

  12. 仅提供source-ref页面的预贴标结果。如果您使用非来自source-ref页面的区块获得预标记结果,则可能会影响性能。