Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Analyse de documents
Amazon Textract analyse les documents et les formulaires pour détecter les relations entre le texte détecté. Les opérations d'analyse Amazon Textract renvoient 5 catégories d'extraction de documents : texte, formulaires, tableaux, réponses aux requêtes et signatures. L'analyse des factures et des reçus est traitée selon un processus différent. Pour plus d'informations, voirAnalyse des factures et des reçus.
Extraction de texte
Le texte brut extrait d'un document. Pour plus d'informations, voir Lignes et mots de texte.
Extraction de formulaires
Les données du formulaire sont liées à des éléments de texte extraits d'un document. Amazon Textract représente les données du formulaire sous forme de paires clé-valeur.
Dans l'exemple suivant, l'une des lignes de texte détectées par Amazon Textract est Name : Jane Doe. Amazon Textract identifie également une clé (Nom :) et une valeur (Jane Doe). Pour plus d'informations, consultez la section Données du formulaire (Key-valuepaires).
Nom : Jane Doe
Adresse : 123 Any Street, Anytown, États-Unis
Date de naissance : 26-12-1980
Key-value les paires sont également utilisées pour représenter les cases à cocher ou les boutons d'option (boutons radio) extraits des formulaires.
Homme : ☑
Pour plus d'informations, consultez la section Éléments de sélection.
Extraction de tableaux
Amazon Textract peut extraire des tableaux, des cellules de tableau, les éléments qu'ils contiennent, les titres et pieds de page des tableaux, ainsi que le type de tableau. Amazon Textract peut également être programmé pour renvoyer les résultats dans un fichier JSON, CSV ou TXT.
| Nom | Adresse |
|---|---|
|
Ana Carolina |
123 N'importe quelle ville |
Pour plus d’informations, veuillez consulter Tables. Les éléments de sélection peuvent également être extraits de tableaux. Pour plus d'informations, consultez la section Éléments de sélection.
Signatures dans l'analyse de documents
Amazon Textract peut détecter l'emplacement des signatures dans les documents texte. Ils sont renvoyés sous forme d'objets géométriques avec des cadres de délimitation qui indiquent l'emplacement d'une signature sur la page, ainsi que la certitude qu'une signature se trouve à cet endroit. Si la fonctionnalité de signature est utilisée seule, Amazon Textract renverra à la fois les signatures et les résultats de détection de texte standard. La détection de signature peut être utilisée conjointement avec d'autres types de fonctionnalités tels que les formulaires, les tables et les requêtes. Lorsque vous l'utilisez avec des formulaires et des tableaux, les signatures peuvent être détectées dans le cadre d'une paire clé-valeur ou dans une cellule de tableau, respectivement.
Requêtes dans l'analyse de documents
Lorsque vous traitez un document avec Amazon Textract, vous pouvez ajouter des requêtes à votre analyse pour préciser les informations dont vous avez besoin. Cela implique de transmettre une question, telle que « Quel est le numéro de sécurité sociale du client ? » à Amazon Textract. Amazon Textract trouvera ensuite les informations relatives à cette question dans le document et les renverra dans une structure de réponse distincte du reste des informations du document. Pour plus d'informations sur cette structure de réponse, voir Structures de réponse aux requêtes. Pour plus d'informations sur les meilleures pratiques relatives à l'utilisation des requêtes, consultezBonnes pratiques en matière de requêtes. Les requêtes peuvent être traitées seules ou en combinaison avec d'autresFeatureType, telles que des tableaux ou des formulaires.
Exemple de requête : quel est le SSN du client ?
Exemple de réponse : 111-xx-333
Pour les articles analysés, Amazon Textract renvoie les éléments suivants sous forme de plusieurs objets Block :
-
Les lignes et les mots du texte détecté
-
Le contenu des éléments détectés
-
La relation entre les éléments détectés
-
La page sur laquelle l'article a été détecté
-
Emplacement de l'élément sur la page du document
Requêtes personnalisées
Grâce à l'analyse des documents Amazon Textract, vous pouvez personnaliser la sortie du modèle grâce à des adaptateurs formés sur vos propres documents. Les adaptateurs sont des composants qui s'intègrent au modèle d'apprentissage profond préentraîné d'Amazon Textract, afin de personnaliser ses résultats en fonction des documents spécifiques à votre entreprise. Vous créez un adaptateur adapté à votre cas d'utilisation spécifique en vous servant de annotating/labeling vos exemples de documents et en entraînant l'adaptateur sur les échantillons annotés.
Après avoir créé un adaptateur, Amazon Textract vous fournit un. AdapterId Vous pouvez avoir plusieurs versions d'adaptateur au sein d'un même adaptateur. Vous pouvez fournir le AdapterId, accompagné d'un AdapterVersion, à une opération pour spécifier que vous souhaitez utiliser l'adaptateur que vous avez créé. Par exemple, vous fournissez les deux paramètres à l'AnalyzeDocumentAPI pour l'analyse synchrone des documents ou à l'StartDocumentAnalysisopération pour l'analyse asynchrone. Le fait de fournir le dans le AdapterId cadre de la demande intégrera automatiquement l'adaptateur dans le processus d'analyse et l'utilisera pour améliorer les prévisions pour vos documents. De cette façon, vous pouvez tirer parti des fonctionnalités de AnalyzeDocument tout en personnalisant le modèle en fonction de votre propre cas d'utilisation.
Pour plus d’informations sur la création et l’utilisation d’adaptateurs, consultez Personnalisation de vos requêtes et réponses. Pour un didacticiel sur la création, l'entraînement et l'utilisation d'adaptateurs avec le Console de gestion AWS, voirTutoriel sur les requêtes personnalisées.
Mise en page dans l'analyse de documents
Amazon Textract peut être utilisé pour détecter la mise en page d'un document en localisant les différents éléments et les lignes de texte associées. Ces éléments sont les paragraphes, les listes, les en-têtes, les pieds de page, les numéros de page, les figures, les tableaux, les titres et les en-têtes de section. Lors de l'analyse de la mise en page d'un document, Amazon Textract renvoie un cadre contenant l'emplacement des éléments de mise en page ainsi que le texte de ces éléments. Ces informations sont renvoyées dans l'ordre de lecture implicite du document, en listant les éléments de haut en bas, de gauche à droite.
Vous pouvez utiliser des opérations synchrones ou asynchrones pour analyser le texte d'un document. Pour analyser le texte de manière synchrone, utilisez l'AnalyzeDocumentopération et transmettez un document en entrée. AnalyzeDocumentrenvoie l'ensemble complet des résultats. Pour de plus amples informations, veuillez consulter Analyse du texte d'un document avec Amazon Textract.
Pour détecter le texte de manière asynchrone, utilisez-le StartDocumentAnalysispour démarrer le traitement. Pour obtenir les résultats, appelez GetDocumentAnalysis. Les résultats sont renvoyés dans une ou plusieurs réponses deGetDocumentAnalysis. Pour plus d'informations et pour voir un exemple, consultez Détection ou analyse du texte dans un document de plusieurs pages.
Pour spécifier le type d'analyse à effectuer, vous pouvez utiliser le paramètre d'entrée de FeatureTypes liste. Ajoutez des TABLEAUX à la liste pour renvoyer des informations sur les tableaux détectés dans le document d'entrée, par exemple, les cellules de tableau, le texte des cellules et les éléments de sélection dans les cellules. Ajoutez des FORMULAIRES pour renvoyer les relations entre les mots, telles que les paires clé-valeur et les éléments de sélection. Ajoutez des REQUÊTES pour spécifier les informations que vous souhaitez qu'Amazon Textract recherche dans le document et obtenir une réponse sous la forme d'une paire questions-réponses. Ajoutez LAYOUT pour déterminer la mise en page du document. Pour effectuer tous les types d'analyse, ajoutez des TABLES, des FORMULAIRES, des REQUÊTES et un LAYOUT àFeatureTypes.
Toutes les lignes et tous les mots détectés dans le document sont inclus dans la réponse (y compris le texte non lié à la valeur deFeatureTypes).