View a markdown version of this page

Préparation des ensembles de données de formation et de test - Amazon Textract

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Préparation des ensembles de données de formation et de test

Ensembles de données de formation et de test

L'ensemble de données d'entraînement est à la base de la création d'un adaptateur. Vous devez fournir un jeu de données d'entraînement annoté pour entraîner un adaptateur. Cet ensemble de données de formation comprend des pages de documents téléchargées par les utilisateurs, des requêtes et des réponses aux requêtes annotées. Le modèle tire les leçons de cet ensemble de données pour améliorer ses performances sur le type de documents que vous fournissez.

L'ensemble de données de test est utilisé pour évaluer les performances de l'adaptateur. Le jeu de données de test est créé en utilisant une tranche du jeu de données d'origine que le modèle n'a jamais vue auparavant. Ce processus évalue les performances de l'adaptateur à l'aide de nouvelles données, créant ainsi des mesures et des métriques précises.

Vous devez diviser tous vos documents en ensembles de formation et de tests. Le kit d'entraînement est utilisé pour entraîner l'adaptateur. L'adaptateur apprend les modèles contenus dans ces documents annotés. Le kit de test est utilisé pour évaluer les performances de l'adaptateur. Si vous téléchargez moins de 20 documents, répartissez-les à parts égales entre train et test. Si vous téléchargez plus de 20 documents, attribuez 70 % des données à la formation et 30 % aux tests. Lorsque vous divisez des documents dans le Console de gestion AWS, vous pouvez laisser Amazon Textract les diviser automatiquement. Vous pouvez également diviser manuellement vos documents en ensembles de formation et de test.

Composants du jeu de données

Les ensembles de données contiennent les quatre composants suivants, que vous devez préparer vous-même ou en utilisant : Console de gestion AWS

  • Images - Les images peuvent être au format JPEG, PNG, PDF d'une page ou TIFF d'une page. Si vous soumettez des documents de plusieurs pages, chaque page Console de gestion AWS sera visualisée séparément pour annotation.

  • Fichier d'annotation : le fichier d'annotation suit la structure des blocs Amazon Textract, bien qu'il ne contienne que les blocs QUERY et QUERY_RESULT.

  • Fichiers de préétiquetage : il s'agit de la structure de bloc issue de la réponse API actuelle d'Amazon Textract, extraite du résultat des opérations ou DetectDocumentText. AnalyzeDocument Si vous avez déjà appelé Amazon Textract et enregistré le résultat de l'opération, vous pouvez fournir les références à ces résultats. Amazon Textract accepte plusieurs fichiers de préétiquetage au cas où la page de votre document contiendrait plusieurs fichiers de réponses exportés depuis une API asynchrone.

  • Fichier manifeste : JSONL-based fichier dont chaque ligne pointe vers un fichier d'annotation, le fichier de préétiquetage, une image ou un PDF d'une seule page. Reportez-vous à ce format de fichier manifeste lors de la structuration de votre fichier manifeste.

Les fichiers manifestes contiennent une ou plusieurs lignes JSON, chaque ligne contenant des informations pour une seule image. Ce qui suit est une seule ligne dans un fichier manifeste :

{ "source-ref": "s3://textract-adapters-sample-bucket-129090f9e-d51c-4034-a732-48caa3b532e7/adapters/0000000000/assets/1003_3_1.png", "source-ref-version": "uPNKaY_2I8dxj9Kp2sO0zDUt4q3MAJen", "source-ref-metadata": { "origin-ref": "s3://textract-adapters-sample-bucket-129090f9e-d51c-4034-a732-48caa3b532e7/adapters/0000000000/original_assets/1003_3.tiff", "page-number": 1 }, "annotations-ref": "s3://textract-adapters-sample-bucket-129090f9e-d51c-4034-a732-48caa3b532e7/adapters/0000000000/annotations/1003_3_1.png.json", "annotations-ref-version": "nwj_MC40zsAae_idwsdEa0r4ZQaVthGs", "annotations-ref-metadata": { "prelabeling-refs": [{ "prelabeling-ref": "s3://textract-adapters-sample-bucket-129090f9e-d51c-4034-a732-48caa3b532e7/adapters/0000000000/prelabels/fd958ee156b5b5de1ee6101dd05263120790836856774c871b877baa35e2f373/1" "prelabeling-ref-version": "uPNKaY_2I8dxj9Kp2sO0zDUt4q3MAJen" ]}, "assignment": "TRAINING", "include": true, }, "schema-version": "1.0" }

Notez que le fichier manifeste contient les informations suivantes :

  • source-ref : (Obligatoire) L'emplacement Amazon S3 de l'image ou du fichier d'une seule page. Le format est « s3 ://BUCKET/OBJECT_PATH ».

  • source-ref-version : (Facultatif) La version de l'objet Amazon S3 de l'image ou du fichier d'une seule page.

  • source-ref-metadata : (Facultatif) Métadonnées relatives à la référence source lorsque cette image d'un fichier d'une seule page doit faire partie d'un document de plusieurs pages. Ces informations sont utiles lorsque vous souhaitez évaluer l'adaptateur sur des documents de plusieurs pages. Lorsqu'elle n'est pas spécifiée, nous considérons chaque référence source comme un document autonome.

  • origin-ref : (Obligatoire) L'emplacement Amazon S3 du document multipage d'origine.

  • numéro de page : (Obligatoire) Numéro de page de la référence source dans le document original.

  • annotations-ref : (Obligatoire) L'emplacement Amazon S3 du client a effectué des annotations sur l'image. Le format est « s3 ://BUCKET/OBJECT_PATH ».

  • annotations-ref-metadata : (Obligatoire) Métadonnées relatives à l'attribut annotations. Contient les références de pré-étiquetage, ainsi que le type d'affectation de l'élément de ligne du manifeste, et si elles ont été associées include/exclude au document après la formation.

  • prelabeling-refs : (Obligatoire) Liste des fichiers issus de la réponse de l'API asynchrone Amazon Textract au fichier source-ref. Chaque fichier dans prelabeling-refs doit contenir une propriété Block, avec un maximum de 1 000 blocs.

  • prelabeling-ref (obligatoire) Emplacement Amazon S3 des annotations automatiques sur l'image à l'aide de l'API Amazon Textract.

  • prelabeling-ref-version (facultatif) La version de l'objet Amazon S3 du fichier de préétiquetage.

  • affectation : (Obligatoire) Spécifiez « ENTRAÎNEMENT » si l'image appartient à l'ensemble de données d'entraînement. Sinon, utilisez « TESTING ».

  • include : (Obligatoire) Spécifiez true pour inclure l'élément de ligne destiné à la formation. Dans le cas contraire, utilisez false.

  • schema-version : (Facultatif) Version du fichier manifeste. La valeur valide est 1,0.

Pour des améliorations de précision optimales, voirBonnes pratiques pour les requêtes personnalisées Amazon Textract.

Annoter les documents avec des requêtes et des réponses

Lorsque vous annotez vos documents, vous pouvez choisir d'étiqueter automatiquement vos documents à l'aide de la fonction de requêtes prédéfinie, puis de modifier les étiquettes si nécessaire. Vous pouvez également étiqueter manuellement les réponses pour chacune de vos requêtes documentaires.

Lorsque vous étiquetez manuellement vos documents, Amazon Textract extrait le texte brut du document. Une fois le texte brut extrait, vous pouvez utiliser l'interface Console de gestion AWS d'annotation pour créer des requêtes pour vos documents. Liez ces questions aux réponses pertinentes de vos documents afin d'établir une « vérité de base » pour la formation.

Lorsque vous étiquetez automatiquement vos documents, vous spécifiez les requêtes appropriées pour votre document. Lorsque vous avez fini d'ajouter des requêtes à vos documents, Amazon Textract tente d'en extraire les éléments appropriés pour générer des annotations. Vous devez ensuite vérifier l'exactitude de ces annotations, en corrigeant celles qui sont incorrectes. En liant les requêtes aux réponses, vous apprenez au modèle quelles informations sont importantes dans vos documents.

Lorsque vous créez des requêtes, réfléchissez aux types de questions que vous devrez poser pour récupérer les données pertinentes dans vos documents. Pour plus d'informations sur cette structure de réponse, consultez la section Structures de réponse aux requêtes. Pour plus d'informations sur les meilleures pratiques relatives aux requêtes, consultez la section Meilleures pratiques pour les requêtes.

Vous devrez former un adaptateur sur des échantillons représentatifs de vos documents. Lorsque vous utilisez le Console de gestion AWS pour annoter les documents, la console prépare automatiquement ces fichiers pour vous.