Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
Modelli di classificazione della formazione
Per addestrare un modello per la classificazione personalizzata, si definiscono le categorie e si forniscono documenti di esempio per addestrare il modello personalizzato. Il modello viene addestrato in modalità multiclasse o multi-etichetta. Multi-class la modalità associa una singola classe a ciascun documento. Multi-label la modalità associa una o più classi a ciascun documento.
La classificazione personalizzata supporta due tipi di modelli di classificazione: modelli in testo normale e modelli di documenti nativi. Un modello in testo normale classifica i documenti in base al loro contenuto testuale. Un modello di documento nativo classifica anche i documenti in base al contenuto testuale. Un modello di documento nativo può anche utilizzare segnali aggiuntivi, ad esempio provenienti dal layout del documento. Si addestra un modello di documento nativo con documenti nativi per consentire al modello di apprendere le informazioni di layout.
Plain-text i modelli hanno le seguenti caratteristiche:
-
Il modello viene addestrato utilizzando documenti di testo UTF-8 codificati.
-
È possibile addestrare il modello utilizzando documenti in una delle seguenti lingue: inglese, spagnolo, tedesco, italiano, francese o portoghese.
-
I documenti di formazione per un determinato classificatore devono utilizzare tutti la stessa lingua.
-
I documenti di formazione sono in testo semplice, quindi non ci sono costi aggiuntivi per l'estrazione del testo.
I modelli di documenti nativi hanno le seguenti caratteristiche:
-
Il modello viene addestrato utilizzando documenti semistrutturati, che includono i seguenti tipi di documenti:
-
Documenti PDF digitali e scansionati.
-
Documenti Word (DOCX).
-
Immagini: file JPG, file PNG e file TIFF a pagina singola.
-
File JSON di output dell'API Textract.
-
-
Addestrate il modello utilizzando documenti in inglese.
-
Se i documenti di formazione includono file di documenti scansionati, sono previsti costi aggiuntivi per l'estrazione del testo. Per ulteriori informazioni, consulta la pagina dei prezzi di
Amazon Comprehend.
Puoi classificare qualsiasi tipo di documento supportato utilizzando entrambi i tipi di modello. Tuttavia, per ottenere risultati più accurati, consigliamo di utilizzare un modello di testo normale per classificare i documenti di testo normale e un modello di documento nativo per classificare i documenti semistrutturati.