Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
Risultato dell'addestramento del classificatore
Dopo aver completato l'addestramento del modello di classificatore personalizzato, Amazon Comprehend crea i file di output nella posizione di output di Amazon S3 specificata nella richiesta CreateDocumentClassifier API o nella richiesta equivalente della console.
Amazon Comprehend crea una matrice di confusione quando si addestra un modello in testo normale o un modello di documento nativo. Può creare file di output aggiuntivi quando si addestra un modello di documento nativo.
Matrice di confusione
Quando si addestra un modello di classificatore personalizzato, Amazon Comprehend crea una matrice di confusione che fornisce metriche sulle prestazioni del modello durante l'addestramento. Questa matrice mostra una matrice di etichette prevista dal modello, rispetto alle etichette effettive dei documenti. Amazon Comprehend utilizza una parte dei dati di addestramento per creare la matrice di confusione.
Una matrice di confusione fornisce un'indicazione di quali classi potrebbero utilizzare più dati per migliorare le prestazioni del modello. Una classe con una frazione elevata di previsioni corrette ha il maggior numero di risultati lungo la diagonale della matrice. Se il numero sulla diagonale è inferiore, la classe ha una frazione inferiore di previsioni corrette. Puoi aggiungere altri esempi di addestramento per questa classe e addestrare nuovamente il modello. Ad esempio, se il 40% dei campioni dell'etichetta A viene classificato come etichetta D, l'aggiunta di altri campioni per l'etichetta A e l'etichetta D migliora le prestazioni del classificatore.
Dopo che Amazon Comprehend ha creato il modello di classificazione, la matrice di confusione è disponibile nel confusion_matrix.json file nella posizione di output di S3.
Il formato della matrice di confusione varia a seconda che tu abbia addestrato il classificatore utilizzando la modalità multiclasse o la modalità multi-etichetta.
Argomenti
Matrice di confusione per la modalità multiclasse
In modalità multiclasse, le singole classi si escludono a vicenda, quindi la classificazione assegna un'etichetta a ciascun documento. Ad esempio, un animale può essere un cane o un gatto, ma non entrambi contemporaneamente.
Considerate il seguente esempio di matrice di confusione per un classificatore addestrato a più classi:
A B X Y <-(predicted label)
A 1 2 0 4
B 0 3 0 1
X 0 0 1 0
Y 1 1 1 1
^
|
(actual label)
In questo caso, il modello prevedeva quanto segue:
Un'etichetta «A» è stata prevista con precisione, due etichette «A» sono state previste erroneamente come etichette «B» e quattro etichette «A» sono state previste erroneamente come etichette «Y».
Tre etichette «B» sono state previste con precisione e un'etichetta «B» è stata erroneamente prevista come etichetta «Y».
Una «X» è stata prevista con precisione.
Un'etichetta «Y» è stata prevista con precisione, una è stata prevista erroneamente come etichetta «A», una è stata prevista erroneamente come etichetta «B» e una è stata erroneamente prevista come etichetta «X».
La linea diagonale nella matrice (A:A,, B:B e) mostra le previsioni accurate. X:X Y:Y Gli errori di previsione sono i valori al di fuori della diagonale. In questo caso, la matrice mostra i seguenti tassi di errore di previsione:
-
Etichette A: 86%
-
Etichette B: 25%
-
Etichette X: 0%
-
Etichette Y: 75%
Il classificatore restituisce la matrice di confusione come file in formato JSON. Il seguente file JSON rappresenta la matrice per l'esempio precedente.
{
"type": "multi_class",
"confusion_matrix": [
[1, 2, 0,4],
[0, 3, 0, 1],
[0, 0, 1, 0],
[1, 1, 1, 1]],
"labels": ["A", "B", "X", "Y"],
"all_labels": ["A", "B", "X", "Y"]
}
Matrice di confusione per la modalità multi-etichetta
In modalità multi-etichetta, la classificazione può assegnare una o più classi a un documento. Considerate il seguente esempio di matrice di confusione per un classificatore addestrato a più classi.
In questo esempio, sono possibili tre etichette:Comedy,Action, e. Drama La matrice di confusione multi-etichetta crea una matrice 2x2 per ogni etichetta.
Comedy Action Drama
No Yes No Yes No Yes <-(predicted label)
No 2 1 No 1 1 No 3 0
Yes 0 2 Yes 2 1 Yes 1 1
^ ^ ^
| | |
|-----------(was this label actually used)--------|
In questo caso, il modello ha restituito quanto segue per l'etichetta: Comedy
-
Due casi in cui è stata prevista con precisione la presenza di
Comedyun'etichetta. Vero positivo (TP). -
Due casi in cui è stata prevista con precisione l'assenza di
Comedyun'etichetta. Vero negativo (TN). -
Zero casi in cui è stata erroneamente prevista la presenza di
Comedyun'etichetta. Falso positivo (FP). -
Un caso in cui è stato erroneamente previsto che
Comedyun'etichetta fosse assente. Falso negativo (FN).
Come per una matrice di confusione multiclasse, la linea diagonale di ogni matrice mostra le previsioni accurate.
In questo caso, il modello ha previsto con precisione Comedy le etichette l'80% delle volte (TP più TN) e le ha previste erroneamente il 20% delle volte (FP più FN).
Il classificatore restituisce la matrice di confusione come file in formato JSON. Il seguente file JSON rappresenta la matrice per l'esempio precedente.
{
"type": "multi_label",
"confusion_matrix": [
[[2, 1],
[0, 2]],
[[1, 1],
[2, 1]],
[[3, 0],
[1, 1]]
],
"labels": ["Comedy", "Action", "Drama"]
"all_labels": ["Comedy", "Action", "Drama"]
}
Output aggiuntivi per modelli di documenti nativi
Amazon Comprehend può creare file di output aggiuntivi durante il training di un modello di documento nativo.
Output di Amazon Textract
Se Amazon Comprehend richiama le API di Amazon Textract per estrarre il testo per uno qualsiasi dei documenti di formazione, salva i file di output di Amazon Textract nella posizione di output di S3. Utilizza la seguente struttura di directory:
-
Documenti di formazione:
amazon-textract-output/train/<file_name>/<page_num>/textract_output.json -
Documenti di prova:
amazon-textract-output/test/<file_name>/<page_num>/textract_output.json
Amazon Comprehend compila la cartella di test se hai fornito documenti di test nella richiesta API.
Errori di annotazione dei documenti
Amazon Comprehend crea i seguenti file nella posizione di output di Amazon S3 (nella cartella skipped_documents/) in caso di annotazioni non riuscite:
-
failed_annotations_train.jsonl
Il file esiste se alcune annotazioni non sono riuscite nei dati di allenamento.
-
failed_annotations_test.jsonl
Il file esiste se la richiesta includeva dati di test ed eventuali annotazioni non riuscite nei dati del test.
I file di annotazione non riusciti sono file JSONL con il seguente formato:
{ "File": "String", "Page": Number, "ErrorCode": "...", "ErrorMessage": "..."} {"File": "String", "Page": Number, "ErrorCode": "...", "ErrorMessage": "..." }