View a markdown version of this page

Formate der Classifier-Trainingsdateien - Amazon Comprehend

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Formate der Classifier-Trainingsdateien

Für ein Klartextmodell können Sie Klassifikator-Trainingsdaten als CSV-Datei oder als erweiterte Manifestdatei bereitstellen, die Sie mit SageMaker AI Ground Truth erstellen. Die CSV-Datei oder die erweiterte Manifestdatei enthält den Text für jedes Trainingsdokument und die zugehörigen Bezeichnungen.

Für ein systemeigenes Dokumentmodell stellen Sie Classifier-Trainingsdaten als CSV-Datei bereit. Die CSV-Datei enthält den Dateinamen für jedes Trainingsdokument und die zugehörigen Bezeichnungen. Sie fügen die Schulungsdokumente in den Amazon S3-Eingabeordner für den Schulungsjob ein.

CSV-Dateien

Sie stellen beschriftete Trainingsdaten als UTF-8 kodierten Text in einer CSV-Datei zur Verfügung. Füge keine Kopfzeile hinzu. Das Hinzufügen einer Kopfzeile in Ihrer Datei kann zu Laufzeitfehlern führen.

Für jede Zeile in der CSV-Datei enthält die erste Spalte eine oder mehrere Klassenbezeichnungen. Eine Klassenbezeichnung kann eine beliebige gültige UTF-8 Zeichenfolge sein. Wir empfehlen, klare Klassennamen zu verwenden, deren Bedeutung sich nicht überschneidet. Der Name kann Leerzeichen enthalten und aus mehreren Wörtern bestehen, die durch Unterstriche oder Bindestriche miteinander verbunden sind.

Lassen Sie vor oder nach den Kommas, die die Werte in einer Zeile trennen, keine Leerzeichen.

Der genaue Inhalt der CSV-Datei hängt vom Klassifikatormodus und der Art der Trainingsdaten ab. Einzelheiten finden Sie in den Abschnitten zu Multi-class Modus undMulti-label Modus.

Erweiterte Manifestdatei

Eine erweiterte Manifestdatei ist ein beschrifteter Datensatz, den Sie mit SageMaker AI Ground Truth erstellen. Ground Truth ist ein Datenkennzeichnungsservice, der Ihnen — oder einer von Ihnen beschäftigten Belegschaft — hilft, Trainingsdatensätze für Modelle des maschinellen Lernens zu erstellen.

Weitere Informationen zu Ground Truth und den daraus resultierenden Ergebnissen finden Sie im Amazon AI Developer Guide unter Verwenden von SageMaker AI Ground Truth zur Kennzeichnung von Daten. SageMaker

Erweiterte Manifestdateien sind im JSON-Zeilenformat. In diesen Dateien ist jede Zeile ein vollständiges JSON-Objekt, das ein Trainingsdokument und die zugehörigen Bezeichnungen enthält. Der genaue Inhalt jeder Zeile hängt vom Klassifikatormodus ab. Einzelheiten finden Sie in den Abschnitten zu Multi-class Modus undMulti-label Modus.

Wenn Sie Amazon Comprehend Ihre Trainingsdaten zur Verfügung stellen, geben Sie einen oder mehrere Namen von Labelattributen an. Wie viele Attributnamen Sie angeben, hängt davon ab, ob Ihre erweiterte Manifestdatei die Ausgabe eines einzelnen Etikettierungsauftrags oder eines verketteten Etikettierungsauftrags ist.

Wenn Ihre Datei das Ergebnis eines einzelnen Beschriftungsauftrags ist, geben Sie den Namen des einzelnen Labelattributs aus dem Ground-Truth-Job an.

Wenn Ihre Datei das Ergebnis eines verketteten Etikettierauftrags ist, geben Sie den Namen des Labelattributs für einen oder mehrere Aufträge in der Kette an. Jeder Name des Labelattributs enthält die Anmerkungen zu einem einzelnen Auftrag. Sie können bis zu 5 dieser Attribute für erweiterte Manifestdateien aus verketteten Labeling-Aufträgen angeben.

Weitere Informationen zu verketteten Labeling-Aufträgen und Beispiele für die von ihnen erzeugte Ausgabe finden Sie unter Verkettung von Labeling-Aufträgen im Amazon SageMaker AI Developer Guide.