View a markdown version of this page

Dokumente - Amazon Kendra

Amazon Kendra ist nicht mehr offen für neue Kunden. In den Amazon Bedrock Knowledge Bases finden Sie ähnliche Funktionen wie. Amazon KendraWeitere Informationen.

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Dokumente

In diesem Abschnitt wird erklärt, wie die vielen unterstützten Dokumentformate und die verschiedenen fields/attributes Dokumente Amazon Kendra indexiert werden.

Dokumenttypen oder -formate

Amazon Kendra unterstützt gängige Dokumenttypen oder Formate wie PDF, HTML PowerPoint, Word und mehr. Ein Index kann mehrere Dokumentformate enthalten.

Amazon Kendra extrahiert den Inhalt der Dokumente, um die Dokumente durchsuchbar zu machen. Die Dokumente werden so analysiert, dass die Suche nach dem extrahierten Text und allen tabellarischen Inhalten (HTML-Tabellen) in den Dokumenten optimiert wird. Das bedeutet, die Dokumente in Felder oder Attribute zu strukturieren, die für die Suche verwendet werden. Die Metadaten des Dokuments, z. B. das Datum der letzten Änderung, können nützliche Suchfelder sein.

Dokumente können in Zeilen und Spalten organisiert werden. Beispielsweise ist jedes Dokument eine Zeile und jedes Dokument field/attribute, wie Titel und Textinhalt, ist eine Spalte. Wenn Sie beispielsweise eine Datenbank als Datenquelle verwenden, sollten die Daten strukturiert oder in Zeilen und Spalten organisiert sein.

Sie können Dokumente auf folgende Weise zu Ihrem Index hinzufügen:

Wenn Sie eine FAQ-Datei hinzufügen möchten, verwenden Sie die CreateFaq API, um die in einem Amazon S3 Bucket gespeicherte Datei hinzuzufügen. Sie können zwischen einem grundlegenden CSV-Format, einem CSV-Format, das benutzerdefinierte Felder fields/attributes in einer Kopfzeile enthält, und einem JSON-Format, das benutzerdefinierte Felder enthält, wählen. Das Standardformat ist das grundlegende CSV-Format.

Im Folgenden finden Sie Informationen zu den einzelnen unterstützten Dokumentformaten und dazu, wie jedes Format bei der Indizierung von Dokumenten Amazon Kendra behandelt wird.

Dokumentformat Behandelt als Verarbeitung des Dokuments Ursprüngliche Struktur
Portable Document Format (PDF) HTML In HTML konvertiert, dann wird der Inhalt extrahiert. Unstrukturiert
HyperText Auszeichnungssprache (HTML) HTML HTML-Tags werden herausgefiltert, um Inhalte zu extrahieren. Der Inhalt muss zwischen den wichtigsten HTML Start- und Schlusstags (<HTML>content</HTML>) liegen. Semi-structured
Erweiterbare Markup Language (XML) XML XML-Tags werden herausgefiltert, um Inhalte zu extrahieren. Semi-structured
Extensible Stylesheet Language Transformation (XSLT) XSLT Tags werden herausgefiltert, um Inhalte zu extrahieren. Semi-structured
MarkDown (MD) Klartext Der Inhalt wird inklusive MarkDown Syntax extrahiert. Semi-structured
Comma Separated Values (CSV) CSV Inhalt wird aus jeder Zelle extrahiert, wobei eine einzelne Datei als einzelnes Dokumentergebnis behandelt wird. Strukturiert für FAQ-Dateien, ansonsten halbstrukturiert
Microsoft Excel (XLS und XLSX) XLS und XLSX Aus jeder Zelle extrahierter Inhalt, wobei eine einzelne Datei als einzelnes Dokumentergebnis behandelt wird. Semi-structured
JavaScript Objektnotation (JSON) Klartext Der Inhalt wird inklusive JSON-Syntax extrahiert. Semi-structured
Rich Text Format (RTF) RTF Die RTF-Syntax wird herausgefiltert, um Inhalte zu extrahieren. Semi-structured
Microsoft PowerPoint (PPT) PPT, PPTX Nur Textinhalte werden für die Suche aus den PowerPoint Folien extrahiert. Bilder und andere Inhalte werden nicht extrahiert. Unstrukturiert
Microsoft Word DOC, DOCX Nur Textinhalte werden für die Suche aus Word-Seiten extrahiert. Bilder und andere Inhalte werden nicht extrahiert. Unstrukturiert
Klartext (TXT) TXT Der gesamte Text im Textdokument wird extrahiert. Unstrukturiert

Attribute oder Felder des Dokuments

Einem Dokument sind Attribute oder Felder zugeordnet. Felder eines Dokuments sind die Eigenschaften eines Dokuments oder das, was in der Struktur eines Dokuments enthalten ist. Beispielsweise kann jedes Ihrer Dokumente Titel, Haupttext und Autor enthalten. Sie können auch benutzerdefinierte Felder für Ihre speziellen Dokumente hinzufügen. Wenn Ihr Index beispielsweise nach Steuerdokumenten sucht, können Sie ein benutzerdefiniertes Feld für den Typ des Steuerdokuments angeben W-2, z. B. 1099 usw.

Bevor Sie ein Dokumentfeld in einer Abfrage verwenden können, muss es einem Indexfeld zugeordnet werden. Beispielsweise kann das Titelfeld dem Feld zugeordnet werden. _document_title Weitere Informationen finden Sie unter Felder https://docs.aws.amazon.com/kendra/latest/dg/field-mapping.html zuordnen. Um ein neues Feld hinzuzufügen, müssen Sie ein Indexfeld erstellen, dem das Feld zugeordnet werden soll. Sie erstellen Indexfelder mithilfe der Konsole oder mithilfe der UpdateIndex API.

Sie können Dokumentfelder verwenden, um Antworten zu filtern und facettierte Suchergebnisse zu erstellen. Beispielsweise können Sie eine Antwort so filtern, dass nur eine bestimmte Version eines Dokuments zurückgegeben wird, oder Sie können Suchanfragen so filtern, dass nur Steuerdokumente vom Typ 1099 zurückgegeben werden, die dem Suchbegriff entsprechen. Weitere Informationen finden Sie unter Filtern und Facettensuche.

Sie können Dokumentfelder auch verwenden, um die Abfrageantwort manuell zu optimieren. Sie können beispielsweise die Wichtigkeit des Titelfeldes erhöhen, um das Gewicht zu erhöhen, das dem Feld bei der Entscheidung, welche Dokumente in der Antwort zurückgegeben werden sollen, Amazon Kendra zugewiesen wird. Weitere Informationen finden Sie unter Optimieren der Suchrelevanz.

Wenn Sie ein Dokument direkt zu einem Index hinzufügen, geben Sie die Felder im Eingabeparameter Dokument für die BatchPutDocument API an. Sie geben die benutzerdefinierten Feldwerte in einem DocumentAttribute Objektarray an. Wenn Sie eine Datenquelle verwenden, hängt die Methode, mit der Sie die Dokumentfelder hinzufügen, von der Datenquelle ab. Weitere Informationen finden Sie unter Zuweisen von Datenquellenfeldern.

Verwenden Amazon Kendra reservierte oder allgemeine Dokumentfelder

Mit der UpdateIndex API können Sie reservierte oder allgemeine Felder erstellen, indem Sie den Amazon Kendra reservierten Indexfeldnamen verwenden DocumentMetadataConfigurationUpdates und angeben, um ihn Ihrem entsprechenden attribute/field Dokumentnamen zuzuordnen. Sie können auch benutzerdefinierte Felder erstellen. Wenn Sie einen Datenquellen-Connector verwenden, enthalten die meisten Feldzuordnungen, mit denen die Felder Ihres Datenquellendokuments Amazon Kendra Indexfeldern zugeordnet werden. Wenn Sie die Konsole verwenden, aktualisieren Sie Felder, indem Sie Ihre Datenquelle auswählen, die Aktion „Bearbeiten“ auswählen und dann mit dem Abschnitt „Feldzuordnungen“ fortfahren, in dem Sie die Datenquelle konfigurieren.

Sie können das Search Objekt so konfigurieren, dass ein Feld entweder als anzeigbar, facetabel, durchsuchbar und sortierbar festgelegt wird. Sie können das Relevance Objekt so konfigurieren, dass es die Rangfolge, die Boost-Dauer oder den Zeitraum eines Felds festlegt, der auf Boosting-, Aktualisierungs-, Wichtigkeitswerte und Wichtigkeitswerte angewendet wird, die bestimmten Feldwerten zugeordnet sind. Wenn Sie die Konsole verwenden, können Sie die Sucheinstellungen für ein Feld festlegen, indem Sie im Navigationsmenü die Option Facette auswählen. Um die Relevanzoptimierung festzulegen, wählen Sie im Navigationsmenü die Option zum Durchsuchen Ihres Index aus, geben Sie eine Abfrage ein und verwenden Sie die Optionen im Seitenbereich, um die Suchrelevanz zu optimieren. Sie können den Feldtyp nicht mehr ändern, nachdem Sie das Feld erstellt haben.

Amazon Kendra hat die folgenden reservierten oder allgemeinen Dokumentfelder, die Sie verwenden können:

  • _authors— Eine Liste von einem oder mehreren Autoren, die für den Inhalt des Dokuments verantwortlich sind.

  • _category— Eine Kategorie, die ein Dokument einer bestimmten Gruppe zuordnet.

  • _created_at— Datum und Uhrzeit der Erstellung des Dokuments im ISO 8601-Format. Beispielsweise ist 2012-03-25 T12:30:10 + 01:00 das ISO 8601-Datums-/Uhrzeitformat für den 25. März 2012 um 12:30 Uhr (plus 10 Sekunden) in Mitteleuropäischer Zeit.

  • _data_source_id— Der Bezeichner der Datenquelle, die das Dokument enthält.

  • _document_body— Der Inhalt des Dokuments.

  • _document_id— Ein eindeutiger Bezeichner für das Dokument.

  • _document_title— Der Titel des Dokuments.

  • _excerpt_page_number— Die Seitenzahl in einer PDF-Datei, auf der der Dokumentauszug erscheint. Wenn Ihr Index vor dem 8. September 2020 erstellt wurde, müssen Sie Ihre Dokumente erneut indizieren, bevor Sie dieses Attribut verwenden können.

  • _faq_id— Wenn es sich um ein Dokument vom Typ Frage und Antwort (FAQ) handelt, eine eindeutige Kennung für die häufig gestellten Fragen.

  • _file_type— Der Dateityp des Dokuments, z. B. PDF oder DOC.

  • _last_updated_at— Datum und Uhrzeit der letzten Aktualisierung des Dokuments im ISO 8601-Format. Beispielsweise ist 2012-03-25 T12:30:10 + 01:00 das ISO 8601-Datums-/Uhrzeitformat für den 25. März 2012 um 12:30 Uhr (plus 10 Sekunden) in Mitteleuropäischer Zeit.

  • _source_uri— Die URI, unter der das Dokument verfügbar ist. z. B. der URI des Dokuments auf einer Unternehmenswebsite

  • _version— Ein Bezeichner für die spezifische Version eines Dokuments.

  • _view_count— Die Häufigkeit, mit der das Dokument angesehen wurde.

  • _language_code(String) — Der Code für eine Sprache, die für das Dokument gilt. Standardmäßig wird Englisch verwendet, wenn Sie keine Sprache angeben. Weitere Informationen zu den unterstützten Sprachen, einschließlich ihrer Codes, finden Sie unter Dokumente in anderen Sprachen als Englisch https://docs.aws.amazon.com/kendra/latest/dg/in-adding-languages.html hinzufügen.

Für benutzerdefinierte Felder erstellen Sie diese Felder DocumentMetadataConfigurationUpdates mithilfe der UpdateIndex API, genau wie beim Erstellen eines reservierten oder allgemeinen Felds. Sie müssen den entsprechenden Datentyp für Ihr benutzerdefiniertes Feld festlegen. Wenn Sie die Konsole verwenden, aktualisieren Sie Felder, indem Sie Ihre Datenquelle auswählen, die Aktion „Bearbeiten“ auswählen und dann neben dem Abschnitt Feldzuordnungen zur Konfiguration der Datenquelle fortfahren. Einige Datenquellen unterstützen das Hinzufügen neuer Felder oder benutzerdefinierter Felder nicht. Sie können den Feldtyp nicht mehr ändern, nachdem Sie das Feld erstellt haben.

Die folgenden Typen können Sie für benutzerdefinierte Felder festlegen:

  • Date

  • Zahl

  • Zeichenfolge

  • Zeichenfolgenliste

Wenn Sie Dokumente mithilfe der BatchPutDocument API zum Index hinzugefügt haben, Attributes listet die fields/attributes Ihrer Dokumente auf und Sie erstellen Felder mithilfe des DocumentAttribute Objekts.

Für Dokumente, die aus einer Amazon S3 Datenquelle indexiert wurden, erstellen Sie Felder mithilfe einer JSON-Metadatendatei, die die Feldinformationen enthält.

Wenn Sie eine unterstützte Datenbank als Datenquelle verwenden, können Sie Ihre Felder mithilfe der Option Feldzuordnungen konfigurieren.