Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
Anforderungen an die Schulungsdaten für Clean Rooms ML
Um erfolgreich ein Lookalike-Modell zu erstellen, müssen Ihre Trainingsdaten die folgenden Anforderungen erfüllen:
-
Die Trainingsdaten müssen im Parquet-, CSV- oder JSON-Format vorliegen.
Anmerkung
Zstandard (ZSTD) komprimierte Parquet-Daten werden nicht unterstützt.
-
Ihre Trainingsdaten müssen in katalogisiert sein. AWS Glue Weitere Informationen finden Sie unter Erste Schritte mit dem AWS Glue-Datenkatalog im AWS Glue Entwicklerhandbuch. Wir empfehlen, AWS Glue Crawler zum Erstellen Ihrer Tabellen zu verwenden, da das Schema automatisch abgeleitet wird.
-
Der Amazon S3-Bucket, der die Trainingsdaten und Startdaten enthält, befindet sich in derselben AWS Region wie Ihre anderen Clean Rooms ML-Ressourcen.
-
Die Trainingsdaten müssen mindestens 100.000 eindeutige Benutzer-IDs mit jeweils mindestens zwei Artikelinteraktionen enthalten.
-
Die Trainingsdaten müssen mindestens 1 Million Datensätze enthalten.
-
Das in der CreateTrainingDataset Aktion angegebene Schema muss mit dem Schema übereinstimmen, das bei der Erstellung der AWS Glue Tabelle definiert wurde.
-
Die erforderlichen Felder, wie in der bereitgestellten Tabelle definiert, sind in der CreateTrainingDataset Aktion definiert.
Feldtyp Unterstützte Datentypen Erforderlich Description USER_ID Zeichenfolge, Ganzzahl, Bigint Ja Eine eindeutige Kennung für jeden Benutzer im Datensatz. Es sollte ein Wert für nicht persönlich identifizierbare Informationen (PII) sein. Dies kann eine Hash-ID oder eine Kunden-ID sein. ITEM_ID Zeichenfolge, Ganzzahl, Bigint Ja Eine eindeutige Kennung für jedes Objekt, mit dem ein Benutzer interagiert. TIMESTAMP (ZEITSTEMPEL) bigint, int, timestamp Ja Der Zeitpunkt, zu dem ein Benutzer mit dem Objekt interagiert hat. Die Werte müssen im Unix-Zeitformat im Sekundenformat vorliegen. KATEGORIALES_MERKMAL Zeichenfolge, Ganzzahl, Float, Bigint, Double, Boolean, Matrix Nein Erfasst kategoriale Daten, die sich auf den Benutzer oder das Objekt beziehen. Dazu können Dinge wie ein Ereignistyp (wie Klick oder Kauf), demografische Daten der Nutzer (Altersgruppe, Geschlecht — anonymisiert), der Standort des Benutzers (Stadt, Land — anonymisiert), Artikelkategorie (wie Kleidung oder Elektronik) oder Artikelmarke gehören. NUMERISCHES_MERKMAL doppelt, float, int, bigint Nein Erfasst numerische Daten, die sich auf den Benutzer oder das Objekt beziehen. Dazu können Dinge wie die Kaufhistorie der Nutzer (Gesamtbetrag der Ausgaben), der Artikelpreis, die Anzahl der Besuche eines Artikels oder Nutzerbewertungen für Artikel gehören. -
Optional können Sie insgesamt bis zu 10 kategoriale oder numerische Merkmale angeben.
Hier ist ein Beispiel für einen gültigen Trainingsdatensatz im CSV-Format
USER_ID,ITEM_ID,TIMESTAMP,EVENT_TYPE(CATEGORICAL FEATURE),EVENT_VALUE (NUMERICAL FEATURE) 196,242,881250949,click,15 186,302,891717742,click,13 22,377,878887116,click,10 244,51,880606923,click,20 166,346,886397596,click,10