View a markdown version of this page

Requisiti relativi ai dati di formazione per Clean Rooms ML - AWS Clean Rooms

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

Requisiti relativi ai dati di formazione per Clean Rooms ML

Per creare con successo un modello simile, i dati di training devono soddisfare i seguenti requisiti:

  • I dati di allenamento devono essere in formato Parquet, CSV o JSON.

    Nota

    I dati Parquet compressi Zstandard (ZSTD) non sono supportati.

  • I dati di allenamento devono essere catalogati in. AWS Glue Per ulteriori informazioni, consulta Guida introduttiva all'AWS Glue Data Catalog nella AWS Glue Developer Guide. Ti consigliamo di utilizzare AWS Glue i crawler per creare le tabelle perché lo schema viene dedotto automaticamente.

  • Il bucket Amazon S3 che contiene i dati di training e i dati iniziali si trova nella stessa AWS regione delle altre risorse ML di Clean Rooms.

  • I dati di addestramento devono contenere almeno 100.000 ID utente univoci con almeno due interazioni tra elementi ciascuno.

  • I dati di addestramento devono contenere almeno 1 milione di record.

  • Lo schema specificato nell'CreateTrainingDatasetazione deve essere allineato allo schema definito al momento della creazione della AWS Glue tabella.

  • I campi obbligatori, come definiti nella tabella fornita, sono definiti nell'CreateTrainingDatasetazione.

    Tipo di campo Tipi di dati supportati Richiesto Description
    USER_ID string, int, bigint Sì Un identificatore univoco per ogni utente del set di dati. Dovrebbe essere un valore di informazioni non identificabili personalmente (PII). Potrebbe essere un identificatore con hash o un ID cliente.
    ITEM_ID string, int, bigint Sì Un identificatore univoco per ogni elemento con cui un utente interagisce.
    TIMESTAMP bigint, int, timestamp Sì L'ora in cui un utente ha interagito con l'elemento. I valori devono essere nel formato Unix epoch time in secondi.
    CARATTERISTICA_CATEGORICA stringa, int, float, bigint, double, booleano, matrice No Acquisisce dati categorici relativi all'utente o all'elemento. Ciò può includere elementi come il tipo di evento (ad esempio clic o acquisto), i dati demografici degli utenti (fascia di età, sesso - resi anonimi), la posizione dell'utente (città, paese - resi anonimi), la categoria dell'articolo (ad esempio abbigliamento o elettronica) o il marchio dell'articolo.
    CARATTERISTICA_NUMERICA double, float, int, bigint No Acquisisce dati numerici relativi all'utente o all'elemento. Ciò può includere elementi come la cronologia degli acquisti degli utenti (importo totale speso), il prezzo dell'articolo, il numero di volte in cui un articolo viene visitato o le valutazioni degli utenti per gli articoli.
  • Facoltativamente, puoi fornire fino a 10 caratteristiche categoriche o numeriche totali.

Ecco un esempio di set di dati di allenamento valido in formato CSV

USER_ID,ITEM_ID,TIMESTAMP,EVENT_TYPE(CATEGORICAL FEATURE),EVENT_VALUE (NUMERICAL FEATURE) 196,242,881250949,click,15 186,302,891717742,click,13 22,377,878887116,click,10 244,51,880606923,click,20 166,346,886397596,click,10