View a markdown version of this page

AWS-Reinräume ML - AWS Clean Rooms

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

AWS-Reinräume ML

Mit AWS Clean Rooms ML können zwei oder mehr Parteien Modelle für maschinelles Lernen auf ihren Daten ausführen, ohne dass sie ihre Daten miteinander teilen müssen. Der Service bietet datenschutzfreundliche Kontrollen, die es Dateninhabern ermöglichen, ihre Daten und ihr Modell-IP zu schützen. Sie können selbst AWS erstellte Modelle verwenden oder Ihr eigenes benutzerdefiniertes Modell mitbringen.

Eine detailliertere Erläuterung der Funktionsweise finden Sie unter. Cross-account Jobs

Weitere Informationen zu den Funktionen von Clean Rooms ML-Modellen finden Sie in den folgenden Themen.

Die ML-Terminologie von AWS Clean Rooms

Es ist wichtig, die folgende Terminologie zu verstehen, wenn Sie Clean Rooms ML verwenden:

  • Anbieter von Trainingsdaten — Die Partei, die die Trainingsdaten beisteuert, ein Lookalike-Modell erstellt und konfiguriert und dieses Lookalike-Modell dann einer Kollaboration zuordnet.

  • Anbieter von Startdaten — Die Partei, die die Startdaten beisteuert, ein Lookalike-Segment generiert und sein Lookalike-Segment exportiert.

  • Trainingsdaten — Die Daten des Anbieters der Trainingsdaten, die zur Generierung eines ähnlichen Modells verwendet werden. Die Trainingsdaten werden verwendet, um die Ähnlichkeit des Benutzerverhaltens zu messen.

    Die Trainingsdaten müssen eine Benutzer-ID, eine Artikel-ID und eine Zeitstempelspalte enthalten. Optional können die Trainingsdaten andere Interaktionen als numerische oder kategoriale Merkmale enthalten. Beispiele für Interaktionen sind eine Liste von angesehenen Videos, gekauften Artikeln oder gelesenen Artikeln.

  • Startdaten — Die Daten des Seed-Datenanbieters, die zur Erstellung eines Lookalike-Segments verwendet werden. Die Startdaten können direkt bereitgestellt werden oder aus den Ergebnissen einer AWS Clean Rooms Abfrage stammen. Bei der Ausgabe des Lookalike-Segments handelt es sich um eine Gruppe von Benutzern aus den Trainingsdaten, die den Startbenutzern am ähnlichsten sind.

  • Lookalike-Modell — Ein maschinelles Lernmodell der Trainingsdaten, das verwendet wird, um ähnliche Benutzer in anderen Datensätzen zu finden.

    Bei Verwendung der API wird der Begriff Zielgruppenmodell äquivalent zum Lookalike-Modell verwendet. Beispielsweise verwenden Sie die CreateAudienceModel API, um ein Lookalike-Modell zu erstellen.

  • Lookalike-Segment — Eine Teilmenge der Trainingsdaten, die den Startdaten am ehesten ähnelt.

    Wenn Sie die API verwenden, erstellen Sie ein Lookalike-Segment mit der API. StartAudienceGenerationJob

Die Daten des Anbieters der Trainingsdaten werden niemals an den Anbieter der Startdaten weitergegeben, und die Daten des Anbieters der Startdaten werden niemals an den Anbieter der Trainingsdaten weitergegeben. Die Ausgabe des Lookalike-Segments wird mit dem Anbieter der Trainingsdaten geteilt, niemals jedoch mit dem Anbieter der Startdaten.

Wie funktioniert AWS Clean Rooms ML mit AWS -Modelle von

Ein Überblick darüber, wie AWS Clean Rooms ML mit AWS Modellen funktioniert.

Die Arbeit mit ähnlichen Modellen erfordert, dass zwei Parteien, ein Anbieter von Trainingsdaten und ein Anbieter von Startdaten, nacheinander zusammenarbeiten, AWS Clean Rooms um ihre Daten in eine Zusammenarbeit einzubringen. Dies ist der Arbeitsablauf, den der Anbieter von Trainingsdaten zuerst abschließen muss:

  1. Die Daten des Anbieters von Trainingsdaten müssen in einer AWS Glue Datenkatalogtabelle mit Interaktionen zwischen Benutzern und Elementen gespeichert werden. Die Trainingsdaten müssen mindestens eine Benutzer-ID-Spalte, eine Interaktions-ID-Spalte und eine Zeitstempelspalte enthalten.

  2. Der Anbieter von Trainingsdaten registriert die Trainingsdaten bei AWS Clean Rooms.

  3. Der Trainingsdatenanbieter erstellt ein Lookalike-Modell, das mit mehreren Anbietern von Startdaten gemeinsam genutzt werden kann. Das Lookalike-Modell ist ein tiefes neuronales Netzwerk, dessen Training bis zu 24 Stunden dauern kann. Es wird nicht automatisch neu trainiert und wir empfehlen, das Modell wöchentlich neu zu trainieren.

  4. Der Anbieter von Trainingsdaten konfiguriert das Lookalike-Modell, einschließlich der Frage, ob Relevanzmetriken gemeinsam genutzt werden sollen, und die Amazon S3-Position der Ausgabesegmente. Der Anbieter von Trainingsdaten kann aus einem einzigen Lookalike-Modell mehrere konfigurierte Lookalike-Modelle erstellen.

  5. Der Anbieter von Trainingsdaten ordnet das konfigurierte Zielgruppenmodell einer Kollaboration zu, die mit einem Anbieter von Startdaten gemeinsam genutzt wird.

Dies ist der Arbeitsablauf, den der Anbieter von Startdaten als Nächstes abschließen muss:

  1. Die Daten des Seed-Datenanbieters können in einem Amazon S3-Bucket gespeichert werden oder aus den Ergebnissen einer Abfrage stammen.

  2. Der Anbieter von Startdaten eröffnet die Zusammenarbeit, die er mit dem Anbieter der Trainingsdaten teilt.

  3. Der Anbieter von Startdaten erstellt auf der Seite für die Zusammenarbeit auf der Registerkarte Clean Rooms ML ein Lookalike-Segment.

  4. Der Anbieter von Startdaten kann die Relevanzmetriken auswerten, sofern sie gemeinsam genutzt wurden, und das Lookalike-Segment zur Verwendung nach außen exportieren. AWS Clean Rooms

Wie funktioniert AWS Clean Rooms ML mit benutzerdefinierten Modellen

Mit Clean Rooms ML können Mitglieder einer Kollaboration einen angedockten Algorithmus für benutzerdefinierte Modelle verwenden, der in Amazon ECR gespeichert ist, um ihre Daten gemeinsam zu analysieren. Dazu muss der Modellanbieter ein Image erstellen und es in Amazon ECR speichern. Folgen Sie den Schritten im Amazon Elastic Container Registry User Guide, um ein privates Repository zu erstellen, das das benutzerdefinierte ML-Modell enthält.

Jedes Mitglied einer Kollaboration kann der Model-Anbieter sein, sofern es über die richtigen Berechtigungen verfügt. Alle Mitglieder einer Kollaboration können Trainingsdaten, Inferenzdaten oder beides zum Modell beitragen. Für die Zwecke dieses Leitfadens werden Mitglieder, die Daten beisteuern, als Datenanbieter bezeichnet. Das Mitglied, das die Kollaboration erstellt, ist der Ersteller der Kollaboration. Dieses Mitglied kann entweder der Modellanbieter, einer der Datenanbieter oder beide sein.

Auf der höchsten Ebene sind die folgenden Schritte aufgeführt, die ausgeführt werden müssen, um eine benutzerdefinierte ML-Modellierung durchzuführen:

  1. Der Ersteller der Kollaboration erstellt eine Kollaboration und weist jedem Mitglied die entsprechenden Mitgliederfähigkeiten und Zahlungskonfigurationen zu. Der Ersteller der Kollaboration muss in diesem Schritt dem Mitglied die Möglichkeit zuweisen, entweder Modellergebnisse oder Inferenzergebnisse zu empfangen, dem entsprechenden Mitglied in diesem Schritt, da diese Fähigkeit nicht mehr aktualisiert werden kann, nachdem die Kollaboration erstellt wurde. Weitere Informationen finden Sie unter Kollaboration in AWS Clean Rooms ML erstellen und ihr beitreten.

  2. Der Modellanbieter konfiguriert und ordnet sein containerisiertes ML-Modell der Kollaboration zu und stellt sicher, dass Datenschutzbeschränkungen für exportierte Daten festgelegt werden. Weitere Informationen finden Sie unter Konfiguration eines Modellalgorithmus in AWS Clean Rooms ML.

  3. Die Datenanbieter tragen ihre Daten zur Zusammenarbeit bei und stellen sicher, dass ihre Datenschutzanforderungen spezifiziert werden. Die Datenanbieter müssen dem Modell den Zugriff auf ihre Daten ermöglichen. Weitere Informationen erhalten Sie unter Bereitstellung von Trainingsdaten in AWS Clean Rooms ML und Verknüpfung des konfigurierten Modellalgorithmus in AWS Clean Rooms ML.

  4. Ein Kollaborationsmitglied erstellt die ML-Konfiguration, die definiert, wohin die Modellartefakte oder Inferenzergebnisse exportiert werden.

  5. Ein Kollaborationsmitglied erstellt einen ML-Eingabekanal, der Eingaben für den Trainingscontainer oder Inferenzcontainer bereitstellt. Der ML-Eingabekanal ist eine Abfrage, die die Daten definiert, die im Kontext des Modellalgorithmus verwendet werden sollen.

  6. Ein Kollaborationsmitglied ruft das Modelltraining mithilfe des ML-Eingabekanals und des konfigurierten Modellalgorithmus auf. Weitere Informationen finden Sie unter Erstellen eines trainierten Modells in AWS Clean Rooms ML.

  7. (Optional) Der Modeltrainer ruft den Modellexportjob auf und die Modellartefakte werden an den Empfänger der Modellergebnisse gesendet. Nur Mitglieder mit einer gültigen ML-Konfiguration und der Fähigkeit des Mitglieds, Modellausgaben zu empfangen, können Modellartefakte empfangen. Weitere Informationen finden Sie unter Exportieren von Modellartefakten aus AWS Clean Rooms ML.

  8. (Optional) Ein Kollaborationsmitglied ruft die Modellinferenz mithilfe des ML-Eingabekanals, des trainierten Modell-ARN und des für die Inferenz konfigurierten Modellalgorithmus auf. Die Inferenzergebnisse werden an den Inferenzausgabeempfänger gesendet. Nur Mitglieder mit einer gültigen ML-Konfiguration und der Fähigkeit der Mitglieder, Inferenzausgaben zu empfangen, können Inferenzergebnisse empfangen.

Hier sind die Schritte, die vom Modellanbieter ausgeführt werden müssen:

  1. Erstellen Sie ein SageMaker AI-kompatibles Amazon ECR-Docker-Image. Clean Rooms ML unterstützt nur SageMaker AI-kompatible Docker-Images.

  2. Nachdem Sie ein SageMaker AI-kompatibles Docker-Image erstellt haben, übertragen Sie das Image auf Amazon ECR. Folgen Sie den Anweisungen im Amazon Elastic Container Registry User Guide, um ein Container-Training-Image zu erstellen.

  3. Konfigurieren Sie den Modellalgorithmus für die Verwendung in Clean Rooms ML.

    1. Geben Sie den Amazon ECR-Repository-Link und alle Argumente an, die für die Konfiguration des Modellalgorithmus erforderlich sind.

    2. Stellen Sie eine Servicezugriffsrolle bereit, die Clean Rooms ML den Zugriff auf das Amazon ECR-Repository ermöglicht.

    3. Ordnen Sie den konfigurierten Modellalgorithmus der Zusammenarbeit zu. Dazu gehört auch die Bereitstellung einer Datenschutzrichtlinie, die Kontrollen für Containerprotokolle, Fehlerprotokolle, CloudWatch Metriken und Grenzwerte dafür definiert, wie viele Daten aus den Container-Ergebnissen exportiert werden können.

Hier sind die Schritte, die der Datenanbieter ausführen muss, um mit einem benutzerdefinierten ML-Modell zusammenarbeiten zu können:

  1. Konfigurieren Sie eine vorhandene AWS Glue Tabelle mit einer benutzerdefinierten Analyseregel. Auf diese Weise kann eine bestimmte Gruppe von vorab genehmigten Abfragen oder vorab genehmigten Konten Ihre Daten verwenden.

  2. Ordnen Sie Ihre konfigurierte Tabelle einer Kollaboration zu und stellen Sie eine Servicezugriffsrolle bereit, die auf Ihre AWS Glue Tabellen zugreifen kann.

  3. Fügen Sie der Tabelle eine Regel für die Kollaborationsanalyse hinzu, die der konfigurierten Modellalgorithmus-Zuordnung den Zugriff auf die konfigurierte Tabelle ermöglicht.

  4. Nachdem das Modell und die Daten in Clean Rooms ML verknüpft und konfiguriert wurden, stellt das Mitglied, das Abfragen ausführen kann, eine SQL-Abfrage bereit und wählt den zu verwendenden Modellalgorithmus aus.

Nach Abschluss des Modelltrainings initiiert dieses Mitglied den Export von Artefakten oder Inferenzergebnissen des Modelltrainings. Diese Artefakte oder Ergebnisse werden an das Mitglied gesendet, das die trainierte Modellausgabe empfangen kann. Der Empfänger der Ergebnisse muss ihre Konfiguration vornehmen, MachineLearningConfiguration bevor er die Modellausgabe empfangen kann.