Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.
Privacy-enhanced generación de conjuntos de datos sintéticos
Un conjunto de datos sintéticos tiene propiedades estadísticas similares a las del conjunto de datos original en el que se basa, pero no contiene las observaciones del mundo real presentes en el conjunto de datos original. Al usar conjuntos de datos sintéticos con privacidad mejorada, puedes desbloquear nuevos modelos de aprendizaje automático (ML) para entrenar casos de uso que antes evitaban los problemas de privacidad de los datos. Al crear un canal de entrada de aprendizaje automático, puede generar datos sintéticos para proteger la información confidencial mientras entrena modelos de aprendizaje automático.
Al crear una plantilla con datos sintéticos, debe:
-
Exigir que la salida de la plantilla sea sintética
-
Clasifique las columnas del esquema de salida como numéricas o categóricas
-
Personalice los datos sintéticos en función de las necesidades de la organización
-
Ajustar la configuración de privacidad:
-
Establecer el nivel de privacidad (epsilon)
-
Configurar el umbral de privacidad
-
aviso
La generación de datos sintéticos evita deducir atributos individuales, ya sea si hay individuos específicos en el conjunto de datos original o si existen atributos de aprendizaje de esos individuos. Sin embargo, no impide que los valores literales del conjunto de datos original, incluida la información de identificación personal (PII), aparezcan en el conjunto de datos sintético.
Recomendamos evitar los valores del conjunto de datos de entrada que estén asociados a un solo sujeto de datos, ya que pueden volver a identificar a un sujeto de datos. Por ejemplo, si solo un usuario vive en un código postal, la presencia de ese código postal en el conjunto de datos sintético confirmaría que el usuario estaba en el conjunto de datos original. Para mitigar este riesgo, se pueden utilizar técnicas como truncar valores de alta precisión o reemplazar catálogos poco comunes por otros. Estas transformaciones pueden formar parte de la consulta utilizada para crear el canal de entrada ML.
Para obtener más información sobre cómo generar datos sintéticos para el entrenamiento de modelos personalizados, consulteCreación de una plantilla de análisis SQL.
Las plantillas de análisis con salidas sintéticas solo se pueden usar para crear canales de entrada de aprendizaje automático. Para obtener más información, consulte Creación de un canal de entrada de aprendizaje automático en AWS Clean Rooms ML.