View a markdown version of this page

識別和處理個人身分識別資訊 (PII) - AWS Glue DataBrew開發人員指南

本文為英文版的機器翻譯版本,如內容有任何歧義或不一致之處,概以英文版為準。

識別和處理個人身分識別資訊 (PII)

當您建置分析函數或機器學習模型時,您需要保護措施,以防止個人身分識別資訊 (PII) 資料的公開。PII 是個人資料,可用於識別個人,例如地址、銀行帳戶號碼或電話號碼。例如,當資料分析師和資料科學家使用資料集來探索一般人口統計資訊時,他們不應該存取特定個人的 PII。

DataBrew 提供資料遮罩機制,以在資料準備過程中混淆 PII 資料。根據您的組織需求,有不同的 PII 資料修訂機制可用。您可以混淆 PII 資料,讓使用者無法將其還原,也可以讓混淆恢復。

在 DataBrew 中識別和遮罩 PII 資料涉及建置一組轉換,供客戶用來修訂 PII 資料。此程序的一部分是在 DataBrew 主控台的資料設定檔概觀儀表板中提供 PII 資料偵測和統計資料。

您可以使用下列資料遮罩技術:

  • 替代 - 將 PII 資料取代為其他外觀真實的值。

  • 隨機播放 – 從不同資料列中的相同資料欄隨機播放值。

  • 確定性加密 – 將確定性加密演算法套用至資料欄值。確定性加密一律會為值產生相同的加密文字。

  • 機率加密 – 將機率加密演算法套用至資料欄值。每次套用機率加密都會產生不同的加密文字。

  • 解密 – 根據加密金鑰解密資料欄。

  • 剔除或刪除 – 將特定欄位取代為 null 值或刪除資料欄。

  • 遮罩 – 使用角色雜湊或遮罩欄中的某些部分。

  • 雜湊:將雜湊函數套用至資料欄值。

如需使用轉換的詳細資訊,請參閱個人身分識別資訊 (PII) 配方步驟。如需使用設定檔任務來偵測 PII 的詳細資訊,包括可偵測到的實體類型清單,請參閱 EntityDetectorConfiguration 一節,以程式設計方式在建置設定檔任務組態中設定 PII