View a markdown version of this page

發佈 - AWS Glue

本文為英文版的機器翻譯版本,如內容有任何歧義或不一致之處,概以英文版為準。

發佈

使用 Distribution Analyzer 計算資料欄中值的頻率分佈。分析器會根據資料欄資料類型產生不同的輸出:

  • 數值欄 – 產生二進位長條圖。長條圖會將資料欄的值範圍分割為等寬間隔 (bins),並計算每個儲存貯體中的值數目。

  • 字串、日期和其他非數值資料欄 – 產生值分佈,計算每個不同值的頻率,依頻率遞減排序。分析器只會傳回前 20 個最常用的值。

注意

您只能在 DQDL 規則集的 Analyzers 區塊中使用 Distribution Analyzer。它不能用作規則。

語法

Distribution <COL_NAME> Distribution <COL_NAME> with bins = <BIN_COUNT> Distribution <COL_NAME> with bins = <BIN_COUNT>, rebin = <true|false>
  • COL_NAME – 要分析或AllColumns運算資料集中所有資料欄分佈的資料欄名稱。

    支援的欄類型:任何欄類型

  • bins (選用) – 用於數值欄長條圖的 bins (間隔) 數目。預設值為 20。最大值為 20。此參數不會影響非數值資料欄。

  • rebin (選用) – 控制自動 rebinning 行為。當溢位超過連續執行的閾值時,分析器會自動儲存庫。預設值為 true。設定為 false以無限期地凍結儲存貯體邊緣,無論溢出頻率為何。如需詳細資訊,請參閱自動重組

範例 – 單一資料欄的基本分佈

下列範例會使用預設的 20 個 bin 來計算資料Salary欄的頻率分佈:

Analyzers = [ Distribution "Salary" ]

範例 – 自訂 bin 計數

下列範例使用 10 個 bin 運算資料Age欄的長條圖:

Analyzers = [ Distribution "Age" with bins = 10 ]

範例 – 所有資料欄的分佈

下列範例會運算資料集中所有資料欄的分佈。數值資料欄會產生具有 20 個 bin 的長條圖,非數值資料欄會產生值分佈:

Analyzers = [ Distribution AllColumns ]

範例 – 結合規則和其他分析器

下列範例顯示結合規則、標準分析器和Distribution分析器的規則集:

Rules = [ RowCount > 100, Completeness "Salary" > 0.9 ] Analyzers = [ Mean "Salary", StandardDeviation "Salary", Distribution "Salary" with bins = 15, Distribution "Department" ]

輸出格式

當您執行 Distribution Analyzer 時,會產生名為 的統計資料Distribution。純量統計資料 (例如 MeanSum) 會傳回單一數值。相對而言, Distribution 統計資料會傳回結構化結果:

  • BinEdges – 定義 bin 界限 (數值欄) 或相異值 (非數值欄) 的陣列。

  • Count – 每個儲存貯體或值的頻率陣列。

您可以使用 ListDataQualityStatistics API 或 GetDataQualityResult API 擷取分佈結果。如需 Data Quality APIs的詳細資訊,請參閱 Glue APIs 參考中的 Data Quality API。 AWS

Null 行為

分析器會從 bin 計算中排除目標欄中具有 NULL 值的資料列。

如需凍結的儲存貯體邊緣、溢位觀察和自動重組的詳細資訊,請參閱 Distribution Analyzer