本文為英文版的機器翻譯版本,如內容有任何歧義或不一致之處,概以英文版為準。
發佈
使用 Distribution Analyzer 計算資料欄中值的頻率分佈。分析器會根據資料欄資料類型產生不同的輸出:
-
數值欄 – 產生二進位長條圖。長條圖會將資料欄的值範圍分割為等寬間隔 (bins),並計算每個儲存貯體中的值數目。
-
字串、日期和其他非數值資料欄 – 產生值分佈,計算每個不同值的頻率,依頻率遞減排序。分析器只會傳回前 20 個最常用的值。
注意
您只能在 DQDL 規則集的 Analyzers 區塊中使用 Distribution Analyzer。它不能用作規則。
語法
Distribution<COL_NAME>Distribution<COL_NAME>with bins =<BIN_COUNT>Distribution<COL_NAME>with bins =<BIN_COUNT>, rebin =<true|false>
-
COL_NAME – 要分析或
AllColumns運算資料集中所有資料欄分佈的資料欄名稱。支援的欄類型:任何欄類型
-
bins (選用) – 用於數值欄長條圖的 bins (間隔) 數目。預設值為 20。最大值為 20。此參數不會影響非數值資料欄。
-
rebin (選用) – 控制自動 rebinning 行為。當溢位超過連續執行的閾值時,分析器會自動儲存庫。預設值為
true。設定為false以無限期地凍結儲存貯體邊緣,無論溢出頻率為何。如需詳細資訊,請參閱自動重組。
範例 – 單一資料欄的基本分佈
下列範例會使用預設的 20 個 bin 來計算資料Salary欄的頻率分佈:
Analyzers = [ Distribution "Salary" ]
範例 – 自訂 bin 計數
下列範例使用 10 個 bin 運算資料Age欄的長條圖:
Analyzers = [ Distribution "Age" with bins = 10 ]
範例 – 所有資料欄的分佈
下列範例會運算資料集中所有資料欄的分佈。數值資料欄會產生具有 20 個 bin 的長條圖,非數值資料欄會產生值分佈:
Analyzers = [ Distribution AllColumns ]
範例 – 結合規則和其他分析器
下列範例顯示結合規則、標準分析器和Distribution分析器的規則集:
Rules = [ RowCount > 100, Completeness "Salary" > 0.9 ] Analyzers = [ Mean "Salary", StandardDeviation "Salary", Distribution "Salary" with bins = 15, Distribution "Department" ]
輸出格式
當您執行 Distribution Analyzer 時,會產生名為 的統計資料Distribution。純量統計資料 (例如 Mean或 Sum) 會傳回單一數值。相對而言, Distribution 統計資料會傳回結構化結果:
-
BinEdges– 定義 bin 界限 (數值欄) 或相異值 (非數值欄) 的陣列。 -
Count– 每個儲存貯體或值的頻率陣列。
您可以使用 ListDataQualityStatistics API 或 GetDataQualityResult API 擷取分佈結果。如需 Data Quality APIs的詳細資訊,請參閱 Glue APIs 參考中的 Data Quality API。 AWS
Null 行為
分析器會從 bin 計算中排除目標欄中具有 NULL 值的資料列。
如需凍結的儲存貯體邊緣、溢位觀察和自動重組的詳細資訊,請參閱 Distribution Analyzer。