View a markdown version of this page

利用可能なチェック - AWS Glue DataBrewデベロッパーガイド

翻訳は機械翻訳により提供されています。提供された翻訳内容と英語版の間で齟齬、不一致または矛盾がある場合、英語版が優先します。

利用可能なチェック

次の表に、ルールで使用できるすべての条件のリファレンスを示します。集約された条件は、同じルールの非集約条件と組み合わせることはできません。

注記

SDK ユーザーの場合、同じルールを複数の列に適用するには、ルールColumnSelectors 属性を使用し、名前または正規表現を使用して検証済み列を指定します。この場合、暗黙的な CheckExpression を使用する必要があります。たとえば、選択した各列の値を指定された値と比較“> :val”します。DataBrew は、動的データセットで FilterExpression を定義するために暗黙的な構文を使用します。各チェックに列 (複数可) を個別に指定する場合は、ColumnSelectors 属性を設定しないでください。代わりに、明示的な式を指定します。例えば、ルールCheckExpression “:col > :val”として。

条件の種類 データの品質チェック 追加パラメータ 比較タイプ SDK 構文の例
データセット条件を集約する 行数 カスタム値との数値比較

"CheckExpression": "AGG(ROWS_COUNT) > :val", "SubstitutionMap": {":val", "10000"}

列の数 カスタム値との数値比較

"CheckExpression": "AGG(COLUMNS_COUNT) == :val", "SubstitutionMap": {":val", "20"}

重複行

カスタム値との数値比較

"CheckExpression": "AGG(DUPLICATE_ROWS_COUNT) < :val", "SubstitutionMap": {":val", "100"}

または

"CheckExpression": "AGG(DUPLICATE_ROWS_PERCENTAGE) < :val", "SubstitutionMap": {":val", "5"}

列統計条件を集計する 欠落した値 カスタム値との数値比較

"CheckExpression": "AGG(MISSING_VALUES_COUNT) < :val", "SubstitutionMap": {":val", "100"}

または

"CheckExpression": "AGG(MISSING_VALUES_PERCENTAGE) < :val", "SubstitutionMap": {":val", "5"}

重複する値 カスタム値との数値比較

"CheckExpression": "AGG(DUPLICATE_VALUES_COUNT) < :val", "SubstitutionMap": {":val", "100"}

または

"CheckExpression": "AGG(DUPLICATE_VALUES_PERCENTAGE) < :val", "SubstitutionMap": {":val", "5"}

有効値

カスタム値との数値比較

"CheckExpression": "AGG(VALID_VALUES_COUNT) > :val", "SubstitutionMap": {":val", "10000"}

または

"CheckExpression": "AGG(VALID_VALUES_PERCENTAGE) > :val", "SubstitutionMap": {":val", "95"}

個別の値 カスタム値との数値比較

"CheckExpression": "AGG(DISTINCT_VALUES_COUNT) > :val", "SubstitutionMap": {":val", "1000"}

または

"CheckExpression": "AGG(DISTINCT_VALUES_PERCENTAGE) >= :val", "SubstitutionMap": {":val", "50"}

一意の値

カスタム値との数値比較

"CheckExpression": "AGG(UNIQUE_VALUES_COUNT) > :val", "SubstitutionMap": {":val", "100"}

または

"CheckExpression": "AGG(UNIQUE_VALUES_PERCENTAGE) > :val", "SubstitutionMap": {":val", "20"}

外れ値

Z スコアのしきい値 カスタム値との数値比較

"CheckExpression": "AGG(Z_SCORE_OUTLIERS_COUNT, :zscore_dev) < :val", "SubstitutionMap": {":zscore_dev": "4", ":val", "100"}

または

"CheckExpression": "AGG(Z_SCORE_OUTLIERS_PERCENTAGE) < :val", "SubstitutionMap": {":val", "5"}

値分散統計

統計名 (次の表を参照) カスタム値との数値比較

"CheckExpression": "AGG(<STAT_NAME>) < :val", "SubstitutionMap": {":val", "100"}

または

"CheckExpression": "AGG(<STAT_NAME>, :param) < :val", "SubstitutionMap": {":param": "0.25", :val", "5"}

注記

可能なSTAT_NAME値については、次の表を参照してください。

数値統計

統計名 (次の表を参照) カスタム値との数値比較

"CheckExpression": "AGG(<STAT_NAME>) < :val", "SubstitutionMap": {":val", "100"}

または

"CheckExpression": "AGG(<STAT_NAME>, :param) < :val", "SubstitutionMap": {":param": "0.25", :val", "5"}

注記

可能なSTAT_NAME値については、次の表を参照してください。

非集計 (しきい値を受け入れる) 値は正確に 値のリストとの正確な比較

"CheckExpression": ":col IN :list", "SubstitutionMap": {":col": "`size`", ":list": "[\"S\",\"M\",\"L\",\"XL\"]"}

値が正確にない 値は、リストからの値と完全に一致してはいけません

"CheckExpression": ":col NOT IN :list", "SubstitutionMap": {":col": "`domain`", ":list": "[\"GOV\",\"ORG\"]"}

文字列値 カスタム値または他の文字列列との文字列比較

"CheckExpression": ":col STARTS_WITH :val", "SubstitutionMap": {":col": "`url`", ":val": "http"}

または

"CheckExpression": ":col1 contains :col2", "SubstitutionMap": {":col1": "`url`", ":col2": "`company_name`"}

数値 カスタム値または他の数値列との数値比較

"CheckExpression": ":col IS_BETWEEN :val1 and :val2", "SubstitutionMap": {":col": "`APY`", ":val1": "0", ":val2": "10"}

または

"CheckExpression": ":col1 <= :col2", "SubstitutionMap": {":col1": "`bank_rate`", ":col2": "`fed_rate`"}

値文字列の長さ カスタム値または他の数値列との数値比較

"CheckExpression": "length(:col) IS_BETWEEN :val1 and :val2", "SubstitutionMap": {":col": "`identifier`", ":val1": "8", ":val2": "12"}

または

"CheckExpression": "length(:col1) <= :col2", "SubstitutionMap": {":col1": "`name`", ":col2": "`max_name_len`"}

数値比較

DataBrew は、数値比較のために次のオペレーションをサポートしています。Is equals (==)Is not equals (!=)Less than (<)Less than equals (<=)Greater than (>)Greater than equals (>=)、Is between (is_between :val1 and :val2)

文字列比較

次の文字列比較がサポートされています。「 で始まる」、「 で始まらない」、「 で終わる」、「 で終わる」、「 を含む」、「 を含まない」、「 等しい」、「 等しくない」、「 一致」、「 一致しない」。

次の表は、値分布統計と数値統計に使用できる統計を示しています。

データの品質チェック 統計名 追加パラメータ SDK 構文
値分散統計 最小 "CheckExpression": "AGG(MAX) < :val", "SubstitutionMap": {":val", "100"}
最大 "CheckExpression": "AGG(MIN) > :val", "SubstitutionMap": {":val", "0"}
中央値 "CheckExpression": "AGG(MEDIAN) >= :val", "SubstitutionMap": {":val", "50"}
平均値 "CheckExpression": "AGG(MEAN) <= :val", "SubstitutionMap": {":val", "10"}
モード "CheckExpression": "AGG(MODE) > :val", "SubstitutionMap": {":val", "0"}
標準偏差 "CheckExpression": "AGG(STANDARD_DEVIATION) > :val", "SubstitutionMap": {":val", "0"}
エントロピー "CheckExpression": "AGG(ENTROPY) > :val", "SubstitutionMap": {":val", "0"}
数値統計 合計 "CheckExpression": "AGG(SUM) > :val", "SubstitutionMap": {":val", "0"}
尖度 "CheckExpression": "AGG(KURTOSIS) > :val", "SubstitutionMap": {":val", "0"}
歪み "CheckExpression": "AGG(SKEWNESS) > :val", "SubstitutionMap": {":val", "0"}
Variance "CheckExpression": "AGG(VARIANCE) > :val", "SubstitutionMap": {":val", "0"}
絶対偏差 "CheckExpression": "AGG(MEDIAN_ABSOLUTE_DEVIATION) > :val", "SubstitutionMap": {":val", "0"}
分位数 分位数: '0.25'、'0.5'、'0.75' のいずれか "CheckExpression": "AGG(QUANTILE, :pct) > :val", "SubstitutionMap": {":pct": "0.25", ":val", "0"}