기계 번역으로 제공되는 번역입니다. 제공된 번역과 원본 영어의 내용이 상충하는 경우에는 영어 버전이 우선합니다.
최소 집계 임계값
데이터 집계는 쿼리가 개인 또는 소규모 그룹에 대한 결과를 반환하지 못하도록 하여 익명화를 적용하는 데 도움이 되는 개인 정보 보호 개선 기법입니다. 테이블에 최소 집계 임계값이 구성된 경우는 데이터 공급자의 지정된 최소 임계값을 충족하지 않는 결과를 AWS Clean Rooms 억제합니다.
집계 임계값
구성된 테이블에 대한 사용자 지정 분석 규칙에서 최소 집계 임계값을 구성할 수 있습니다. 데이터 공급자는 identityColumns 및 minimumIdentityCount, N을 지정합니다.에 지원되는 값은 2~100,000minimumIdentityCount입니다. identityColumns 값은 string, varchar또는 char 유형이어야 합니다. 최소 집계 임계값은 SQL 쿼리 결과의 각 행에 최소 N개의 개별 데이터 주체가 기여하도록 합니다. 가 쿼리 필터와 identityColumns 상호 작용하는 방법에 대한 자세한 내용은 섹션을 참조하세요비교 제어.
다음 예제에서는를 identityColumns 값으로 사용하여 최소 집계 임계값을 100user_id으로 설정합니다.
{ "aggregationThresholds": [ { "identityColumns": [ "user_id" ], "minimumIdentityCount": 100, "type": "COUNT_DISTINCT" } ] }
특정 출력 열의 최소 집계 임계값 재정의
출력 열의 민감도 수준은 다르며 데이터 공급자는 출력 열에 따라 다른 minimumIdentityCount 값을 적용할 수 있습니다. 예를 들어,는 최소 5개의 개별 데이터 주체 임계값이 있는 저감도 열일 campaign_id 수 있지만, postal_code 및는 고감도 열이므로 최소 100의 임계값을 income_bracket 얻을 수 있습니다.
열별 재정의는 최소 집계 또는 2~100,000 사이의 값에서 해당 출력 열을 제외0하는를 허용합니다.
다음 예제에서는 campaign_id 열에 대한 최소 집계 임계값 재정의를 설정합니다.
{ "outputColumnThresholds": [ { "outputColumnName": "campaign_id", "minimumIdentityCount": 5 } ] }
집계 함수에서 중첩 표현식 허용
집계 함수 내에서 표현식을 허용하면 클린룸 쿼리에서 데이터 주체를 다시 식별할 수 있는 위험이 증가합니다. 의 기본 설정은 프라이버시 강화 구성으로 COLUMNS_ONLY권장되는 allowedAggregateExpressionType입니다. 이 설정을 사용하면 집계 함수 내에서 다음과 같은 열만 허용됩니다.
-
SUM(비용)
-
COUNT(DISTINCT campaign_id)
또는 쿼리 실행기가 신뢰할 수 있는 파트너인 공동 작업의 경우 집계 함수 ANY_EXPRESSION 내에서를 허용할 수 있습니다. 이 설정은 데이터에서 실행할 수 있는 SQL 쿼리의 유연성을 높이지만 쿼리 실행기는 집계 함수 내에서 소규모 그룹을 격리할 수 있으므로 개인 정보 보호 위험을 초래합니다.
개인 정보 보호 및 규정 준수 검토 필요
집계 함수 ANY_EXPRESSION 내부를 허용하기 전에 개인 정보 보호, 보안, 법률 및 규정 준수 팀에 문의하여 조직의 요구 사항을 준수하는지 확인하세요.
다음은 일반적으로 안전한 것으로 간주되는 집계 함수의 표현식 예제입니다.
-
SUM(비용 * 수량)
다음은 개인 정보 보호 위험으로 간주되는 집계 함수의 표현식 예제입니다.
-
SUM(CASE WHEN zip_code = '10001' THEN 급여 ELSE 0END)
다음은 전체 aggregationThresholds 예제입니다.
{ "aggregationThresholds": [ { "identityColumns": [ "user_id" ], "minimumIdentityCount": 100, "type": "COUNT_DISTINCT", "allowedAggregateExpressionType": "COLUMNS_ONLY", "outputColumnThresholds": [ { "outputColumnName": "campaign_id", "minimumIdentityCount": 5 } ] } ] }
콘솔에서 최소 집계 임계값 구성
구성된 테이블이 존재하면 구성된 테이블에 사용자 지정 분석 규칙을 추가하는 과정에서 최소 집계 임계값을 구성합니다. 전체 사용자 지정 분석 규칙 안내 흐름은 섹션을 참조하세요테이블에 사용자 지정 분석 규칙 추가(안내식 흐름).
최소 집계 임계값을 구성하려면
-
에 로그인 AWS Management Console 하고 https://console.aws.amazon.com/cleanrooms
AWS Clean Rooms 콘솔을 엽니다. -
왼쪽 탐색 창에서 테이블을 선택한 다음 구성된 테이블을 선택합니다.
-
구성된 테이블 세부 정보 페이지에서 분석 규칙 구성을 선택합니다.
-
분석 규칙 유형에서 사용자 지정을 선택합니다.
-
각 새 분석 검토 또는 특정 공동 작업자의 분석 허용을 선택합니다. 나머지 단계는 특정 공동 작업자별 분석 허용 경로를 따릅니다.
-
AWS 계정 추가를 선택하여이 구성된 테이블에 대한 분석을 제출할 수 있는 파트너를 구성한 다음 허용할 AWS 계정 를 선택합니다.
-
분석 결과 컨트롤 지정 - 선택 사항에서 집계 임계값 적용?에서 예를 선택합니다.
-
최소 집계 임계값을 구성합니다.
-
자격 증명 열을 선택합니다. 자격 증명 열은
string,varchar또는char유형이어야 합니다. -
최소 자격 증명 수를 지정합니다. 지원되는 값은 2~100,000입니다.
-
집계 유형은 개수별로 미리 구성됩니다.
-
-
집계 함수에서 중첩 표현식을 허용하시겠습니까?의 경우 기본값은 아니요입니다. 이 옵션을 끈 상태로 두면 개인 정보 보호가 강화된 구성이 됩니다. 자세한 내용은 집계 함수에서 중첩 표현식 허용 단원을 참조하십시오.
-
(선택 사항) 출력 열 재정의를 구성합니다.
-
열 재정의 추가를 선택합니다.
-
드롭다운 목록에서 출력 열을 선택합니다.
-
최소 자격 증명 수를 지정합니다. 지원되는 값은 열을 최소 집계에서
0제외하거나 2~100,000입니다.
자세한 내용은 특정 출력 열의 최소 집계 임계값 재정의 단원을 참조하십시오.
-
-
(권장) 비교 가능한 열을 구성합니다.
-
기본적으로 모든 열을 비교할 수 있습니다. 리터럴 및 열 column-to-column 비교에 허용되는 열을 명시적으로 구성하는 것은 개인 정보 보호 강화 구성입니다.
-
사용자 지정 목록을 선택합니다.
-
리터럴 비교에 허용되는 열을 선택합니다. 예를 들어
state열을 허용하면 쿼리 실행기가와 같은 리터럴 필터를 사용하여 쿼리를 실행할 수 있습니다WHERE state = 'New York'. -
열 column-to-column 비교에 사용할 수 있는 열을 선택합니다. 예를 들어
state열을 허용하면 쿼리 실행기가와 같은 열 비교로 테이블 간 조인을 실행할 수 있습니다JOIN my_table t ON t.state = partner_table.state.
자세한 내용은 비교 제어 단원을 참조하십시오.
-
-
다음을 선택합니다.
-
다음을 선택합니다. 차등 프라이버시는 꺼져 있으며 최소 집계 임계값 또는 비교 제어에서는 지원되지 않습니다. 자세한 내용은 제한 사항 단원을 참조하십시오.
-
사용자 지정 분석 규칙 구성을 검토합니다.
-
분석 규칙 구성을 선택합니다.
-
구성된 테이블을 공동 작업에 연결합니다. 자세한 내용은 2단계: 구성된 테이블 연결 단원을 참조하십시오.
고려 사항 및 제한 사항
최소 집계 임계값을 사용하는 경우 고려 사항 및 제한 사항이 적용됩니다. 전체 목록은 고려 사항 및 제한 사항 단원을 참조하십시오.