As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.
Limites mínimos de agregação
A agregação de dados é uma técnica de aprimoramento da privacidade que ajuda a impor a anonimização ao impedir que consultas retornem resultados sobre indivíduos ou pequenos grupos. Quando os limites mínimos de agregação são configurados em suas tabelas, AWS Clean Rooms suprime os resultados que não atendem ao limite mínimo especificado pelo provedor de dados.
Tópicos
Limites de agregação
Você pode configurar limites mínimos de agregação em uma regra de análise personalizada para sua tabela configurada. Os provedores de dados especificam o identityColumns e ominimumIdentityCount, N. Os valores suportados para minimumIdentityCount estão entre 2 e 100.000. O identityColumns valor deve ser um stringvarchar, ou char tipo. Os limites mínimos de agregação garantem que cada linha no resultado de uma consulta SQL tenha pelo menos N sujeitos de dados distintos contribuindo para ela. Para obter informações sobre como identityColumns interage com os filtros de consulta, consulteControles de comparação.
O exemplo a seguir define o limite mínimo de agregação user_id como 100 com o identityColumns valor:
{ "aggregationThresholds": [ { "identityColumns": [ "user_id" ], "minimumIdentityCount": 100, "type": "COUNT_DISTINCT" } ] }
Substituindo o limite mínimo de agregação para colunas de saída específicas
As colunas de saída têm diferentes níveis de sensibilidade, e os provedores de dados podem impor minimumIdentityCount valores diferentes dependendo da coluna de saída. Por exemplo, campaign_id pode ser uma coluna de baixa sensibilidade com um limite mínimo de 5 sujeitos de dados distintos, postal_code e income_bracket obter um limite mínimo de 100 porque são colunas de alta sensibilidade.
Aceita uma substituição por coluna0, que isenta essa coluna de saída da agregação mínima, ou de um valor entre 2 e 100.000.
O exemplo a seguir define uma substituição mínima do limite de agregação para a coluna: campaign_id
{ "outputColumnThresholds": [ { "outputColumnName": "campaign_id", "minimumIdentityCount": 5 } ] }
Permitindo expressões aninhadas em funções agregadas
Permitir expressões dentro de funções de agregação aumenta o risco de que os titulares dos dados possam ser reidentificados em consultas de sala limpa. A configuração padrão para allowedAggregateExpressionType éCOLUMNS_ONLY, que é recomendada como configuração de privacidade aprimorada. Com essa configuração, somente colunas são aceitas dentro de uma função de agregação, como:
-
SUM(custo)
-
COUNT(id DISTINCT da campanha)
Como alternativa, para colaborações em que o executor da consulta é um parceiro confiável, você pode permitir uma função de ANY_EXPRESSION agregação. Essa configuração aumenta a flexibilidade das consultas SQL que podem ser executadas em seus dados, mas apresenta risco de privacidade, pois os executores de consultas podem isolar pequenos grupos em uma função de agregação.
É necessária uma análise de privacidade e conformidade
Antes de permitir funções agregadas ANY_EXPRESSION internas, consulte suas equipes de privacidade, segurança, jurídicas e de conformidade para garantir que isso atenda aos requisitos da sua organização.
Veja a seguir um exemplo de uma expressão em uma função de agregação que geralmente é considerada segura:
-
SUM(custo* quantidade)
Veja a seguir um exemplo de uma expressão em uma função de agregação que é considerada um risco de privacidade:
-
SUM(CASEWHENzip_code = '10001' salário 0) THEN ELSE END
Veja a seguir um aggregationThresholds exemplo completo:
{ "aggregationThresholds": [ { "identityColumns": [ "user_id" ], "minimumIdentityCount": 100, "type": "COUNT_DISTINCT", "allowedAggregateExpressionType": "COLUMNS_ONLY", "outputColumnThresholds": [ { "outputColumnName": "campaign_id", "minimumIdentityCount": 5 } ] } ] }
Configurando limites mínimos de agregação no console
Você configura limites mínimos de agregação como parte da adição de uma regra de análise personalizada a uma tabela configurada, após a existência da tabela configurada. Para ver o fluxo guiado completo da regra de análise personalizada, consulteAdicionar uma regra de análise personalizada a uma tabela (fluxo guiado).
Para configurar limites mínimos de agregação
-
Faça login no Console de gerenciamento da AWS e abra o AWS Clean Rooms console em https://console.aws.amazon.com/cleanrooms
. -
No painel de navegação esquerdo, escolha Tabelas e, em seguida, escolha sua tabela configurada.
-
Na página de detalhes da tabela configurada, escolha Configurar regra de análise.
-
Em Tipo de regra de análise, escolha Personalizada.
-
Escolha Revisar cada nova análise ou Permitir qualquer análise feita por colaboradores específicos. As etapas restantes seguem o caminho Permitir qualquer análise por colaboradores específicos.
-
Escolha Adicionar conta da AWS para configurar quais parceiros podem enviar análises nessa tabela configurada e, em seguida, escolha Conta da AWS a permitir.
-
Em Especificar controles de resultados de análise - opcional, para Impor limites de agregação? , escolha Sim.
-
Configure o limite mínimo de agregação.
-
Escolha sua coluna de identidade. A coluna de identidade deve ser do
chartipostringvarchar, ou. -
Especifique sua contagem mínima de identidade. Os valores suportados estão entre 2 e 100.000.
-
O tipo agregado é pré-configurado para Contagem distinta.
-
-
Para Permitir expressões aninhadas em funções agregadas? , o padrão é Não. Deixar essa opção desativada fica a configuração de privacidade aprimorada. Para obter mais informações, consulte Permitindo expressões aninhadas em funções agregadas.
-
(Opcional) Configure as substituições da coluna de saída.
-
Escolha Adicionar substituição de coluna.
-
Escolha sua coluna de saída na lista suspensa.
-
Especifique sua contagem mínima de identidade. Os valores aceitos são
0para isentar a coluna da agregação mínima, ou entre 2 e 100.000.
Para obter mais informações, consulte Substituindo o limite mínimo de agregação para colunas de saída específicas.
-
-
(Recomendado) Configure as colunas permitidas para comparação.
-
Por padrão, todas as colunas são elegíveis para comparação. A configuração de privacidade aprimorada é configurar explicitamente quais colunas são permitidas para comparação literal e coluna a coluna.
-
Escolha Lista personalizada.
-
Escolha quais colunas são permitidas para comparação literal. Por exemplo, permitir a
statecoluna permite que o executor da consulta execute uma consulta com um filtro literal, como.WHERE state = 'New York' -
Escolha quais colunas podem ser usadas para comparação de coluna a coluna. Por exemplo, permitir a
statecoluna permite que o executor da consulta execute uma união entre tabelas com uma comparação de colunas, como.JOIN my_table t ON t.state = partner_table.state
Para obter mais informações, consulte Controles de comparação.
-
-
Escolha Próximo.
-
Escolha Próximo. A privacidade diferencial está desativada e não é suportada com limites mínimos de agregação ou controles de comparação. Para obter mais informações, consulte Limitações.
-
Revise sua configuração de regra de análise personalizada.
-
Selecione Configurar regra de análise.
-
Associe a tabela configurada a uma colaboração. Para obter mais informações, consulte Etapa 2: Associar uma tabela configurada.
Considerações e limitações
Considerações e limitações se aplicam quando você usa limites mínimos de agregação. Para ver a lista completa, consulte Considerações e limitações.