View a markdown version of this page

GPU-acceleration para indexação vetorial - OpenSearch Serviço Amazon

As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.

GPU-acceleration para indexação vetorial

GPU-acceleration ajuda você a criar bancos de dados vetoriais em grande escala com mais rapidez e eficiência. Você pode ativar esse recurso em OpenSearch domínios novos ou existentes e coleções sem OpenSearch servidor. Esse recurso é usado GPU-acceleration para reduzir o tempo necessário para indexar dados em índices vetoriais.

Com GPU-acceleration, você pode aumentar a velocidade de indexação vetorial em até 10 vezes por um quarto do custo de indexação.

Pré-requisitos

GPU-acceleration é suportado em OpenSearch domínios que executam uma OpenSearch versão 3.1 ou posterior e em coleções sem OpenSearch servidor. Para obter mais informações, consulte Atualizando domínios do Amazon OpenSearch Service UpdateDomainConfig, e UpdateCollection APIs.

Como funciona

Os índices vetoriais exigem recursos computacionais significativos para criar estruturas de dados, como gráficos Hierarchical Navigable Small Worlds (HNSW). Quando você ativa GPU-acceleration em seu domínio ou coleção, detecta OpenSearch automaticamente oportunidades para acelerar suas compilações de índice e transfere as compilações de índice para instâncias de GPU. OpenSearch O serviço gerencia as instâncias de GPU em seu nome, atribuindo-as ao seu domínio ou coleção quando necessário. Isso significa que você não gerencia a utilização nem paga pelo tempo ocioso.

Você paga somente pelo processamento útil por meio de unidades de computação (OCU) - aceleração vetorial. Cada OCU de aceleração vetorial é uma combinação de aproximadamente 8 GiB de memória de CPU, 2 vCPUs e 6 GiB de memória de GPU. Para obter mais informações, consulte Preços de aceleração de GPU.

Para ativar a aceleração de GPU para seu domínio ou coleção, consulteHabilitando GPU-acceleration.

Preços de aceleração de GPU

AWS cobra quando OpenSearch detecta oportunidades de acelerar as cargas de trabalho de criação de índices do seu domínio ou coleção. Cada OCU de aceleração vetorial é uma combinação de aproximadamente 8 GiB de memória de CPU, 2 vCPUs e 6 GiB de memória de GPU.

AWS fatura OCU com granularidade de segundo nível. No extrato da sua conta, você verá uma entrada para computação. OCU-hours

Por exemplo, quando você usa GPU-acceleration por uma hora para criar um índice, usando 2 vCPUs e 1 GiB de memória de GPU, é cobrada 1 OCU. Se você usar 9 GiB de memória de CPU durante o uso GPU-acceleration, serão cobradas 2 OCU.

OpenSearch O Serverless adiciona OCUs adicionais em incrementos de 1 OCU com base na capacidade de computação e no armazenamento necessários para dar suporte às suas coleções. É possível configurar um número máximo de OCUs para sua conta para controlar os custos.

nota

O número de OCUs provisionadas a cada momento pode variar e não é exato. Com o tempo, o algoritmo que OpenSearch o OpenSearch Serverless usa continuará melhorando para minimizar melhor o uso do sistema.

Para obter detalhes completos de preços, consulte os preços OpenSearch do Amazon Service.

GPU-acceleration e operações de gravação

GPU-acceleration é ativado quando OpenSearch a taxa de ingestão do vetor (MB/sec) está dentro de um intervalo. Em OpenSearch domínios, você tem a flexibilidade de configurar esse intervalo por meio de index.knn.remote_index_build.size.min e. index.knn.remote_index_build.size.max Por exemplo, com o intervalo inferior padrão de 50 MB, a gravação de 15.000 vetores de precisão total com 768 dimensões entre os intervalos de atualização será acionada por padrão. GPU-acceleration

Os dados são gravados com as seguintes operações de API:

GPU-acceleration é ativado com mesclagens de segmentos automáticas e manuais.

Configurações de índice suportadas

O motor Faiss suporta GPU-acceleration.

As configurações a seguir não oferecem suporte GPU-acceleration a:

Compatível Regiões da AWS

GPU-acceleration está disponível no seguinte Regiões da AWS:

  • Leste dos EUA (Norte da Virgínia)

  • Leste dos EUA (Ohio)

  • Oeste dos EUA (Oregon)

  • Ásia-Pacífico (Sydney)

  • Ásia-Pacífico (Tóquio)

  • Ásia-Pacífico (Mumbai)

  • Europa (Irlanda)

  • Europa (Frankfurt)

  • Europa (Estocolmo)

  • Europa (Espanha)

Práticas recomendadas

Siga essas práticas recomendadas para maximizar os benefícios de suas cargas GPU-acceleration de trabalho de pesquisa vetorial:

  • Aumente os clientes do índice - Para aproveitar ao máximo as GPUs durante a criação do índice, aumente o número de clientes do índice que estão ingerindo dados. OpenSearch Isso permite uma melhor paralelização e utilização dos recursos da GPU.

  • Ajuste o limite aproximado - altere a index.knn.advanced.approximate_threshold configuração para garantir que não ocorram construções menores de índices de segmentos, o que melhora a velocidade geral de ingestão. Um valor de 10.000 é um bom ponto de partida. Para coleções, você deve especificar explicitamente um valor para essa configuração.

  • Otimize o tamanho do fragmento: tente criar fragmentos que tenham pelo menos 1 milhão de documentos. Fragmentos com menos do que esse número de documentos podem não obter benefícios gerais. GPU-acceleration