View a markdown version of this page

HealthOmics Las etiquetas electrónicas y la procedencia de los datos - AWS HealthOmics

Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.

HealthOmics Las etiquetas electrónicas y la procedencia de los datos

Una HealthOmics ETag (etiqueta de entidad) es un hash del contenido ingerido en un almacén de secuencias. Esto simplifica la recuperación y el procesamiento de datos, a la vez que mantiene la integridad del contenido de los archivos de datos ingeridos. La ETag refleja los cambios en el contenido semántico del objeto, no en sus metadatos. El tipo de conjunto de lectura y el algoritmo especificados determinan cómo se calcula la ETag. El cálculo de la ETag no altera el archivo real ni los datos genómicos. Cuando el esquema de tipos de archivo del conjunto de lectura lo permite, el almacén de secuencias actualiza los campos que están vinculados a la procedencia de los datos.

Los archivos tienen una identidad bit a bit y una identidad semántica. La identidad bit a bit significa que los bits de un archivo son idénticos, y una identidad semántica significa que el contenido de un archivo es idéntico. La identidad semántica es resistente a los cambios en los metadatos y a los cambios de compresión, ya que captura la integridad del contenido del archivo.

Los conjuntos de lectura de los almacenes de HealthOmics secuencias se someten a compression/decompression ciclos y a un seguimiento de la procedencia de los datos a lo largo del ciclo de vida de un objeto. Durante este procesamiento, la identidad bit a bit de un archivo ingerido puede cambiar y se espera que cambie cada vez que se active un archivo; sin embargo, se mantiene la identidad semántica del archivo. La identidad semántica se captura como una etiqueta de HealthOmics entidad, o ETag, que se calcula durante la incorporación al almacén de secuencias y está disponible como metadatos del conjunto de lectura.

Cuando el esquema de tipos de archivo del conjunto de lectura lo permite, los campos de actualizaciones del almacén de secuencias se vinculan a la procedencia de los datos. En el caso de los archivos uBAM, BAM y CRAM, se agrega una nueva etiqueta @CO o Comment al encabezado. El comentario contiene el identificador del almacén de secuencias y la marca de tiempo de ingesta.

Etiquetas electrónicas de Amazon S3

Al acceder a un archivo mediante la URI de Amazon S3, las operaciones de la API de Amazon S3 también pueden devolver valores de ETag y suma de comprobación de Amazon S3. Los valores de ETag y checksum de Amazon S3 difieren de los de las HealthOmics ETags porque representan la identidad bit a bit del archivo. Para obtener más información sobre los metadatos y objetos descriptivos, consulte la documentación de la API de objetos de Amazon S3. Los valores de las ETag de Amazon S3 pueden cambiar con cada ciclo de activación de un conjunto de lectura y puede usarlos para validar la lectura de un archivo. Sin embargo, no almacene en caché los valores de ETag de Amazon S3 para usarlos en la validación de la identidad del archivo durante el ciclo de vida del archivo, ya que no son coherentes. Por el contrario, la HealthOmics ETag permanece uniforme durante todo el ciclo de vida del conjunto de lectura.

¿Cómo HealthOmics calcula las ETags

La ETag se genera a partir de un hash del contenido del archivo ingerido. La familia de algoritmos ETag está configurada en MD5up de forma predeterminada, pero se puede configurar de forma diferente durante la creación del almacén de secuencias. Cuando se calcula la ETag, el algoritmo y los hashes calculados se añaden al conjunto de lectura. Los algoritmos MD5 compatibles con los tipos de archivos son los siguientes.

  • FASTQ_MD5up: calcula el hash MD5 de una fuente de conjunto de lectura FASTQ completa y sin comprimir.

  • BAM_MD5up: calcula el hash MD5 de la sección de alineación de una fuente de conjunto de lectura de BAM o uBAM sin comprimir tal como se representa en el SAM, basándose en la referencia vinculada, si hay alguna disponible.

  • CRAM_MD5up: calcula el hash MD5 de la sección de alineación de la fuente del conjunto de lectura de CRAM sin comprimir tal como se representa en el SAM, basándose en la referencia vinculada.

nota

Se sabe que el hash del MD5 es vulnerable a las colisiones. Por este motivo, dos archivos diferentes pueden tener la misma ETag si se crearon para aprovechar la colisión conocida.

La familia SHA256 admite los siguientes algoritmos. Los algoritmos se calculan de la siguiente manera:

  • FASTQ_SHA256up: calcula el SHA-256 hash de una fuente de conjunto de lectura FASTQ completa y sin comprimir.

  • BAM_SHA256up: calcula el SHA-256 hash de la sección de alineación de una fuente de conjunto de lectura de BAM o uBAM sin comprimir tal como se representa en el SAM, basándose en la referencia vinculada, si hay alguna disponible.

  • CRAM_SHA256up: calcula el SHA-256 hash de la sección de alineación de una fuente de conjunto de lectura de CRAM sin comprimir tal como se representa en el SAM, basándose en la referencia vinculada.

La familia SHA512 admite los siguientes algoritmos. Los algoritmos se calculan de la siguiente manera:

  • FASTQ_SHA512up: calcula el SHA-512 hash de una fuente de conjunto de lectura FASTQ completa y sin comprimir.

  • BAM_SHA512up: calcula el SHA-512 hash de la sección de alineación de una fuente de conjunto de lectura de BAM o uBAM sin comprimir tal como se representa en el SAM, basándose en la referencia vinculada, si hay alguna disponible.

  • CRAM_SHA512up: calcula el SHA-512 hash de la sección de alineación de una fuente de conjunto de lectura de CRAM sin comprimir tal como se representa en el SAM, basándose en la referencia vinculada.