View a markdown version of this page

HealthOmics ETags und Datenherkunft - AWS HealthOmics

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

HealthOmics ETags und Datenherkunft

Ein HealthOmics ETag (Entitäts-Tag) ist ein Hash des aufgenommenen Inhalts in einem Sequenzspeicher. Dies vereinfacht das Abrufen und Verarbeiten von Daten und gewährleistet gleichzeitig die Inhaltsintegrität der aufgenommenen Datendateien. Das ETag spiegelt Änderungen am semantischen Inhalt des Objekts wider, nicht an seinen Metadaten. Der angegebene Lesesatztyp und der angegebene Algorithmus bestimmen, wie das ETag berechnet wird. Die ETag-Berechnung ändert nicht die eigentliche Datei oder die Genomdaten. Wenn das Dateitypschema des Lesesatzes dies zulässt, aktualisiert der Sequenzspeicher Felder, die mit der Datenherkunft verknüpft sind.

Dateien haben eine bitweise Identität und eine semantische Identität. Die bitweise Identität bedeutet, dass die Bits einer Datei identisch sind, und eine semantische Identität bedeutet, dass der Inhalt einer Datei identisch ist. Die semantische Identität ist widerstandsfähig gegenüber Änderungen an Metadaten und Komprimierung, da sie die Inhaltsintegrität der Datei erfasst.

Lesesätze in HealthOmics Sequenzspeichern werden compression/decompression Zyklen unterzogen, und die Herkunft der Daten wird während des gesamten Lebenszyklus eines Objekts nachverfolgt. Während dieser Verarbeitung kann sich die bitweise Identität einer aufgenommenen Datei ändern und es wird erwartet, dass sie sich jedes Mal ändert, wenn eine Datei aktiviert wird. Die semantische Identität der Datei bleibt jedoch erhalten. Die semantische Identität wird als HealthOmics Entitäts-Tag oder ETag erfasst, das während der Aufnahme durch den Sequenzspeicher berechnet wird und als Lesesatz-Metadaten verfügbar ist.

Wenn das Dateitypschema des Lesesatzes dies zulässt, werden die Felder für Sequenzspeicher-Aktualisierungen mit der Datenherkunft verknüpft. Bei uBAM-, BAM- und CRAM-Dateien wird dem Header ein neues @CO OR-Tag hinzugefügt. Comment Der Kommentar enthält die Sequenzspeicher-ID und den Zeitstempel der Aufnahme.

Amazon S3-eTags

Beim Zugriff auf eine Datei mithilfe der Amazon S3-URI können Amazon S3-API-Operationen auch Amazon S3-ETag- und Prüfsummenwerte zurückgeben. Die Amazon S3-ETag- und Prüfsummenwerte unterscheiden sich von den HealthOmics ETags, da sie die bitweise Identität der Datei darstellen. Weitere Informationen zu beschreibenden Metadaten und Objekten finden Sie in der Amazon S3 Object API-Dokumentation. Die Amazon S3-ETag-Werte können sich mit jedem Aktivierungszyklus eines Lesesatzes ändern, und Sie können sie verwenden, um das Lesen einer Datei zu überprüfen. Zwischenspeichern Sie Amazon S3-ETag-Werte jedoch nicht, um sie während des Lebenszyklus der Datei für die Überprüfung der Dateiidentität zu verwenden, da sie nicht konsistent bleiben. Im Gegensatz dazu bleibt das HealthOmics ETag während des gesamten Lebenszyklus des Lesesatzes konsistent.

Wie HealthOmics berechnet man ETags

Das ETag wird aus einem Hash des aufgenommenen Dateiinhalts generiert. Die ETag-Algorithmusfamilie ist standardmäßig auf MD5up gesetzt, kann aber bei der Erstellung des Sequenzspeichers anders konfiguriert werden. Wenn das ETag berechnet wird, werden der Algorithmus und die berechneten Hashes zum Lesesatz hinzugefügt. Die unterstützten MD5-Algorithmen für Dateitypen lauten wie folgt.

  • FASTQ_MD5UP — Berechnet den MD5-Hash einer unkomprimierten, vollständigen FASTQ-Readset-Quelle.

  • bam_MD5up — Berechnet den MD5-Hash des Alignment-Abschnitts einer unkomprimierten BAM- oder uBAM-Lesatzquelle, wie sie im SAM dargestellt wird, auf der Grundlage der verknüpften Referenz, sofern eine verfügbar ist.

  • cram_MD5up — Berechnet den MD5-Hash des Alignment-Abschnitts der unkomprimierten CRAM-Readset-Quelle, wie er im SAM dargestellt ist, auf der Grundlage der verknüpften Referenz.

Anmerkung

MD5-Hashing ist bekanntermaßen anfällig für Kollisionen. Aus diesem Grund könnten zwei verschiedene Dateien dasselbe ETag haben, wenn sie so hergestellt wurden, dass sie die bekannte Kollision ausnutzen.

Die folgenden Algorithmen werden für die SHA256-Familie unterstützt. Die Algorithmen werden wie folgt berechnet:

  • fastq_sha256up — Berechnet den SHA-256 Hash einer unkomprimierten, vollständigen FASTQ-Readset-Quelle.

  • bam_sha256up — Berechnet den SHA-256 Hash des Alignment-Abschnitts einer unkomprimierten BAM- oder uBAM-Lesatzquelle, wie sie im SAM dargestellt wird, basierend auf der verknüpften Referenz, falls eine verfügbar ist.

  • cram_sha256up — Berechnet den SHA-256 Hash des Alignment-Abschnitts einer unkomprimierten CRAM-Readset-Quelle, wie sie im SAM dargestellt wird, auf der Grundlage der verknüpften Referenz.

Die folgenden Algorithmen werden für die SHA512-Familie unterstützt. Die Algorithmen werden wie folgt berechnet:

  • fastq_sha512up — Berechnet den SHA-512 Hash einer unkomprimierten, vollständigen FASTQ-Readset-Quelle.

  • bam_sha512UP — Berechnet den SHA-512 Hash des Alignment-Abschnitts einer unkomprimierten BAM- oder uBAM-Lesatzquelle, wie sie im SAM dargestellt wird, basierend auf der verknüpften Referenz, falls eine verfügbar ist.

  • cram_SHA512UP — Berechnet den SHA-512 Hash des Alignment-Abschnitts einer unkomprimierten CRAM-Readset-Quelle, wie sie im SAM dargestellt wird, auf der Grundlage der verknüpften Referenz.