View a markdown version of this page

Prognostizieren Sie Proteinstrukturen mit ESMFold auf Deadline Cloud - Deadline Cloud

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Prognostizieren Sie Proteinstrukturen mit ESMFold auf Deadline Cloud

Das Jobpaket esmfold_predict auf der GitHub Website führt die Vorhersage der Proteinstruktur mit ESMFold (Metas, MIT-Lizenz) durch. facebook/esmfold_v1 Das Paket verwendet eine FASTA-Datei als Eingabe und erzeugt eine .pdb Datei pro Sequenz als Ausgabe, zusammen mit Konfidenzmetriken und einem optionalen Validierungsbericht anhand experimenteller Referenzstrukturen.

Der Job besteht aus vier Schritten:

  1. Analysieren Sie die FASTA-Eingabe, validieren Sie Sequenzen (bis zu 1024 Aminosäuren, Standardreste plus X) und teilen Sie die Datensätze auf die einzelnen Worker-Aufgaben auf.

  2. Führen Sie die ESMfold-Inferenz für jeden Sequenzstapel auf der GPU aus.

  3. Rendern Sie ein Backbone-Trace-Bild jeder vorhergesagten Struktur, eingefärbt nach der pldDT-Konfidenz pro Rest.

  4. Optional: Wenn Sie ein Verzeichnis mit experimentellen Referenz-PDBs angeben, berechnen Sie RMSD und ein TM-score Kalibrierungsdiagramm pro Rückstand. pLDDT/error

Das Paket erfordert eine Farm mit einer vom NVIDIA GPU-Service verwalteten Flotte (A10G, L4 oder A100; mindestens 16 GB VRAM und 16 GB System-RAM) und eine Warteschlange mit einer Conda-Warteschlangenumgebung, die die Job-Parameter und verwendet. CondaPackages CondaChannels Die schnellste Einrichtung ist die cuda_farm () -Vorlage auf der Website. AWS CloudFormation CloudFormation GitHub Amazon Elastic Compute Cloud (Amazon EC2) GPU-Instances werden durch vCPU-Kontingente pro Region begrenzt. Wenn Ihre Flotte nicht skaliert wird, fordern Sie in der Service Quota-Konsole eine Erhöhung für die Ausführung von On-Demand G- und VT-Instances an.

Reichen Sie die Demo ein, die drei kurze Benchmark-Proteine zusammenfasst (Trp-cage Varianten 1L2Y und 2JOF sowie Villin-Kopfstück 1VII):

deadline bundle submit ./job_bundles/esmfold_predict/ \ -p InputFasta=./job_bundles/esmfold_predict/sample_inputs/demo.fasta

Beim ersten Fold auf einem neuen Worker werden die 5,2 GB großen facebook/esmfold_v1 Gewichte heruntergeladen (etwa drei Minuten bei einem<OutputDir>/.hf_cache/). g5.2xlarge Bei nachfolgenden Fold-Tasks im selben Job wird der Cache wiederverwendet.

Um Vorhersagen anhand experimenteller Referenzen zu validieren, platzieren Sie <seq_id>.pdb Dateien in einem Verzeichnis und übergeben Sie es alsReferencePdbDir. Der Validate Schritt schreibt validation.csv und eine pro Sequenzcalibration.png.