View a markdown version of this page

在 Deadline Cloud 上使用 ESMFold 预测蛋白质结构 - 截止日期云

本文属于机器翻译版本。若本译文内容与英语原文存在差异,则一律以英文原文为准。

在 Deadline Cloud 上使用 ESMFold 预测蛋白质结构

GitHub 网站上的 esmfold_predict 任务包使用ESMFold(Meta,麻省理工学院许可证)进行蛋白质结构预测。facebook/esmfold_v1该包采用 FASTA 文件作为输入,每个序列生成一个.pdb文件作为输出,以及可信度指标和针对实验参考结构的可选验证报告。

该任务运行四个步骤:

  1. 解析输入 FASTA,验证序列(最多 1024 个氨基酸、标准残基和 X),并在工作任务之间拆分记录。

  2. 在 GPU 上的每批序列上运行 ESMFold 推理。

  3. 渲染每个预测结构的骨干轨迹图像,按每个残留物 pldDT 置信度着色。

  4. 可选:当您提供实验参考 PDB 目录时,计算 TM-score、RMSD 和每 pLDDT/error残留物校准图。

该套装需要一个拥有 NVIDIA GPU 服务管理机群(A10G、L4 或 A100;至少 16 GB VRAM 和 16 GB 系统内存)的农场,以及一个具有消耗和任务参数的 conda 队列环境的队列。CondaPackages CondaChannels最快的设置是网站上的 cuda_farm AWS CloudFormation (CloudFormation) 模板。 GitHub 亚马逊弹性计算云 (Amazon EC2) GPU 实例受每个区域 vCPU 配额的限制;如果您的队列无法扩大规模,请在服务配额控制台中申请增加正在运行的 On-Demand G 和 VT 实例。

提交演示,其中包含三种简短的基准蛋白(Trp-cage 变体 1L2Y 和 2JOF,以及反派头饰 1VII):

deadline bundle submit ./job_bundles/esmfold_predict/ \ -p InputFasta=./job_bundles/esmfold_predict/sample_inputs/demo.fasta

新员工的第一张折页会将 5.2 GB 的facebook/esmfold_v1权重下载到<OutputDir>/.hf_cache/(在 a 上大约需要三分钟g5.2xlarge)。同一任务中的后续折叠任务会重复使用缓存。

要根据实验参考文献验证预测,请将<seq_id>.pdb文件放在一个目录中并将其作为ReferencePdbDir。该Validate步骤按顺序calibration.png写入validation.csv