本文属于机器翻译版本。若本译文内容与英语原文存在差异,则一律以英文原文为准。
在截止日期云上使用 esmFold 预测蛋白质结构
esmfold_predfacebook/esmfold_v1该捆绑包以 FASTA 文件作为输入,并根据每个序列生成一个.pdb文件作为输出,以及置信度指标和针对实验参考结构的可选验证报告。
该作业分为四个步骤:
-
解析输入 FASTA,验证序列(最多 1024 个氨基酸、标准残基加上 X),并在工作任务之间拆分记录。
-
在 GPU 上对每批序列运行 ESMFold 推理。
-
渲染每个预测结构的主干轨迹图像,按每残留物 PLDDT 置信度着色。
-
可选:当您提供实验参考 PDB 目录时,计算 TM-score、RMSD 和每 pLDDT/error残留物校准图。
该捆绑包需要一个具有 NVIDIA GPU 服务托管队列(A10G、L4 或 A100;至少 16 GB VRAM 和 16 GB 系统 RAM)的服务器场以及一个队列,其队列的队列具有消耗和任务参数的 conda 队列环境。CondaPackages CondaChannels最快的设置是 cuda_farm AWS CloudFormation ()CloudFormation模板
提交演示,它折叠了三种简短的基准蛋白(Trp-cage 变体 1L2Y 和 2JOF,以及反派头饰 1VII):
deadline bundle submit ./job_bundles/esmfold_predict/ \ -p InputFasta=./job_bundles/esmfold_predict/sample_inputs/demo.fasta
新工作人员的第一个折叠会将 5.2 GB 的facebook/esmfold_v1权重下载到<OutputDir>/.hf_cache/(a 上大约三分钟g5.2xlarge)。同一作业中的后续折叠任务会重复使用缓存。
要根据实验参考验证预测,请将<seq_id>.pdb文件放在目录中并将其传递为ReferencePdbDir。该Validate步骤写入validation.csv并按序列calibration.png写入。