

本文属于机器翻译版本。若本译文内容与英语原文存在差异，则一律以英文原文为准。

# 在截止日期云上使用 esmFold 预测蛋白质结构
<a name="examples-jb-esmfold"></a>

[esmfold\_pred](https://github.com/aws-deadline/deadline-cloud-samples/tree/mainline/job_bundles/esmfold_predict) ict 任务包使用 esmFold（Meta，麻省理工学院许可证）进行蛋白质结构预测。`facebook/esmfold_v1`该捆绑包以 FASTA 文件作为输入，并根据每个序列生成一个`.pdb`文件作为输出，以及置信度指标和针对实验参考结构的可选验证报告。

该作业分为四个步骤：

1. 解析输入 FASTA，验证序列（最多 1024 个氨基酸、标准残基加上 X），并在工作任务之间拆分记录。

1. 在 GPU 上对每批序列运行 ESMFold 推理。

1. 渲染每个预测结构的主干轨迹图像，按每残留物 PLDDT 置信度着色。

1. 可选：当您提供实验参考 PDB 目录时，计算 TM-score、RMSD 和每 pLDDT/error残留物校准图。

该捆绑包需要一个具有 NVIDIA GPU 服务托管队列（A10G、L4 或 A100；至少 16 GB VRAM 和 16 GB 系统 RAM）的服务器场以及一个队列，其队列的队列具有消耗和任务参数的 conda 队列环境。`CondaPackages` `CondaChannels`最快的设置是 [cuda\_farm AWS CloudFormation ()CloudFormation模板](https://github.com/aws-deadline/deadline-cloud-samples/tree/mainline/cloudformation/farm_templates/cuda_farm)。Amazon Elastic Compute Cloud (Amazon EC2) GPU 实例受每个区域的 vCPU 配额限制；如果您的队列无法扩展，请在服务配额控制台*中申请增加 On-Demand 运行 G 和* VT 实例的配额。

提交演示，它折叠了三种简短的基准蛋白（Trp-cage 变体 1L2Y 和 2JOF，以及反派头饰 1VII）：

```
deadline bundle submit ./job_bundles/esmfold_predict/ \
  -p InputFasta=./job_bundles/esmfold_predict/sample_inputs/demo.fasta
```

新工作人员的第一个折叠会将 5.2 GB 的`facebook/esmfold_v1`权重下载到`<OutputDir>/.hf_cache/`（a 上大约三分钟`g5.2xlarge`）。同一作业中的后续折叠任务会重复使用缓存。

要根据实验参考验证预测，请将`<seq_id>.pdb`文件放在目录中并将其传递为`ReferencePdbDir`。该`Validate`步骤写入`validation.csv`并按序列`calibration.png`写入。