ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

AlphaFold蛋白质结构预测实战指南:从一条序列到原子级结构

AlphaFold蛋白质结构预测实战指南:从一条序列到原子级结构 AlphaFold蛋白质结构预测实战指南从一条序列到原子级结构【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafoldAlphaFold 是 DeepMind 开源的蛋白质结构预测推理实现输入一个 FASTA 格式的氨基酸序列文件输出带原子级坐标的 PDB 结构文件并附带逐残基的置信度评分。需要说明的是这个仓库只包含推理流程而不含训练代码——你无法微调权重或修改网络训练方式只能通过预设切换推理行为。与在线预测服务相比离线推理管线的优势在于全过程可追溯MSA 搜索、模板匹配、模型输出、Amber 力场精修全部在本地完成所有中间文件都落盘保存便于复现和审计。 认知校准这个仓库是什么不是什么仓库是 AlphaFold v2 的官方推理实现覆盖单链蛋白质monomer和多链复合物multimer即 AlphaFold-Multimer两种模式。模型权重以参数文件形式分发通过--model_preset参数在四个预设间切换monomerCASP14 原始模型5 个模型取最优、monomer_casp148 倍集成主要为复现比赛结果而存在计算开销 8 倍但精度仅提升约 0.1 GDT、monomer_ptm额外输出 pTM 与 PAE 的置信度头、multimer复合物模式。代码里确实包含 Evoformer 注意力网络、结构生成模块与置信度评估的完整实现但官方不提供训练与微调入口技术细节以仓库内的 technical note 为准。 硬件与数据先盘好 2.6 TB 磁盘AlphaFold 仅支持 Linux并要求一块 NVIDIA GPU显存越大能预测的蛋白质越大。完整遗传数据库下载量 556 GB解压后 2.62 TB其中 BFD 一个库就约 1.8 TB官方强烈建议 SSD。如果你的机器配置有限可以选缩减预设8 个 vCPU、8 GB 内存、600 GB 磁盘即可运行代价是用 small_bfd 替换 BFDMSA 搜索深度下降。 前置软件共三样Docker、NVIDIA Container Toolkit负责容器内 GPU 直通和 aria2c数据库并行下载。最小初始化路径先 clone 仓库git clone https://gitcode.com/GitHub_Trending/al/alphafold安装好上述三件工具再把下载脚本挂到后台——556 GB 的下载必然是一场持久战。# 完整数据库约 556 GB建议后台运行 scripts/download_all_data.sh $DOWNLOAD_DIR download.log 2 download_all.log 这里有一条官方反复强调的规则数据目录不能放在仓库目录内部否则 2.6 TB 的数据会被整个复制进 docker build context镜像构建慢到无法接受。 核心链路从 FASTA 到 PDB 的四步流程准备 FASTA 文件。单链就是一条序列复合物把所有链写进同一个 FASTA每条序列一个名称头同源多聚体就把同一序列重复写多份。脚本按文件内序列数量决定是否按复合物折叠并用文件名给输出目录命名所以多个输入路径的文件名必须互不相同。验证 GPU 可见性。整条推理都在容器内跑先确认容器能看到显卡再动手构建镜像避免白等一晚上。构建镜像。Dockerfile 会从源码编译 HHSuite提供 HHblits、hhsearch、jackhmmer并装入 HHmer、Kalign、OpenMM精修步骤用这些外部依赖手动装齐远比构建镜像麻烦。docker run --rm --gpus all nvidia/cuda:11.0-base nvidia-smi docker build -f docker/Dockerfile -t alphafold .运行推理。--max_template_date 把模板搜索限制在该日期之前发布的结构相当于时间机器折叠历史测试集时可避免用到目标蛋白自身的同源结构作弊multimer 模式需要额外下载 UniProt 数据库。python3 docker/run_docker.py \ --fasta_pathsyour_protein.fasta \ --max_template_date2022-01-01 \ --model_presetmonomer \ --db_presetfull_dbs \ --data_dir$DOWNLOAD_DIR \ --output_dir/home/user/absolute_output_dir如果只想知道模型本身的纯推理耗时可加 --benchmarktrue计时结果会写进输出的 timings.json。 输出解读pLDDT、PAE 与 ranked 文件输出目录结构是固定的features.pkl喂给模型的全部特征、unrelaxed_model_1~5.pdb模型原始输出、relaxed_model_.pdb经 Amber 力场精修后的结构、ranked_0~4.pdb按 pLDDT 排序ranked_0 置信度最高、result_model_.pkldistogram 等原始张量、timings.json以及保存 MSA 中间结果的 msas/ 目录。默认只对 pLDDT 最高的一个模型做精修可用 --models_to_relax 改为全部或全部不精修。pLDDT是 0-100 的逐残基置信度同时写进 PDB 的 B-factor 列——注意方向与传统 B-factor 相反数值越高越好拿它做分子替换等任务时要特别小心。整体均值用于全局判断逐残基曲线用来定位无序区。 由 monomer_ptm 或 multimer 预设预测的结构还会输出pTM全局 TM-score 置信度和PAEpredicted aligned error预测对齐误差矩阵PAE 对角线反映域内误差非对角线反映域间相对位置误差哪块区域数值高就说明那两个结构域的相对朝向不确定这部分结构不能直接用于功能分析。⚙️ 速度与显存大蛋白怎么跑官方在单张 A100 上测得的推理时间3 次 recycle不含 MSA 与模板搜索100 残基约 5 秒1000 残基约 96 秒3000 残基约 1240 秒5000 残基约 18800 秒也就是 5 个多小时随序列长度近似线性增长。常用的加速手段有这么几个小蛋白批量跑推理脚本会按蛋白尺寸编译专用内核蛋白越小编译占比越显眼在显存允许时调大 alphafold/model/config.py 里的 global_config.subbatch_size 能明显提速。MSA 阶段BFD 是最大的库也是搜索耗时大头--db_presetreduced_dbs 用 17 GB 的 small_bfd 换 1.8 TB 的 BFD搜索深度与速度做取舍。--use_precomputed_msastrue同一条序列换推理参数反复试时复用上次算好的 MSA直接跳过整条管线中最慢的搜索步骤。multimer 默认每个模型跑 5 个 seed合计 25 个预测用 --num_multimer_predictions_per_model1 压到 1 个精度有小幅下降但速度快很多。官方没有提供批量推理脚本如果蛋白较小逐个编译的开销不可忽略推荐基于 RunModel.predict 配合 make_fixed_size 做定长填充来自建批量管线。️ 三个高频坑与自查方法坑一镜像构建异常缓慢。原因基本只有一个DOWNLOAD_DIR 放在了仓库目录里build context 膨胀到 TB 级。解法是把数据目录挪到仓库外重新构建官方在文档里用醒目提示强调过这一点。 坑二MSA 工具jackhmmer、HHblits 等报出不透明的外部错误。这是数据目录读写权限不足的典型症状用 sudo chmod 755 --recursive $DOWNLOAD_DIR 补上权限后重跑即可。 坑三GPU 检查一步就没有显卡列表。原因是装了 Docker 但 NVIDIA Container Toolkit 没配好先用 docker run --rm --gpus all nvidia/cuda:11.0-base nvidia-smi 自查看到 GPU 列表再往下走。 另外留意一点部分蛋白的运行间方差较大官方点名了 T1064新沉积的同源序列会改变它的 MSA。要复现 CASP14 级别的结果必须锁定数据库版本并用 --max_template_date 限制模板日期默认的 5 模型集成加 pLDDT 选择就是对这种方差的主要缓解手段。 能力清单这个仓库的价值不在于给你一个出结果的盒子而是一条完整可审计的推理管线556 GB 遗传数据库喂给 MSA 搜索Evoformer 网络输出结构与置信度Amber 精修打磨局部几何每一步都留下磁盘上的痕迹。读完本文你应该能独立完成环境搭建与数据下载并在 full_dbs 与 reduced_dbs 之间做出正确取舍分别用 monomer 和 multimer 预设跑通单链与复合物预测用 pLDDT 与 PAE 判断模型可信度定位低置信度的序列区域依据 timings.json 分析各阶段耗时选择合适的加速参数识别构建上下文、权限、GPU 可见性三类常见故障并自行排查 下一步建议先读仓库内的 docs/technical_note_v2.3.0.md 理解各模块细节再用 reduced_dbs 对一条 200 残基左右的短蛋白做首次预测跑通全流程、确认输出结构合理后再切换到 full_dbs 做正式预测。【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表