ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

3 步跑通 AlphaFold 蛋白质相互作用预测:蛋白质复合物结构预测调参与置信度解读教程

3 步跑通 AlphaFold 蛋白质相互作用预测:蛋白质复合物结构预测调参与置信度解读教程 3 步跑通 AlphaFold 蛋白质相互作用预测蛋白质复合物结构预测调参与置信度解读教程【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafoldAlphaFold 是 AlphaFold 2 结构预测管线的开源实现其中的 AlphaFold-Multimer 模型负责蛋白质相互作用预测中的复合物场景给出多条亚基序列输出整个蛋白复合物的三维结构及亚基间的相对排布。本文以一次完整的多聚体预测为主线覆盖输入文件怎么写、命令参数怎么定、pLDDT/pTM/PAE 怎么读以及显存不足、低置信度等翻车情况怎么处理。单体与多聚体两种模式的差异以及如何判断该用哪一个蛋白质复合物 FASTA 输入的标准写法与预测运行流程pLDDT、pTM、PAE 各是什么、什么数值算可信、在哪个文件里查显存不足、低置信度区域、亚基排布异常、MSA 报错四类高频问题的处理提速与省资源的参数组合以及不同残基数的预测耗时参考能力边界先判断该用哪种模式先给结论目标复合物的化学计量stoichiometry亚基种类与数量比已知时用多聚体模式已知单体结构也适用亚基组成未知时如基因组规模的批量预测单体模式平均精度更高。对比项monomer 单体模式multimer 多聚体模式输入形式单序列 FASTA多序列 FASTA每个亚基一个独立条目适用对象单链结构亚基组成未知时的批量预测同源多聚体、异源多聚体、化学计量已知的多亚基复合物数据库与硬件门槛标准数据库即可reduced_dbs 预设需 8 核、8 GB RAM、600 GB 磁盘额外需要下载 UniProt 与 PDB seqres 数据库大型复合物显存占用更大输出差异默认输出 pLDDTmonomer_ptm预设额外提供 PAE固定输出 pLDDT、pTM、PAE 三项指标当前默认的多聚体权重为 v2.3.0multimer_v3相对旧版的关键变化集中在大复合物能力上训练数据截止日由 2018-04-30 延到 2021-09-30数据量约多 30%冷冻电镜结构 4 倍、超过 2000 残基的大结构 2 倍训练裁剪从 384 残基扩到 640 残基训练时最大链数由 8 提升到 205 个多聚体模型中有 3 个的 MSA 序列上限从 1,152 提到 2,048。这些数字出自 v2.3.0 技术说明直接收益是 2000 残基以上大型复合物的预测精度明显改善。三步拿到结构第一步写对复合物 FASTA 输入规则只有一条每个亚基一个独立 FASTA 条目独立头行条目数等于亚基数条目顺序对应化学计量。同源多聚体3 个相同序列的拷贝以下序列仅为示意sequence_1 MAEQVALISHRFSPAVEERANTMQQMANSLKAVQ sequence_2 MAEQVALISHRFSPAVEERANTMQQMANSLKAVQ sequence_3 MAEQVALISHRFSPAVEERANTMQQMANSLKAVQ异源多聚体A2B3 化学计量2 条 A 3 条 Bsequence_1 MAEQVALISHRFSPAVEERANTMQQMANSLKAVQ sequence_2 MAEQVALISHRFSPAVEERANTMQQMANSLKAVQ sequence_3 AEGTQVLTTRRLGQDEADMAEDAVNNGM sequence_4 AEGTQVLTTRRLGQDEADMAEDAVNNGM sequence_5 AEGTQVLTTRRLGQDEADMAEDAVNNGM需要连续预测多个目标时用逗号分隔多个 FASTA 路径脚本会依次运行--fasta_pathsmultimer1.fasta,multimer2.fasta。第二步跑多聚体预测命令多聚体与单体的主命令只差一个--model_presetmultimerpython3 docker/run_docker.py \ --fasta_pathsmultimer.fasta \ --max_template_date2022-01-01 \ --model_presetmultimer \ --data_dir$DOWNLOAD_DIR \ --output_dir/home/user/multimer_output单体预测换成对应预设即可python3 docker/run_docker.py \ --fasta_pathsmonomer.fasta \ --max_template_date2022-01-01 \ --model_presetmonomer \ --data_dir$DOWNLOAD_DIR \ --output_dir/home/user/monomer_output特别大或困难的复合物参照 CASP15 的推理设置把每模型种子数提到 20python3 docker/run_docker.py \ --fasta_pathslarge_complex.fasta \ --model_presetmultimer \ --num_multimer_predictions_per_model20 \ --data_dir$DOWNLOAD_DIR \ --output_dir/home/user/large_output关键参数逐行解释参数作用默认值 / 建议--model_preset选模型monomer/monomer_ptm/multimer复合物目标用multimer--num_multimer_predictions_per_model每个模型的种子数多聚体默认 55 个模型共 25 次预测求快设 1困难目标设 20--db_presetMSA 数据库预设reduced_dbs或full_dbs默认full_dbs--enable_gpu_relax松弛relax步骤是否放 GPU 跑默认true更快但可能不够稳定--max_template_date模板检索限定在指定日期之前发布的结构按需设置避免用到“未来”模板--data_dir/--output_dir数据库目录 / 输出目录输出目录缺省为/tmp/alphafoldsubbatch_size是另一个调节旋钮位于 alphafold/model/config.py 的global_config默认值为 4官方说明在 A100 上增大该值可提升小结构的预测速度。第三步认识输出目录输出按目标名存为--output_dir下的子目录结构与 README 描述一致output_dir/target_name/ features.pkl # 输入给模型的特征NumPy 数组 ranked_{0,1,2,3,4}.pdb # 按置信度排序的结构ranked_0.pdb 置信度最高 ranking_debug.json # 排序所用 pLDDT 分数及其到原始模型的映射 relax_metrics.json # 松弛指标如残余几何冲突 relaxed_model_{1..5}.pdb # 经 Amber 松弛后的结构 unrelaxed_model_{1..5}.pdb # 模型原始输出、未松弛的结构 result_model_{1..5}.pkl # 模型原始输出pLDDT、pTM、PAE 等 timings.json # 管线各阶段耗时 msas/ # MSA 检索结果bfd_uniref_hits.a3m 等每个结构的 pLDDT 同时写进了 PDB 文件的 B-factor 字段——注意它和普通 B-factor 含义相反数值越高越可靠。读懂置信度pLDDT、pTM、PAE 哪个算可信三项指标都在result_model_*.pkl模型直接产出的 NumPy 字典里分工各不同一个看局部残基是否可靠一个看整体结构是否可靠一个看两两残基的相对定位是否可靠。pLDDTpredicted LDDT逐残基预测置信度取值 0–100100 最可信。低于 50 的区域通常视为结构不可靠高于 80 一般算高置信。查result_model_*.pkl的plddt字段或直接在 PDB 的 B-factor 列查看。pTMpredicted TM-score标量越高越好评估整体结构的可靠性。多聚体模式下它反映整个复合物装配的可信度——若各链 pLDDT 都不低而 pTM 偏低多半是亚基整体排布有问题。查ptm字段。PAEpredicted aligned error预测对齐误差衡量两残基相对位置可信度的矩阵形状为 [N_res, N_res]0 最可信上限 31 Åconfig.py 中max_error_bin31。跨亚基的块是判断复合物的关键对角块之外的块偏高说明即便两条链各自折叠正确它们之间的相对位置也不可信。查predicted_aligned_error字段。可视化方面官方 教程 notebook 自带 pLDDT/PAE 绘图代码Colab 可直接运行查看三维结构与亚基界面建议用 PyMOL 或 ChimeraX 载入 PDB按 pLDDT 的 B-factor 着色低置信区域一目了然。翻车急救四类高频问题⚠️ 显存不足怎么办症状大型复合物在结构预测阶段报 CUDA out of memory或进程被系统杀掉。可能原因模型显存占用随残基数快速上升——5,000 残基的纯预测耗时超过 5 小时多聚体模型同长度下比单体占用更大。处理动作先把alphafold/model/config.py的global_config.subbatch_size从默认 4 往下调仍不够再把复合物拆成亚基分别预测或改用--db_presetreduced_dbs降低 MSA 规模。⚠️ 低置信度区域怎么办症状ranked_0.pdb中大片区域 pLDDT50对应 PAE 对角块数值也高。可能原因序列本身含固有结构无序区、亚基化学计量给错、或 MSA 证据不足。处理动作先核对 FASTA 中亚基数与顺序是否符合已知复合物困难目标加种子--num_multimer_predictions_per_model20单体目标可换--model_presetmonomer_ptm用它输出的 PAE 矩阵辅助判断哪些区域是无序区。⚠️ 亚基排列异常怎么办症状各链 pLDDT 高但 pTM 很低、PAE 非对角块高结构中各亚基相对位置不合理。可能原因模型对亚基间相对定位置信度低或输入化学计量与实际复合物不符。处理动作确认 FASTA 亚基顺序与已知复合物一致A2B3 就按 A、A、B、B、B 写用 参数下载脚本 重新拉取 v2.3.0 权重排除旧版参数仍不理想时结论按“链内可靠、链间排布存疑”处理不要直接采信亚基间相对位置。⚠️ MSA 阶段慢或数据库报错怎么办症状流程长时间卡在 MSA 检索或 MSA 工具抛出外部报错。可能原因完整数据库体量过大下载 556 GB、解压后 2.62 TB或数据库目录读写权限不足。处理动作改用缩减库scripts/download_all_data.sh DOWNLOAD_DIR reduced_dbs重新下载运行命令配--db_presetreduced_dbs同时检查数据库目录权限官方 README 建议对目录执行chmod 755。提速与省资源参数组合与耗时参考 原则一句话时间大头在 MSA 检索与结构预测网络前者用数据库预设控制后者用种子数和子批大小控制。常用组合如下。参数 / 设置效果适用场景--db_presetreduced_dbs8 核、8 GB RAM、600 GB 磁盘即可运行MSA 更快中小目标、首次试跑--db_presetfull_dbs全套数据库MSA 质量最高精度优先的目标--num_multimer_predictions_per_model1总预测次数从 25 降到 5约 5 倍提速快速筛查、调参探索--enable_gpu_relaxfalse松弛改在 CPU 上跑更慢但更稳定大型复合物对松弛稳定性要求高时--use_precomputed_msastrue复用上一次运行的 MSA同一序列反复调参要求输出目录结构与序列不变global_config.subbatch_size默认 4调大可加速 A100 上小结构预测A100 跑小序列时耗时参考为单张 A100、不含松弛、3 次 recycle、不计 MSA 与模板检索加--benchmarktrue运行后实测耗时记录在timings.json残基数预测耗时秒1004.9500291,000962,0004505,00018,824耗时随长度近指数增长2,000 残基的复合物是分钟级5,000 残基超过 5 小时排机器时间时按这个量级规划。收尾记住三件事模式选择看化学计量是否已知跑完先读ranked_0.pdb再对照 pLDDT、pTM、PAE 判断哪些区域可信困难目标优先加种子数再动其他参数。完整参数清单见 README模型升级细节见 v2.3.0 技术说明数据库一键获取用 数据下载脚本想免本地环境试跑可用官方 教程 notebook。【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表