
有一次组会汇报我拿着AlphaFold跑出来的单链模型对着一个功能位点讲了十分钟全程没提pLDDT结果被老板一句话问住“你凭什么觉得这条环区可信”后来我把pLDDT补在PPT里又被做湿实验的同事反问“那你两个结构域之间的角度为什么敢画得这么实”这件事给我上了一课AlphaFold确实给了一套完整的置信度指标但绝大多数人——包括当时的我——只学会了pLDDT这一张牌然后就拿着它到处用。真正完整的那套牌其实是pLDDT、PAE、pTM、ipTM四个维度一起看。这篇东西我酝酿了很久想把它们分别是什么、各自解决什么问题、怎么配合着用以及我踩过的坑一次性讲透。如果你是刚拿到AlphaFold结果、不知道下一步该看什么的人或者已经跑过蛋白复合物但总觉得“分数还行又说不出哪里不放心”那这篇应该正好对得上你的需要。1. pLDDT的“光环”是怎么来的——以及它让你踩过哪些坑1.1 为什么pLDDT成了默认的“明星指标”pLDDT全称是predicted local Distance Difference Test中文通常叫“预测局部距离差异检验”。AlphaFold在输出结构的时候会给每个残基算出一个0到100的分数然后把这个分数映射成彩虹色蓝色是高置信橙色和红色是低置信。这个色彩方案太直观了几乎是打开结构一眼就能看到的东西所以很多人下意识就把pLDDT当成了“这个预测靠谱不靠谱”的总开关。AlphaFold论文里也把pLDDT和实验结构里的LDDT分数做过对比。简单解释LDDT它把预测模型和真实结构叠在一起看每个残基周围原子间距离关系到底像不像相似度越高分数越高。AlphaFold预测的pLDDT虽然不等于实验LDDT但两者高度相关。也就是说高pLDDT的位置通常意味着模型在这个区域和真实结构会挺接近。问题就出在“通常”这两个字上。pLDDT给的是一个局部残基层面的置信度它回答的是“这一个残基周围的一小片空间模型认为自己卷对没有”。它不回答“我这个结构域和另一个结构域之间的摆放角度对不对”也不回答“两个蛋白亚基之间的界面排布靠不靠谱”。很多人把pLDDT的作用范围无限放大这就埋下了隐患。1.2 只盯着pLDDT我见过的几种翻车现场翻车现场一高pLDDT的“整链模型”域间角度错了。有一个做磷酸酶的朋友蛋白有三个结构域跑出来单链pLDDT都在85以上看着一片蓝色特别好看。他直接把这个全模型拿去做分子对接结果对接出来的结合模式怎么都不合理。后来我们把PAE矩阵翻出来发现N端结构域和中间结构域之间的预测对齐误差到了20多埃。也就是说AlphaFold对这两个结构域的折叠方式很有信心但对它们怎么摆完全没数。这种情况下整体结构从头到尾虽然视觉上是一个完整的链实际上中段更像是“拧在了一个不确定的铰链上”。翻车现场二低pLDDT区域被当成“模型坏了”。另一个常见操作是把低pLDDT的残基全部从模型里剪掉认为那些是“没预测出来”的垃圾区。这个判断有一半是对的有一半是过于粗暴。低pLDDT确实代表低置信度但低置信度有两个来源一个来源是目标区域真的缺少模板、序列同源信息弱模型猜不准另一个来源是这区域本身在天然状态下就是柔性区或无序区它压根没有一个稳定的折叠。如果你研究的是无序蛋白低pLDDT反而是有生物学意义的信息不是垃圾。翻车现场三只看pLDDT以为“复合物界面没问题”。同源二聚体的界面残基pLDDT通常都不低因为模型把单体结构折叠得很确定界面上的氨基酸也同样被折叠得很好。但界面pLDDT高完全不等于两个亚基的相对方位是对的。界面上的pLDDT反映的是残基本身的局部环境而两个亚基到底以哪个面对在一起、转了多少度那是另一个问题得看ipTM和PAE。这一点最容易让人误判。1.3 单体置信度与复合物置信度是两码事pLDDT是“局部自信”PAE是“相对位置自信”pTM是“全局折叠自信”ipTM是“复合物装配自信”。这四种自信本质上是在回答不同尺度的问题。用一个生活化的类比pLDDT像是看一块一块乐高积木的做工好不好积木表面有没有毛刺、齿合处是不是严丝合缝。而PAE像是看积木和积木之间到底有没有说明书说明书里是否明确写清楚了接口要往哪里按。pTM则是看整个成品大致像不像官方样图ipTM更狠直接问“如果最后搭出来的是个城堡那城门和塔楼的相对位置对不对”。所以别再问“这个模型pLDDT这么高是不是一定对”。这个问题本身就有点错位。更合适的问题是哪个区域pLDDT高、我有信心用哪个区域pLDDT低、我不敢用哪个界面PAE低、可以做对接哪个界面PAE高、只能描述粗粒度的结合趋势。2. 把pLDDT读明白高置信残基的“局部”不等于整个结构都对2.1 0到100分怎么划分才算合理AlphaFold官方建议是pLDDT 90 的区域预测得很自信可当作高精度模型使用70到90之间算良好但表面侧链、环区可能有点偏差50到70属于“骨架方向可能对但细节不可信”低于50基本就是无序区或者模型胡猜区。我在实际看结构时会把阈值再细一点pLDDT区间我的处理方式90核心二级结构可做突变设计、底物口袋分析70–90整体骨架可信注意侧链取向适合做距离约束50–70只取大致拓扑不适合做原子级对接50按无序区或柔性linker处理不参与建模细节这个表格不是死规矩但它帮我避免过度解读。比如你看到一个活性位点裂缝里的关键残基pLDDT是68你不能直接说这个残基的侧链朝向一定如模型所示但可以说它在空间上靠近底物结合区域。2.2 怎么快速定位模型里的“不可信区域”拿到AlphaFold的pDB文件之后别急着截图。用PyMOL打开把pLDDT映射到B-factor因子颜色上spectrum b, blue_white_red, minimum0, maximum100这样整条链的置信度分布马上就出来了。红色和白色区段就是想重点关注的区域。再有就是把pLDDT输出成一列数值按残基扫描找连续低分块。一个常见规律是N端和C端各有一段pLDDT很低那是模型对末端没有约束导致的不一定是真的无序如果在蛋白中部出现一段超过20个残基连续低于50的序列那大概率是天然无序区或者长linker而不是“预测出错”。操作上我通常会结合UniProt上的注释看。如果UniProt本身标注了intrinsically disordered region而AlphaFold也在那一段给出低pLDDT那就基本确认是柔性区。如果UniProt没有标注就需要再结合疏水性、序列组成判断甚至跑一下IUPred这类专门预测无序区的工具做交叉验证。2.3 pLDDT与RMSD两种“误差”别混着说很多新手读文献看到“pLDDT高代表RMSD小”这个说法需要打补丁。pLDDT高确实意味着模型在这个位置与真实结构的局部误差倾向小但pLDDT并不直接等于RMSD。RMSD是一整个片段叠合后的均方根偏差pLDDT是每个残基局部距离关系的预测置信度。一个高pLDDT的长α螺旋在整链叠合下RMSD可能很小但如果这个蛋白总体是个多结构域蛋白整体RMSD可能被域间角度差异拉得很高。换句话说pLDDT是“局部云团内部的紧实度”RMSD是“两团云整体差多远”两者不是同一件事。还有一个概念要分清结构性柔性。像钙调蛋白这种连接两个球状结构域的柔性linkerpLDDT在linker区域通常会低但实际生物功能恰恰依赖这种柔性。假如你不假思索把linker剪掉对接出来的构象就失去生物学意义了。所以读到低pLDDT不要条件反射认为“不可用”先问一句这区域是不是功能上就该动。3. 终于轮到PAE“装配图”上的蓝蓝绿绿到底在告诉你什么3.1 PAE矩阵的基本读法PAE全称Predicted Aligned Error即“预测对齐误差”。它和pLDDT最不一样的地方在于它是成对残基的二维矩阵。矩阵第i行第j列的值表示的是如果我把第i个残基作为参考点去叠加结构第j个残基相对于参考点可能偏移多少埃。这个定义有点绕我换个说法。PAE低意味着两个残基之间的相对位置是锁死的不管整个结构怎么转它们俩的相对坐标都不会乱动。PAE高则意味着这两个残基的相对位置在模型里只是“碰巧如此”换个随机种子跑一版它们的相对摆放就可能不一样。读图的时候PAE值通常用蓝白红表示蓝色是低误差两个残基相对位置确定红色是高误差相对位置不确定。数值上一般认为小于5埃算很稳5到10埃可以大致参考大于10埃就要非常小心。3.2 用PAE识别“刚性块”和“柔性铰链”我把PAE矩阵当成结构的“装配图”来用。一个单链蛋白如果明显分成两个结构域PAE矩阵通常会在对角线上看到两个蓝色方块每个方块内部都是蓝的说明结构域内部相对坐标稳定。如果这两个蓝色方块之间的区域也是蓝色说明这两个结构域的界面是刚性的域间角度基本确定这时候你可以大胆地把整个模型拿去做对接、分子动力学初始结构。如果两个蓝色方块之间隔着大片红色或黄绿色那就说明这两个结构域之间只靠一个柔性linker相连相对方向不确定。这种情况下做全模型对接前必须先做一轮柔性处理或者干脆把两个域单独拆出来分别用。还有一种比较微妙的情况两个结构域之间有直接接触面PAE矩阵中两个方块跨越主对角线连成了一个更大的蓝色“L形”或“矩形”也就是说结构域间不仅接触而且接触面的几何关系被预测得很稳。这种结构最适合做后续小分子对接和点突变设计。3.3 PAE在复合物界面判断里的特殊价值对于多聚体PAE矩阵会包含所有链的所有残基对。比如一个同源二聚体矩阵会被分成四个象限两个对角象限对应链内两个非对角象限对应链间。链间象限颜色越蓝两个亚基之间的相对方位越确定。我判断一个二聚体模型能不能往下做先看链间PAE。如果界面区域PAE低于8埃我会认为两个亚基的“组装方式”基本可信后续可以用更精细的对接工具再优化。如果链间PAE大面积是黄色红色哪怕单体pLDDT高到90界面也是不靠谱的。这时候只能把模型当成“空间上允许形成二聚体”的证据而不能当成“二聚体就是这个样子的证据”。有一类特殊模型要格外留意AlphaFold对对称复合物有时会给出链间PAE偏高的结果但视觉上看界面又很合理。这是因为模型可能同时存在多个相似能量的对称解AlphaFold在输出时只选了其中一个但它的内部预测并不完全确定。此时我不会强行选一个构象而会用分子动力学或对称对接工具再做一轮聚类。4. pTM和ipTM多域折叠与复合物装配的两把“总尺”4.1 pTM先回答“整体折叠有没有谱”pTM是predicted Template Modeling score的缩写数值区间是0到1。它借鉴了TM-score的算法逻辑越接近1意味着预测结构和真实结构在全局拓扑上越可能一致越接近0说明整体折叠可信度越低。pTM和pLDDT最大的区别就是pTM把整条链作为一个整体看而且对不同残基误差有一个加权。轻度的局部误差会被稀释严重影响全局折叠的误差会被放大。所以pTM更像是一个“骨架级”的评分它告诉你模型整体有没有形成正确的拓扑。阈值方面AlphaFold论文里提到一个经验边界pTM大于0.5认为整体折叠预测可能正确pTM小于0.5整体折叠就不可信。我自己用的时候会把0.5当成“能不能细看”的门槛但不会当成“这个模型完全没用”的死刑判决。实际项目里pTM对大蛋白比较吃亏。一个由两个大结构域组成的蛋白即使每个结构域内部都折叠得非常准只要域间相对方位不确定pTM也会被压得很难看。这时候你去查pTM发现只有0.45别急着删模型一定回头再看PAE把域间不确定和域内高置信分开表述。4.2 ipTM复合物界面的“定海神针”ipTM全称是interface predicted Template Modeling score也就是“界面预测模板建模分”。AlphaFold-Multimer、AlphaFold3在预测复合物时都会输出它。ipTM的算法和pTM本质一样但权重集中在不同亚基之间的界面残基上。它专门回答一个问题亚基和亚基之间的排列是否正确。常见的参考阈值ipTM 0.8界面模型非常可信0.6到0.8界面有一定可信度可以做初步分析低于0.6界面排布基本不可信。AlphaFold在排序多聚体模型时还会用ranking_score公式是0.8 × ipTM 0.2 × pTM。这也侧面说明了对复合物来说ipTM的重要性是压倒性的。如果你用AlphaFold2老版本跑单体输出里没有ipTM是很正常的。只有跑多聚体版本json文件里才会有ipTM。AlphaFold3的预测结果界面里ipTM直接会显示在输出卡片上。4.3 阈值不是“万能石膏模”分越高越要查来源阈值看似简单但实际使用里有几个陷阱。第一个陷阱ipTM高不代表你关心的界面就是对的。ipTM是一个整体界面的平均化评分可能整个四聚体界面总体很稳但某一个特定口袋有细微偏移这个小偏移在ipTM上根本看不出来。所以ipTM只作为初筛具体到个别残基还是需要回到pLDDT和局部PAE去检查。第二个陷阱ipTM低不一定意味着“不结合”。有些蛋白天然存在多种低能量结合模式AlphaFold可能给出了一个状态但ipTM不高。比如一个二聚体两个亚基只是通过比较小的一块界面接触这种小的接触面本身就没那么“稳定”ipTM偏低不代表预测失败而是真实体系里这个接触就是动态的。第三个陷阱比较不同长度的复合物时ipTM直接横向对比并不公平。小肽复合物和超大多聚体分数分布特征不一样。我见过一个三聚体预测ipTM是0.82另一个十倍大的多聚体ipTM是0.75后者不一定比前者差只是整体规模对评分有影响。所以汇报时最好同时把模型大小、pLDDT分布、PAE热图摆在一起讲不要只甩两个数字。5. 我固定的四步解读流程从拿到pkl到能跟湿实验同事聊5.1 第一步pTM和ipTM先“定基调”每次我拿到AlphaFold预测结果不会第一时间打开三维结构而是先把ranking_score、pTM、ipTM这几个数字看一遍。如果预测的是单体重点看pTM如果是复合物重点看ipTM。这一阶段不追求细节只定基调这个模型能不能进入下一轮细读。如果ipTM低于0.5我基本只会把模型当作“可能形成复合物”的证据不会继续拿出做原子级别的分析。如果ipTM高于0.8我就会考虑对模型做更细致的残基接触分析。介于两者之间则看pLDDT和PAE再决定。5.2 第二步pLDDT沿着序列标“雷区”确定可以细看之后我才会加载三维结构按B-factor把pLDDT染上色然后把pLDDT低于50的残基逐个标出来。尤其是连续低分区域我会在笔记里记下“这20个残基只能看大致趋势不能用于具体侧链分析”。这个方法对表面loop尤其重要。很多功能注释会提到某个loop上有个关键磷酸化位点如果pLDDT只有45你可以在汇报里说“这个位点所在区域高度柔性模型位置仅作示意”而不是理直气壮地画成一个固定结构。5.3 第三步PAE分区判断哪些结构域可以硬连接、哪些必须松处理pLDDT看完后我会把PAE矩阵画出来。如果是从AlphaFold的pkl文件里取PAE代码大概是这样的import pickle import numpy as np with open(result_model_1_multimer_v3.pkl, rb) as f: data pickle.load(f) pae data[predicted_aligned_error] # 实际跑AlphaFold3时注意pkl的层级结构可能不同拿到PAE矩阵后我可以把矩阵按结构域切成几个子块分别统计平均PAE。这一步要解决的问题是哪些结构域之间可以当作刚性整体使用哪些必须拆开处理。比如我要做分子对接刚性块的相对坐标可以直接固定柔性铰链区域的潜在构象就得通过MD采样或ensemble对接实现。5.4 第四步把三重结果打包成“置信度说明书”最后一步我会把上述信息整理成一段能让湿实验同事看懂的结论而不是只丢一个pkl文件。通常包含这几行全链pLDDT均值与低于50的残基区间二次结构域间的PAE情况标出哪些界面稳、哪些界面松复合物的ipTM分数以及对界面可信度的判断哪些区域可以用于后续定点突变或对接哪些不建议用这样做的好处是大家都不会被动陷入“撞运气式”解读所有结论都有明确依据。我自己交出去的模型分析报告几乎都是这种格式反馈效率高很多。6. 三个典型“回访”案例同样的分数组合结论为何完全不同6.1 单结构域高pLDDT、高pTM最省心的类型如果一个蛋白只有一个结构域pLDDT大面积在85以上pTM在0.75以上PAE矩阵里几乎整片是蓝色那这个模型在所有置信度指标上都很利于使用。我会直接把它当成近天然的起始结构做底物对接、突变设计甚至分子动力学模拟的起点都没问题。注意点只剩两处表面环区侧链的取向可能不稳以及AlphaFold对配体、辅因子不建模需要自行补。6.2 单体pLDDT高、界面ipTM低最分裂的类型我最常见到的一类多聚体模型是每个亚基单体的pLDDT都在85以上但ipTM只有0.5到0.6链间PAE大片黄色偏红。这种结果翻译成实际含义是亚基自己折叠得很准但亚基之间怎么相对排列模型拿不准。遇到这种情况我不会轻易下“这个蛋白不形成二聚体”的结论更不会直接断言“模型预测它们以这种姿态结合”。更合理的说法是“AlphaFold支持其形成二聚体的能力但界面构象存在多种可能性建议用交联质谱或突变体实验判断具体界面。”如果项目需要结构我会针对界面区域单独再做一轮对称性限制的预测或者用HADDOCK、ZDOCK等工具把单个可靠亚基拿去做对接生成候选集合后再评比。6.3 pLDDT低却在功能上重要的区域最容易被冤枉的类型我再讲一个做分子伴侣的例子。那是一个在底物识别中起关键作用的柔性looppLDDT只有35。很多人第一反应是这模型不行连关键功能区域都没预测出来。但如果我们把AlphaFold的预测和核磁共振实验数据放在一起看会发现这个loop本来就是天然无序的只有结合底物时才折叠成固定结构。AlphaFold不能预测这种诱导拟合的稳定构象给出的低pLDDT反而正确反映了“它在游离状态下不固定”这一事实。这种情况下低pLDDT不是错误提示而是提示你需要补一个配体结合后的构象研究。所以我一直告诫自己pLDDT低不等于模型垃圾可能是一种真实柔性pLDDT高也不等于整链都能用还得过PAE那关。经过这些年的反复摸索我现在的习惯已经变成一个固定动作pLDDT看局部可信度pAE看相对位置可信度pTM看单体全局ipTM看界面装配。四个维度凑齐了再下笔写结论。这套流程不敢说有多高明但至少能让我在组会汇报的时候被老板问一句“你怎么知道这个区域靠谱”时能答得上来。