AlphaFold 输出文件快速解读跑完蛋白质结构预测3 步判断 5 个文件靠不靠谱【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold你刚跑完一次 AlphaFold 蛋白质结构预测输出文件夹里躺着一堆.pdb、.json、.pkl名字还带model_1到model_5不知道从哪个看起。按残基 → 残基对 → 整体结构三层信任逐层排查15 分钟内就能给出这个结构我能不能用的结论。 先搞清楚文件夹里 5 类文件各管什么默认设置下会跑 5 个独立模型结果目录里真正需要留意的文件如下文件干什么用什么时候看ranked_0.pdbranked_1~4.pdb依次类推预测结构已按可信度排序第一步看confidence_model_1.json每个残基的 pLDDT 值第二步看pae_model_1.json残基对之间的相对位置置信度第三步看relax_metrics.jsonAmber 松弛后的检查报告核验结构features.pkl/result_model_*.pkl模型输入特征与原始输出进阶分析unrelaxed_*.pdb是模型原始输出relaxed_*.pdb是经过 Amber 松弛的同款结构日常用ranked_0.pdb就够了。这些文件的保存逻辑都写在 run_alphafold.py 里其中 pLDDT 被写进 PDB 的 B 因子列置信度和 PAE 两个 JSON 由 alphafold/common/confidence.py 生成。features.pkl模型当时看到了什么这是一个 pickle 字典装着喂给模型的主要输入氨基酸类型 one-hot 编码aatype、多序列比对msa、残基序号和模板特征生成逻辑在 alphafold/data/pipeline.py 的make_sequence_features和make_msa_features里。比对序列本体另外存在msas/子目录。除非你想复盘模型当时依据什么信息做的预测否则可以跳过它不影响前三步。 第一层信任这个残基本身可信吗打开 PDB 文件前先确认 B 因子这 3 列PDB 里每行ATOM记录依次是残基名、链 ID、三维坐标、占有率最靠近行尾的数值列是 B 因子。AlphaFold 在这列放的不是温度因子而是每个残基的 pLDDT 值残基内所有原子数值相同。这个设计让标准可视化软件也能直接显示置信度。在 PyMOL 里加载后这样操作load ranked_0.pdb show cartoon spectrum bspectrum b会按 B 因子列上色也就是按 pLDDT 上色——哪段结构放心、哪段飘一眼可见。pLDDT 四档 H/M/L/D 怎么看低于 50 不一定是失败pLDDT 取值 0~100划分为四档对应 JSON 里的confidenceCategory字段档位分值区间通常含义H90–100局部结构明确可放心使用M70–89可信度较好细节可能有小偏差L50–69存在不确定性结论要保守D0–49低置信可能是天然无序区打开confidence_model_1.json第一眼找三个并列数组residueNumber残基编号从 1 开始、confidenceScore保留两位小数的 pLDDT、confidenceCategory四档字母。要画置信度曲线、或者查某个功能位点的分数直接读它。那 D 档密集是不是预测翻车了不一定。天然无序区域在溶液里本来就没有固定构象低分恰恰是模型的正确答案。PAE 矩阵含义一张残基间的信任关系图pLDDT 只回答这个残基自己卷得对不对。但很多实际问题问的是两处的关系结构域 A 和 B 的相对朝向对吗蛋白界面可信吗这靠 PAEPredicted Aligned Error矩阵回答。pae_model_1.json里是一个 N×N 的predicted_aligned_error数组N 为残基数元素 PAE[i][j] 表示残基 i 和 j 相对位置的预期误差单位是 Å旁边的max_predicted_aligned_error给出这个矩阵的上限值。一个类比pLDDT 是每个残基的自评PAE 是残基之间的互评。热图里靠近对角线的方块通常是深色局部可靠如果对角线之外出现大片高误差的亮色方块说明模型对这两段的相对排布没把握。用它做对接实验或解释界面之前务必先查一下对应区域的 PAE 值。第三层信任Amber 松弛动了你的结构多少RMSD 小于 1 Å 说明什么模型直接输出的结构可能存在空间冲突、键长键角不真实。AlphaFold 会对排名第一的模型做一轮 Amber 分子动力学松弛alphafold/relax/relax.py 的AmberRelaxation类补氢原子、化解原子间碰撞、优化键长键角。你看到的relaxed_*.pdb和ranked_*.pdb就是松弛后的版本。判断原始预测质量的关键指标是松弛前后坐标的 RMSD它连同remaining_violations_count残留结构违规数一起记在relax_metrics.json里。RMSD 小于 1 Å说明原始预测物理上已经很合理松弛只是微调RMSD 偏大或违规数不为零则提示原始结构存在明显空间问题做精细分析时要把这份保留意见记在案。⚡ 30 秒快速判断这次预测能不能用对着ranked_0.pdb和两个 JSON依次核对 4 项整体 pLDDT 有没有成片 H/M 档你关心的功能域是否落在高置信区PAE 热图里功能域或界面对应的方块是否为低误差区松弛报告里 RMSD 是否小于 1 Å、残留违规数是否为 0PyMOL 里目测二级结构元件自然没有原子明显穿插或乱成一团四项全过基本可以放心使用某一项不过就把使用范围收窄比如只取高置信结构域或者补充多序列比对后重跑。多个 ranked 文件怎么挑ranking_debug.json记录了每个模型的排序分数和最终顺序order单体预测按 pLDDT 均值排序多聚体按 iptmptm 之和排序ranked_0即得分最高的那个。如果ranked_0和ranked_1分数咬得很近可以把两者的 PAE 矩阵摆在一起对比选整体低误差面更大的那个拿不准时PAE 整体水平比单点高分更有说服力。上图是项目里 CASP14 靶标的预测与实验结构叠加图蓝色预测、绿色实验。可以直观感受一下好预测长什么样主链几乎完全重合高置信区连侧链走向都对得上。 4 个容易误判的场景蛋白质结构预测结果分析对照表你看到的现象容易误判成实际应核查pLDDT 高但折叠看起来不对模型坏了核对输入序列是否完整再看 PAE 确认整体折叠是否自洽某段持续 D 档预测失败可能是天然无序区用无序预测工具交叉验证松弛 RMSD 偏大预测很差多数只是空间冲突用松弛后结构关注残留违规数局部 pLDDT 高两结构域间 PAE 高界面可靠两段相对位置没把握界面结论需谨慎三层信任逐层排查加这张对照表能覆盖绝大多数使用场景。把流程存下来先看 PDB 的 B 因子颜色再看两个 JSON最后核对松弛报告——之后每次拿到新的 AlphaFold 输出文件都按这条动线走即可。【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考