原文:https://www.ebi.ac.uk/training/online/courses/alphafold/an-introductory-guide-to-its-strengths-and-limitations/strengths-and-limitations-of-alphafold/

本节要点

  • 能力边界由训练数据决定:它只从 PDB 条目的蛋白质部分学习;
  • 擅长单链、复合物,也能识别无序区;吃力于点突变、高变序列、孤儿蛋白和构象变化;
  • 「不做」的那一类根本不在训练分布里,不是还没修好的 bug。

一、开篇那句话是整页的总纲

原文第一段就抛出一条原则:一个神经网络能做什么、不能做什么,主要取决于训练它的数据。AlphaFold2 训练时只用 PDB(Protein Data Bank,蛋白质结构数据库)条目里的蛋白质部分——小分子、核酸这些非蛋白组分全部没进去。所以后面的局限不是「还没修好的 bug」,而是训练分布的边界

打个比方:这就像一个只读过蛋白结构教科书、从没上过化学课、也没做过动力学实验的学生。他看一条氨基酸序列能画出很准的形状,但你要问「这个口袋里有没有一个糖分子」「它动起来会变成什么样」,他没有对应的知识来源——不是他算错了,是这部分信息从他的世界里就缺席了。

二、What AlphaFold can do:它擅长什么

原文列了三点,第三点是很多人会忽略的巧妙反转。

1. 单链、多聚体、蛋白-蛋白复合物

AF2 最初就是在**单条蛋白链**上训练的,所以单链是它的主场。后来又专门训了一版做蛋白-蛋白复合物的,叫 AlphaFold-Multimer(Evans et al., 2022)。同一条链的多个拷贝组成的叫 homo-multimer(同源多聚体,比如二聚体、六聚体),不同链组成的叫 hetero-multimer(异源多聚体)。

2. 它不是「复制」已知结构

这一条是关键的证据性声明:独立研究者证明 AF2 能预测出 PDB 里从未出现过的新折叠(novel folds,Bordin 2023、Barrio-Hernandez 2023、Durairaj 2023)。这才是「它学到的是结构规律,不是背下了条目」的硬证据。

原文图 5 举的例子是一条未表征蛋白(AlphaFold ID: AF-A0A849ZK06-F1),预测它整体像个蛋白激酶折叠(protein kinase fold)、可能是核糖核苷酸结合蛋白——注意这里的功能注释不是 AlphaFold 给的,是另一个工具 DeepFRI 做的(Barrio-Hernandez et al., 2023)。意思是:结构给出来,功能线索可以接力往下推。这条对你们领域意义很大,因为 AlphaFold DB 里海量条目根本没有实验结构。

3. 用来识别内在无序区

这是本页最漂亮的一处逻辑反转。内在无序区(intrinsically disordered region)在自然界里本来就没有固定结构——它是动态的,没有「一个正确答案」可预测,所以 AF2 当然算不出来。但它的局部置信度指标 pLDDT(predicted Local Distance Difference Test,逐残基的局部置信度)与无序程度强相关:无序的地方模型自己也拿不准,置信度就低。

于是同一个事实有两种读法:在「预测结构」这个任务上它失败了;在「识别无序区」这个任务上,它是 state-of-the-art。原文把它放在「能做到」里,是刻意的修辞——失效信号被反用成了检测器

三、What AlphaFold2 struggles with:它吃力在哪

「吃力」这个词要留意,和下一节的「做不到」是不同性质:这里是能出结果但质量会掉。

1. 对点突变不敏感

改变单个残基的点突变,AF2 out of the box(开箱即用状态下)基本感觉不到。原文给的原因是两条叠加的:一是变异效应的训练数据太少,二是 AF2 学的是「模式」而不是「力」(patterns as opposed to calculating physical forces)。它对齐的是进化上反复出现的共变模式,一个孤立突变改变的能量差不在它的表达范围内。

2. 高变序列(如抗体)精度差

同一个原因。抗体的互补决定区本身就是为了高速变异而存在的,序列空间乱、模式弱,AF2 在这种地方自然吃力。

3. 「孤儿」蛋白

孤儿蛋白(orphan protein)= 几乎没有近亲的蛋白。AF2 的工作方式是从序列之间的关系里推导(比对同源序列、找共变位点),近亲少 → MSA(Multiple Sequence Alignment,多序列比对)稀薄 → 共变信号弱 → 预测质量差,而且置信度分数会同步偏低。如果仅有的那几条相关序列在 PDB 里也没有结构,情况更糟。

但要看清它的另一面,这也是原文明说的:即使 PDB 里一条相关结构都没有,只要这个序列有几千个亲戚,AF2 照样能预测。它需要的是序列,不是已解出的结构。 这句话直接解释了上一节「新折叠」为什么可能——需求是序列丰度,不是结构先例。

4. 构象变化

蛋白质干活时会变构象,而 PDB 里只有少数蛋白记录过多种构象。AF2 默认设计成输出静态结构,也就是一张结构快照,所以它抓不住构象变化。

原文图 6 的例子是己糖激酶(hexokinase,Q96Y14):它在有糖时和无糖时采取明显不同的构象(糖结合态 PDB 2E2Q,无糖态 2E2N),而 AF2 的预测对齐的是无糖态——无论视觉比对还是 RMSD 数值都能看出来。原因很直白:它不知道有糖这回事(见下一节)。

不过原文留了个口子:研究者发现用某些技巧(tricks) 可以「逼」AF2 输出同一个序列的另一种构象,详见课程后面「Advanced modelling and applications」那节。也就是说,构象信息部分藏在模型里,只是没有直接的出口。

四、What AlphaFold2 can’t do:它根本不做

这一列是架构性缺席,不是精度问题。

  • 不知道任何与蛋白相互作用的其他分子:核酸、小分子辅因子、离子、其他非蛋白组分,一律不在它的感知里。
  • 没被设计来处理翻译后修饰(post-translational modifications)。
  • 不能建模游离核酸的结构
  • 不知道膜平面:因此跨膜蛋白的跨膜域和其他域之间的相对朝向它摆不对。但这个错误通常会被 PAE(Predicted Aligned Error,预测对齐误差,衡量两个残基相对位置的把握)暴露出来——它不确定的时候会告诉你。

还有一个值得单独记住的怪现象:原文说 AF2 在配体/离子并不存在时,也常常预测出结合态(ligand- or ion-bound form)的样子。这其实和己糖激酶的例子互为两面——它不知道配体在不在,所以有时落在无配体构象、有时落在有配体构象,取决于训练数据里那个家族的模式偏向,而不是取决于事实上有没有那个分子。无声的错误才危险,所以必须配合置信度读结果。

五、原文收尾的那张表

AlphaFold2 predictsStruggles to predictDoesn’t predict
单条蛋白链;蛋白多聚体;多亚基蛋白-蛋白复合物同一序列的多种构象;点突变效应;抗原-抗体相互作用蛋白-DNA/RNA 复合物;核酸结构;配体与离子结合;翻译后修饰;跨膜域的膜平面

六、读这张表的一条判据

三列不是三个难度档,而是三种性质:第一列是训练分布之内;第二列是在分布边缘、靠模式和统计硬撑(所以随数据丰度起伏,也常被置信度分数提前预警);第三列是根本不在输入/输出空间里(所以不存在「多给点数据就变好」,只能改架构)。

延伸一句(超出本页范围,但你已经知道):第三列正是 AlphaFold 3 要填的——它转向全原子(all-atom)并纳入核酸、配体、离子和修饰;而第二列里「点突变效应」后来另开了 AlphaMissense。两者都是扩展边界,不是修 bug,这个判断和本页开篇那条原则是自洽的。

上一节:AlphaFold 是什么 · 下一节:AlphaFold2 的预测是怎么被验证的? · 课程总览