原文:https://www.ebi.ac.uk/training/online/courses/alphafold/validation-and-impact/how-have-alphafolds-predictions-of-protein-structure-been-validated/

本节要点

  • CASP14(2020)盲测断层式夺冠,是「它真的行」的第一个硬证据;
  • 之后四种结构生物学方法在四种物理状态下交叉验证:晶体、冷冻包埋、溶液、活细胞;
  • 最反直觉的是 NMR:预测更像溶液结构而不像晶体结构,说明它学到的不是晶体里的一张快照。

上一节讲的是“训练数据的边界决定了它能做什么”,这一节回答的是另一个问题:AlphaFold2 预测出来的结构,凭什么说它是真的? 文章给的答案分成两条线:先在 CASP 竞赛里被盲测证明,再被多种独立的结构生物学实验反复验证。

一、AlphaFold 在 CASP 中的成功

CASP 是什么,为什么它算数

CASP(Critical Assessment of Structure Prediction,结构预测关键评估)从 1994 年开始,每两年办一次,任何人都可以参加

它的方法学关键在这一句:待测蛋白的结构已经被实验解出来了(X 射线晶体学、NMR 或 cryo-EM),但在评估结束前不公开。参赛者提交预测后,组织方拿预测去和这些实验结构比对。

这才是它作为“考试”的价值——盲测。AlphaFold2 不可能在训练数据里见过这些结构(很多是“刚解出来、还没进 PDB”的),所以成绩好坏没法靠记忆条目糊弄过去。这也解释了为什么 CASP 的名次在结构生物学界分量这么重:评估方是独立的,题目是全新的。

CASP14(2020):断层式夺冠

原文 Figure 7:CASP14(2020)累计得分最高的十个条目,AlphaFold2 遥遥领先。

Google DeepMind 在 2020 年用 AlphaFold2 参赛,“以很大的差距超过了所有其他参赛者”。

然后是这篇文章里最有信息量的一组数字:

  • 在此之前,整体结构预测精度用 GDT_TS(Global Distance Test Total Score,全局距离测试总分)衡量时,只到过 60 左右
  • AlphaFold2 超过 90

GDT_TS 是 0–100 的分数,衡量的是预测结构和实验结构“对得上”的程度,越高越吻合。原文没有展开它的算法,补充一句实现细节:它通常是在 1、2、4、8 Å 这几个越来越宽松的距离阈值上,分别统计落进阈值内的残基比例,再取平均——所以它对局部偏差不那么苛刻,反映的是整体骨架是否摆对。

60 到 90 不是“进步了一点”,是跨过了一个台阶:这个分数意味着预测结构已经贴近实验解出来的结构。CASP 的组织方因此宣告蛋白质折叠问题 “基本解决”(largely solved)——注意限定词,至少对单链蛋白而言

原文 Figure 8:历年 CASP 的整体成功率曲线,2018 和 2020 两次跳升是被 AlphaFold 推上去的。

CASP13(2018)的对照:为什么那一次不算解决

DeepMind 2018 年就用早期版本的 AlphaFold 参加了 CASP13,拿了第一,但优势很小。而且那些预测的精度不够高,所以当时没有人认为折叠问题解决了

这个对照值得记住:2018 到 2020 的跃迁是架构级别的,不是调参调出来的。同样是 DeepMind、同样是 CASP、同样拿第一,但只有 2020 那一次改变了领域对问题性质的判断。

CASP15(2022):DeepMind 没来,但满场都是它

原文 Figure 9:CASP15(2022)的最高分条目,排名靠前的全部基于某个版本的 AlphaFold2。

2022 年的 CASP15,Google DeepMind 没有直接参赛。但所有排名靠前的团队,用的都是 AlphaFold2 的修改版或定制版

原因就是文章里那句关键的因果:因为 Google DeepMind 把 AlphaFold 的源代码开源了,其他研究者才能在它上面继续做,有些情况下还做到了比官方标准版更好(引了 Elofsson 2023、Kryshtafovych et al. 2023)。

图里隐含的信息量其实很大:一个模型变成了一个生态。竞赛的第二名以后不再是“另一个模型”,而是“同一个模型的另一种改法”。

二、后续来自结构生物学的证据

为什么 CASP 之后还要验证

CASP14 里 AlphaFold2 成功了,但它预测的是几十个蛋白。自然界里的蛋白质有几百万种

几十个样本、而且都是“适合做结构解析的靶点”,能不能外推到全空间?所以文章接下来列的是:后续实验者用各种方法继续给这个软件“加考”。

下面四条证据线,注意每一条都用了独立于 CASP 的方法论,而且覆盖了蛋白质的不同物理状态——这是它们能互相补强的原因。

证据一:X 射线晶体学里的分子置换

结构生物学家发现,AlphaFold2 产出的结构(或者是其中定义良好的部分,比如某个结构域)很适合当作分子置换的搜索模型(Barbarin-Bocahu & Graille 2022;McCoy et al. 2022;Millán et al. 2021)。

这里需要补一个背景概念:X 射线晶体学有个相位问题——衍射实验测到的是振幅,相位信息丢了,而算电子密度图两样都要。分子置换(molecular replacement, MR)就是解相位的一条常用路子:拿一个已知的、与目标相似的蛋白结构当“搜索模型”,把它在晶胞里试各种旋转和平移,找到位置后用它算出初始相位,再去解出目标结构。

所以这个证据的力度在于:如果 AlphaFold2 的模型能成功当搜索模型把结构解出来,就说明它跟真实的晶体结构足够接近——不接近的话,MR 是解不出来的。

证据二:冷冻电镜的电子密度图

AlphaFold2 的结构能很好地拟合进实验得到的 cryo-EM 电子密度图(Chojnowski 2022;Giri et al. 2023)。

这里说的是另一种验证方式:不是拿模型去解结构,而是反过来,看模型的原子坐标能不能“装进”实验密度图里。同样指向预测与实验数据的一致。

证据三:NMR——最反直觉的一条

前面两条都还有个潜在质疑:AlphaFold2 主要在蛋白质晶体数据上训练,它是不是只会“往晶体态上靠”?

于是第三条证据用 NMR(Nuclear Magnetic Resonance,核磁共振)来检验,因为 NMR 测的是溶液状态下的蛋白,不是晶体。用 AlphaFold2 模型去解释溶液 NMR 数据,绝大多数情况下拟合极好(Fowler & Williamson 2022;Tejero et al. 2022)。

文章点出了这条证据的真正含义:这说明 AlphaFold2 并没有那么偏向晶体态——尽管它主要是吃晶体数据长大的。

页面还给了一个具体例子(原文 Figure 10):一个特化的酰基载体蛋白(acyl carrier protein)。AlphaFold 的预测(AlphaFold ID: AF-Q6N882-F1)更像 NMR 解出的结构(绿色,PDB ID: 2LPK),而不那么像对应的 X 射线晶体结构(灰色,PDB ID: 3LMO)(Tejero et al. 2022)。

这个例子有点反常识——一个“晶体数据喂出来”的模型,预测结果反而更接近溶液结构而不接近晶体结构。它想说明的是:AlphaFold2 学到的是某种更接近蛋白质本征构象倾向的东西,而不是死记晶体里的那一张快照。

原文 Figure 10:特化的酰基载体蛋白。绿色是 NMR 解出的结构(PDB ID: 2LPK),灰色是对应的 X 射线晶体结构(PDB ID: 3LMO),蓝色是 AlphaFold 的预测——它与绿色明显更贴合。

证据四:交联质谱

交联质谱(cross-linking mass spectrometry)的思路是:用化学交联剂把空间上彼此靠近的残基对共价连起来,酶切后上质谱,就能知道哪些残基曾经挨在一起——本质上是拿到一批距离约束

结果:对单条蛋白链蛋白-蛋白复合物,AlphaFold2 的预测在原位(in situ) 条件下大多数是正确的(Bartolec et al. 2023;McCafferty et al. 2023)。

“in situ”这个限定词是这条证据的独门价值:它测的是细胞内的生理环境,既不是晶体也不是纯化后的溶液。四条证据线到这里就凑齐了四种状态——晶体、冷冻包埋、溶液、活细胞环境。

文章的小结

把这些证据合起来看,文章给了两个结论:

第一,这些数据验证了 AlphaFold2 的准确性
第二,它们提示 AlphaFold2 的模型可以用于多种研究应用

一句话概括这一页:CASP 用盲测证明了它“能考高分”,四种结构生物学方法则分别在不同的物理状态下证明了它“考出来的答案是接近真相的”。下一节接着问的是更细的问题——这个答案到底有多准、误差有多大、哪些部分不能信。

上一节:AlphaFold 2 的强项与局限 · 下一节:AlphaFold 2 的预测有多准? · 课程总览