本节要点
- AF2 的定位不是实验方法的对手,而是起点:辅助结构解析、帮助解读低分辨率数据、加速结构研究、提供可检验假设;
- 九个案例几乎都不是「跑一次 AF2 就出结论」,每个案例背后都站着一种正交实验方法;
- 在蛋白质工程与设计里它的角色变成设计工具(当评分器、做质检),而边界仍由训练数据与任务难度共同决定。
核心论点:AF2 不是实验方法的对手,是起点
原文第一段就把立场钉死了:not intended as a rival to experimental methods。它给出四种作用——辅助结构解析、帮助解读低分辨率数据、加速结构研究、提供可检验假设(testable hypotheses)去指导生化与细胞实验。
这句话的实操含义是:后面九个案例,几乎没有一个能「跑一次 AF2 就出结论」。每个案例右边都站着一种正交实验方法。AF2 改变的是实验从哪里开始,不是实验要不要做。
一、结构生物学(受冲击最大的领域)
X 射线晶体学:分子置换(Molecular Replacement, MR)
晶体学有个老瓶颈叫相位问题——探测器只测得衍射强度,相位信息丢失,而傅里叶反变换没有相位做不了。MR 的思路是拿一个已知的相似结构当初始猜测,去解出新结构的相位。AF2 模型正好能当这个「初始猜测」,而且能解得出来本身就是检验:MR 成功意味着模型与真实晶体结构足够接近。
核孔复合物(NPC)
铺在核膜上的「海关大门」,约 1000 个核孔蛋白、约 30 种类型拼装。原文引用 Mosalaganti et al. 2022,说 AF2 参与后解析了人类 NPC 的约 90%。文中配图就是 PDB 7R5J:
可拖动旋转、滚轮缩放:人类核孔复合物,PDB 7R5J(原文 Figure 12)。
Mce1
结核分枝杆菌用来从宿主细胞搜刮营养的蛋白(Chen et al. 2023)。这个案例的价值不在技术难度,而在于 AF2 直接服务一个医学问题——病原体怎么偷宿主的营养。
与 XL-MS 的相互成就
交联质谱(XL-MS)给出的是距离约束;AF2 帮它解读这些距离,它反过来给 AF2 最薄弱的环节——复合物界面——提供实验验证。文中两个例子:四膜虫纤毛蛋白的结构与定位(McCafferty et al. 2023);人类细胞一次拿到 28,910 个独特残基对,横跨 4,084 个独特蛋白、对应 2,110 个独特蛋白-蛋白相互作用(Bartolec et al. 2023)。
二、用预测结构指导分子与细胞生物学
这一段的主线是「从结构到假设」:
- 突变分析:把致病突变位点投到结构上看落在哪儿。落核心疏水区 → 破坏折叠;落界面 → 破坏结合;落催化残基旁 → 影响活性。结构在这里的作用是一个分类突变后果的坐标系。
- PET 降解酶筛选:塑料降解这个大问题下,研究者用 AF2 帮助识别 74 个潜在 PET 降解酶并刻画三维结构与机制(Erickson et al. 2022)。关键词是「早期、低成本评估」——先在计算里收窄候选清单,再送进湿实验。
- PINK1 与帕金森病:PINK1 突变致常染色体隐性早发型帕金森病。AF2 预测的人 PINK1 结构提供了证据:人和昆虫 PINK1 用的是同一套机制(Gan et al. 2021)。于是可以借研究得更透的昆虫同源体来理解人类致病突变。注意原文措辞是 evidence 和 model,不是结论。
- 蛋白-蛋白相互作用:酵母研究识别出 106 个此前完全未知的组装体,另有 806 个存在但从未被结构表征(Humphreys et al. 2021)。DONSON 那个例子更完整:用 AlphaFold-Multimer 做小规模 in silico 筛选,提示 DONSON 催化复制型 CMG 解旋酶组装的最后一步——把辅因子 GINS 递送上去,随后被结构-功能分析证实(Lim et al. 2023)。这是「计算提假设 → 湿实验证实」的完整闭环。
三、蛋白质工程与设计
这一节最有意思,因为 AF2 的角色变了——从预测器变成设计工具。
- 分子注射器:细菌 PVC(发光杆菌毒力盒)本来是把毒素打进昆虫细胞,被改造成往人类细胞递送治疗蛋白的工具。负责「打谁」的尾丝蛋白针尖完全没有实验结构可用,AF2 就是用来指导这部分的改造(Kreitz et al. 2023)。
- 对称组装体的 hallucination:团队先设定目标对称形状,随机生成序列后在 AF2 网络里迭代优化,直到 AF2 认为它能折成目标形状——把 AF2 反向当评分器。造出十个做实验,预测与实验结构的平均 RMSD 是 0.6 Å(Wicky et al. 2022)。
- 光合 maquette:模仿光合作用设计捕获太阳能的人工支架蛋白,用 AF2 验证工程化变体的结构(Ennist et al. 2022)。角色是质检,不是设计——这其实是工程实践里最日常的用法。
三个值得留意的弦外之音
第一,四种作用不是并列的。 「提供可检验假设」是最普遍的用法,另外三种(辅助解析、解读低分辨率数据、加速研究)都集中在结构生物学这一个领域内。
第二,0.6 Å 这个数字要小心读。 它出现在「人造蛋白」的语境里,和两个实验结构之间的固有差异量级相当——说明这个精度已经是方法层面的天花板,而不是这批设计特别走运。
第三,原文不会告诉你的是边界。 NPC 之所以是 AF2 的高光案例,很可能因为核孔蛋白富含重复的螺旋结构,而螺旋相对好预测。同样的招数换到膜蛋白、内在无序区、配体结合态,未必成立。这正好接回你前面学的 《强项与局限》——训练数据与任务难度共同决定边界。
整章的逻辑链是这样的:可信吗(CASP 盲测 + 四种独立实验)→ 可信到什么程度(置信度)→ 拿它做什么(本页)。
上一节:AlphaFold 2 的预测有多准? · 课程总览