原文:https://www.ebi.ac.uk/training/online/courses/alphafold/an-introductory-guide-to-its-strengths-and-limitations/what-is-the-protein-folding-problem/

本节要点

  • 理论上可能:只凭氨基酸序列就能预测蛋白质的三维结构;
  • 但极其困难:因为可能构象的数量太庞大;
  • 人工智能正好适合这个问题。

一、蛋白质折叠问题:从序列预测蛋白质结构

  • 蛋白质:一串珠子项链。
  • 氨基酸:珠子,有 20 种。

项链不会直挺挺放着,它会自己蜷成一团,变成有确定形状的三维结构。这个“蜷起来”的过程,就叫做折叠。

折叠问题主要有两个难题:

  1. 搞懂折叠是怎么发生的;
  2. 预测最终折成什么样子。

1972 年,Christian Anfinsen 拿了诺贝尔化学奖,因为他提出:在正常的生理环境下,蛋白质折成什么形状,完全由它的氨基酸序列决定。这条结论后来被叫做 Anfinsen 法则(Anfinsen’s dogma)

它的分量在于一个推论——既然序列决定结构,那只要给我序列,我应该就能把结构算出来。几十年结构生物学的研究大体证实了这一点。

二、计算挑战

问题是“能算”不等于“算得完”。文章引出第二个概念:Levinthal 悖论(Levinthal’s paradox)。

1960 年代,Cyrus Levinthal 指出:一条蛋白链理论上能摆出的构象数量极其庞大。如果真让它一个一个试过去,所花的时间长得“可以和宇宙的寿命相比”。

帮你感受一下这个规模。取一条 100 个氨基酸的链,哪怕每个氨基酸只允许 3 种摆放姿势,总组合数也有 ,约 种。每次尝试按 秒算,全部试完要 秒,也就是约 年——比宇宙年龄(约 年)还多 17 个数量级。而真实细胞里的折叠,往往在毫秒到秒的量级就完成了。所以文章那句“宇宙寿命”不是修辞,是个很保守的估计。

不过 Anfinsen 的结论还是给了动力:难归难,至少理论上存在一个高效的办法,能只靠序列找出最可能的天然结构。

三、人工智能的作用

人工智能擅长从大量数据中寻找复杂规律。研究人员可以利用已知蛋白质序列和结构的数据,训练模型学习:

  • 哪些序列片段倾向于形成螺旋或折叠;
  • 不同位置的氨基酸如何相互影响;
  • 什么样的三维排列更可能稳定。

关键点是:预测最终结构不一定要完整模拟折叠过程。

这就像知道一个物体最终会落在哪个位置,并不一定要计算它运动过程中的每一个瞬间。AI 可以直接学习“序列 → 最终结构”的关系,从而绕开 Levinthal 悖论带来的巨大计算负担。

所以,AlphaFold 这类系统的核心思想可以概括为:

  • 氨基酸序列决定蛋白质结构;
  • 蛋白质可能的构象太多,直接模拟很困难;
  • AI 通过学习大量已知结构,直接预测最可能的最终三维形状。

上一节:什么是蛋白质?我们又是如何知道它们的结构的? · 下一节:AlphaFold 是什么 · 课程总览