本节要点
- AlphaFold 是输入氨基酸序列、输出三维结构的人工智能系统,由多个神经网络与计算模块组成;
- 它从 PDB 的「序列—结构」配对数据里学规律,不依赖模板也能预测没人见过的新折叠;
- 预测时先找相似序列和共同进化信号,再据此推断哪些残基彼此靠近。
AlphaFold 是 Google DeepMind 为解决“蛋白质结构预测问题”开发的人工智能系统。
它的输入是蛋白质的一级氨基酸序列,输出是蛋白质可能形成的三维结构。蛋白质的形状通常决定它能与哪些分子结合、参与什么反应,因此预测结构对生物学、药物研发和疾病研究都很重要。
一、AlphaFold 是什么
AlphaFold2 是多组件人工智能系统
AlphaFold2 并不是一个简单的单一程序,而是由多个神经网络和计算模块组成的系统。它通过机器学习,从大量已有的“氨基酸序列—实验结构”数据中学习规律。
机器学习的基本过程是:
- 给模型大量已知蛋白质的序列和结构;
- 模型寻找序列与结构之间的统计规律;
- 输入一个从未预测过的新序列;
- 模型根据学到的规律预测它的三维结构。
因此,AlphaFold2 并不是按照一套人工写死的规则逐步计算,而是通过训练获得预测能力。
AlphaFold 不是传统的同源建模工具
传统的同源建模通常需要先找到一个结构已知、且与目标蛋白质相似的模板,然后根据模板推测目标结构。
AlphaFold 的能力更强一些:
- 它可以在没有模板结构的情况下工作;
- 它可以预测过去没有人发现过的蛋白质折叠类型;
- 它不只是把目标序列“套”到一个已知结构上。
不过,这并不意味着 AlphaFold 永远完全不使用模板。文章后面说明,AlphaFold2 在某些情况下可能会使用已知结构作为辅助信息,但它并不依赖模板才能运行。
二、AlphaFold2 如何解决结构预测问题
训练数据来自 Protein Data Bank
AlphaFold2 的重要训练数据来自 Protein Data Bank(PDB,蛋白质数据库)。
PDB 收集通过 X 射线晶体学、冷冻电镜、核磁共振等实验方法测定的生物大分子结构。每条记录通常包含两类关键信息:
- 蛋白质的氨基酸序列;
- 与该序列对应的实验三维结构。
AlphaFold2 就利用这些成对数据进行训练,让模型学习“什么样的序列通常对应什么样的空间结构”。
文章提到,PDB 当时已有超过 21.5 万条记录。这类大型数据库是 AlphaFold 能够成功的重要基础。模型并不是凭空理解蛋白质,而是从大量实验结果中提取规律。
从新序列到结构预测
当 AlphaFold2 接收到一个新的蛋白质序列时,大致会经历以下过程:
- 寻找相似序列:把新序列与许多已知蛋白质序列进行比对,形成序列比对结果。
- 寻找共同进化信息:如果两个氨基酸位置在进化过程中经常一起变化,通常意味着它们之间可能存在相互作用。例如,一个位置的氨基酸发生变化后,另一个位置也跟着变化,可能是因为两者在空间上靠近,需要共同维持结构稳定性。
- 推断空间接近关系:这些共同进化的信号可以帮助模型判断哪些残基可能彼此靠近、哪些残基之间可能形成接触,以及蛋白质链可能如何弯曲、折叠和排列。
- 生成三维结构:AlphaFold2 综合序列信息、进化信息、几何约束和训练得到的规律,生成一个三维结构预测。
上一节:什么是蛋白质折叠问题? · 下一节:AlphaFold 2 的强项与局限 · 课程总览