案例库 · 研发与科研 · 技术决策 · 2018–2021
AlphaFold 从序列预测蛋白质形状,而非测量
DeepMind 的 AlphaFold 解决了长达50年的蛋白质折叠问题,通过序列以近原子精度预测三维结构。
Google DeepMind
那一手
蛋白质的功能取决于其三维形状,而仅仅知道序列并不能告诉你形状。实验测定一个结构可能需要一个研究团队数月到数年,这就是为什么尽管有数十亿蛋白质序列,已知的独特蛋白质结构只有约10万个。
DeepMind 的 AlphaFold 以计算方法攻克了这个问题。它使用科学家已经解析出的结构进行训练,并以进化作为信号:共享共同祖先的序列必须以相似方式折叠,所以多序列比对包含关于蛋白质中哪些部分在空间上邻近的信息。
然后,该网络仅从序列就能生成每个原子的三维坐标。在盲测 CASP14 评估中,它对大多数目标的预测与实验结构相当,并远超所有先前的计算,几分钟内完成可能需实验室数年的事情。
这次胜利并非单纯追求更大的模型;关键在于将物理和进化知识编码进架构,然后让它泛化到大量未见过的蛋白质空间中。
为什么管用
- 实验结构测定是生物学中最慢、最昂贵的步骤之一,所以用预测替代它改变了可研究规模。
- 多序列比对让进化替代了测量,为模型提供超越少数已知结构的大型私人训练信号。
- 该模型解决的是通用任务,所以即使对从未测量过的类似结构也能工作。
- 近原子精度足以实用,将结构转变为常规输入而非稀缺资源。
值了多少预测形状,不要逐一测量神来之笔
可以搬走什么
当获取真实数据的成本高昂时,构建能够泛化的模型——从少量样本中学习规律,而不是为每个新案例重复测量。
后来呢
AlphaFold 的结构发布了几乎整个已知蛋白质宇宙,开放数据库成为药物发现、基因组学和疾病研究的标准工具。它的方法终结了一个长达50年的开放问题,并展示了一个精心设计的深度网络能从有限而昂贵的数据中提取通用物理规律。
资料来源
发现哪里写错了?告诉我们。