郭震 AI公众号:郭震AI

实时 AI 消息

英伟达联合谷歌 DeepMind 等机构,开源 2800 余种病毒的蛋白复合物结构

英伟达宣布加入由谷歌 DeepMind、EMBL-EBI 等机构组成的联盟,公开释放超过 2800 种病毒的蛋白质复合物预测三维结构,并将其纳入 AlphaFold 数据库供全球科学家免费使用。这批结构由 AlphaFold2 结合英伟达 BioNeMo 推理运行时生成,其中约三成蛋白质相互作用此前从未被科学界记录,被视为下一次大流行来临前的知识储备。

发布时间
英伟达联合谷歌 DeepMind 等机构,开源 2800 余种病毒的蛋白复合物结构
图源: blogs.nvidia.com

英伟达宣布加入一个由全球多家科研机构组成的联盟,与谷歌 DeepMind、欧洲分子生物学实验室下属的欧洲生物信息研究所(EMBL-EBI)等伙伴一起,公开释放超过 2800 种病毒的蛋白质复合物预测三维结构。这些数据通过 AlphaFold 数据库向任何地方的科学家免费开放,目标是在下一次大流行到来之前,先把结构生物学的知识底稿存下来。

据英伟达博客介绍,数据集中的结构由 Google DeepMind 的蛋白质折叠预测模型 AlphaFold2 推算得出,并使用英伟达 BioNeMo 推理运行时进行优化,从而把推理规模扩展到数千个病毒蛋白质组,逐个预测其中编码的复合物,也就是彼此相互作用的一群蛋白质。

除了数据本身,英伟达还开源了用于生成本次数据集的 BioNeMo Structure Prediction Pipeline(结构预测流水线)。这是一条 GPU 加速的工作流,研究者可以把它用在自己的研究目标上,从蛋白质序列一路走到预测三维结构,而不必从零搭建推理链路。

数据的一个重要发现是新颖性:本次加入数据库的蛋白质相互作用中,约有三成是全新的,即从未被记录在蛋白质数据库(Protein Data Bank,实验测定蛋白质结构的主要存储库)中的相互作用形态。这意味着生物学界多出了一批可以直接探索、并用于生成新知识的对象。

为什么结构如此关键?大多数蛋白质并不单独工作,它们会组成复合物来完成复杂功能,而这些复合物往往正是疫苗或药物需要瞄准、以破坏病毒功能的目标。当年正是理解了新冠病毒刺突蛋白的三维结构,疫苗设计才有了基础;而对其他数千种病毒,这类结构知识至今仍然缺失,本次数据集开始填补这部分空白。

在方法层面,传统的结构解析需要把蛋白质结晶后再用 X 射线照射,单个结构可能耗时数年、花费数千美元;经过英伟达 GPU 优化的 AlphaFold2 则能在几分钟内给出一个预测结构,并支持批量计算,科学家随后可以用实验手段验证高置信度的预测结果。本次工作中,团队系统地梳理了已知能感染人类的病毒家族,覆盖范围从普通感冒病毒到 Mpox 这样的新发威胁。

这一联盟的参与者包括流行病防范创新联盟(CEPI)、EMBL-EBI、谷歌 DeepMind、英伟达、首尔大学、成均馆大学、瑞士生物信息学研究所和格拉斯哥大学。数据集释放的时间点,正好与本周在纽约举行的、由世界经济论坛召集的联合国大会流行病预防、准备与应对会议重合;AlphaFold 数据库目前累计已收录超过 2.6 亿个蛋白质与蛋白质复合物预测,覆盖几乎全部已编目的已知蛋白质。

参与者的表态点出了紧迫性。英伟达数字生物应用研究科学团队负责人 Chris Dallago 称这个数据库是“假设生成的引擎”;格拉斯哥大学分子病毒学教授 Joe Grove 则说,他们的做法是提前把知识囤起来。全球发展中心的分析估计,到 2050 年,全球遭遇一场与新冠同等严重的大流行概率约为 50%——这也意味着,开源结构数据的价值不只在科研效率,更在公共卫生的备战能力。

为什么重要

开源数据集加上开源生成流水线,把过去每个结构耗时数年、花费数千美元的解析过程,压缩为可批量运行的分钟级预测,明显降低了资源有限地区科研团队的参与门槛。对公共卫生而言,这相当于在疫情发生之前先建立一份可检索的病毒结构底稿,有望缩短从确认病原体到锁定疫苗与药物靶点的时间。

微博邮件

NVIDIAGoogle DeepMindOpen SourceLife Sciences
返回实时消息

附近消息

全部