Cell 重磅发布!腾讯AI实验室姚建华/杨帆&中南大学李敏团队开发突破性AI框架,首次实现基因扰动与化学药物扰动的统一建模
| 导读 | 它将传统的、与细胞状态无关的虚拟筛选升级为一个同时考虑分子关系和上下文感知表型后果的统一框架,有望在药物发现、机制研究和精准医学中发挥重要作用。 |
近日,腾讯AI实验室姚建华/杨帆&中南大学李敏团队在国际顶级期刊《Cell》发表一项重磅研究成果:研究团队推出名为UniPert-G2CP的两阶段深度学习框架,首次实现了基因扰动与化学药物扰动的统一建模,为人工智能虚拟细胞(AIVC)的构建和精准医学的发展提供了全新范式。

图形摘要
破解三大瓶颈:从分子表征到表型预测
随着高通量筛选技术的发展,科学家们能够通过基因编辑和化合物处理等方式,大规模观察细胞在不同干预下的响应变化。然而,遗传筛选和化学筛选之间存在着天然鸿沟:
其一,筛选规模不匹配。基因筛选可以一次性针对全基因组约2万个基因进行并行测试,而化学筛选受限于物理孔板格式,即使最大规模的化合物图谱也只覆盖数千种化合物,远不及理论化学空间。
其二,分子模态差异巨大。基因扰动涉及核酸/氨基酸序列,化学药物则是小分子结构,两者的数值化表示方式截然不同,难以在同一语义空间中建立联系。
其三,细胞异质性建模困难。不同细胞环境下,同一扰动可能产生迥异的表型效应,传统模型往往被共性模式主导,忽略了关键的上下文特异性信号。
在此背景下,UniPert-G2CP正是针对这些挑战而生。
两大核心技术:UniPert + G2CP
第一阶段:UniPert——统一的多模态分子表征学习
UniPert采用对比学习策略,将蛋白质(基因靶点)和小分子药物映射到同一个共享语义嵌入空间。
-
对于小分子:利用扩展连通性指纹(ECFP)编码分子结构特征;
-
对于蛋白质:结合大型蛋白质语言模型与传统多序列比对方法,通过图神经网络捕捉全局上下文特征和局部保守基序模式;
-
跨模态对齐:基于超过5.3万对已知化合物-靶点相互作用数据,将功能相关的基因与药物在空间中拉近。
结果显示,UniPert在药物作用机制分类、蛋白质家族聚类等方面显著优于现有方法。
第二阶段:G2CP——从基因到药物的迁移学习
G2CP的创新之处在于“先学基因,再学药物”。具体而言:
-
预训练阶段:利用系统性的CRISPR基因筛选数据(约5000个基因),让模型学习不同细胞环境下的遗传背景和响应模式;
-
微调阶段:用有限的化学筛选数据(约1000种化合物)进行适配,使模型掌握药物响应的动态特征。
这种策略巧妙地利用了基因筛选数据丰富、成本低的优势,弥补化学筛选覆盖不足的短板。在LINCS转录组数据集上的验证表明,仅使用20%的化学训练数据时,G2CP相比无预训练模型实现了375.4%的性能提升。
揭示药物反应的细胞特异性
研究团队进一步利用UniPert-G2CP,在五种癌细胞系中生成了包含4994个基因和7860个小分子的“扰动因果空间”,并进行了联合分析。
一个引人注目的案例是雌激素受体(ER)激动剂。分析显示,ER激动剂在乳腺癌细胞MCF7中表现出最高的因果一致性,这与ER阳性乳腺癌的临床特征高度吻合。进一步的功能解读揭示了ESR1突变如何导致内分泌治疗耐药,涉及MYC相关通路、DNA修复、上皮-间充质转化等多个耐药相关程序。
研究意义与未来展望
UniPert-G2CP的发布标志着计算生物学在因果建模领域迈出了关键一步。它将传统的、与细胞状态无关的虚拟筛选升级为一个同时考虑分子关系和上下文感知表型后果的统一框架,有望在药物发现、机制研究和精准医学中发挥重要作用。
该框架具有良好的模块化扩展性。未来可整合DNA、RNA等更多生物序列语言模型,以及蛋白质组学、表观基因组学等多组学数据,进一步逼近真正意义上的人工智能虚拟细胞,加速了人工智能虚拟细胞的实现,并拓展了AI赋能精准医学的潜力。(转化医学网360zhyx.com)
原文链接:
https://www.cell.com/cell/fulltext/S0092-8674(26)00654-9
【关于投稿】
转化医学网(360zhyx.com)是转化医学核心门户,旨在推动基础研究、临床诊疗和产业的发展,核心内容涵盖组学、检验、免疫、肿瘤、心血管、糖尿病等。如您有最新的研究内容发表,欢迎联系我们进行免费报道(公众号菜单栏-在线客服联系),我们的理念:内容创造价值,转化铸就未来!
转化医学网(360zhyx.com)发布的文章旨在介绍前沿医学研究进展,不能作为治疗方案使用;如需获得健康指导,请至正规医院就诊。
责任声明:本稿件如有错误之处,敬请联系转化医学网客服进行修改事宜!
微信号:zhuanhuayixue
腾讯登录
还没有人评论,赶快抢个沙发