Nature述评|西湖大学医学院郭天南团队:如何构建虚拟细胞?以酵母为例

阅读量 :5

7月1日,西湖大学医学院郭天南团队联合多家国际国内研究机构在Nature发表了一篇关于虚拟细胞构建路径的述评文章。文章总结了西湖大学组织的多次国际研讨会的思想碰撞成果,提出一套构建虚拟细胞的系统性理论框架,旨在通过AI建立能够理解、模拟、预测细胞行为并实现理性重设计的AI智能体系统。文章以酵母为例,但是这套理论框架也可以适用于人体、动物、植物、微生物等各类细胞。

该述评提出了一个“虚拟酵母(virtual yeast)”的总体框架。以酿酒酵母(Saccharomyces cerevisiae)为模型对象,系统整合先验生物学知识、细胞空间架构和动态扰动状态,建立既具生物学约束、又具预测能力的细胞级AI智能体。文章提出了一套可验证、可迭代、可迁移的虚拟细胞架构设计与实现路径。这一框架强调,虚拟细胞不是简单的“数字复制品”,也不是追求一次性复刻所有分子细节的理想化数字孪生,而比较现实的目标是围绕明确生物学问题建立可预测、可解释、可实验验证的功能模块,让模型能够帮助科学家理解细胞如何运行、预测细胞在扰动下如何响应,并指导下一步实验和应用设计。

论文地址:

https://www.nature.com/articles/s41586-026-10574-9

01 基于AI智能体架构的虚拟细胞系统

研究团队首先将虚拟酵母定义为一个AI驱动的智能体系统,而不是单一模型。真实细胞内部包含遗传调控、代谢网络、细胞器通讯、应激响应和蛋白质降解等多层级过程,如果把所有问题都交给一个黑箱模型处理,不仅难以解释,也难以验证。

为降低细胞复杂性,研究团队将酵母细胞划分为八个功能模块,包括膜系统、遗传枢纽、线粒体能量代谢、胞质代谢、生物合成网络、细胞骨架、应激处理器以及降解系统(图1)。每个模块由针对特定生物功能的数据和算法驱动,作为相对独立的计算单元运行。

这些模块在统一框架中协同工作,通过信息交换共同模拟细胞行为(图1)。系统上层引入由大语言模型支持的规划与推理机制,用于理解研究问题、拆解分析任务,并在不同功能模块之间进行选择和协调:当研究者提出一个问题时,系统可以判断需要调用哪些功能模块、整合哪些数据类型、采用哪些机制约束,从而实现跨功能、跨模态的协同推理。这种以功能为中心组织模型的方式,有助于提高虚拟细胞的可解释性和计算可行性。

图1 虚拟酵母AI agent的概念路线图

02 功能建模与AI方法框架

在方法层面,论文提出通过结合表征学习模型与生成模型来构建“功能智能”(图2)。表征学习模型用于从基因组、转录组、蛋白组、代谢组、显微成像和文献知识中提取稳定的生物学表示;生成模型则用于推断未观测状态、模拟动态变化、预测扰动响应,并在实验数据不足时生成具有生物学约束的候选状态。

支撑这一系统的,是三个关键数据支柱(图2)。第一是先验知识,包括基因、蛋白质、代谢网络、蛋白互作、调控通路和已有机制模型;第二是空间结构信息,包括细胞核、线粒体、内质网、液泡、膜系统和蛋白复合体等亚细胞架构;第三是动态状态,即细胞在遗传、化学、环境扰动下产生的多组学动态响应。

一个理想的完整的虚拟细胞,不能只知道细胞“有什么”,还要知道这些分子“在哪里”,更要知道当环境变化、基因被扰动或化合物加入时,细胞“会怎样变化”。不同类型的数据通过专门模型进行编码并统一对齐,形成跨模态表征;生成模型进一步用于重建细胞状态并预测变化趋势。同时,系统引入代谢约束、知识图谱、因果推断和生物物理规律,以提升模型预测的生物学合理性。

图2 虚拟酵母每个功能模块的结构框架

03 细胞的空间结构建模

文章将细胞的空间结构视为虚拟细胞建模的关键基础。细胞内部并不是分子随机混杂的空间,许多生命过程都依赖特定位置和结构:基因在细胞核中调控表达,线粒体参与能量代谢,内质网和高尔基体参与蛋白质加工与运输,液泡和蛋白酶体负责降解与回收。

因此,理想的虚拟细胞需要把空间信息纳入模型。相关数据来源包括空间转录组、空间蛋白组、荧光显微成像、超分辨成像、冷冻电镜断层扫描和体积电镜等。这些技术分别在不同分辨率和通量水平上提供细胞内部结构信息。高分辨率数据可提供精确结构约束,高通量数据则用于捕捉群体层面的变化。

在建模方面,生成式方法可用于从不完整或低分辨率数据中重建更完整的空间结构,从而形成统一的空间表示框架。这个空间层为后续动态建模提供了必要的结构约束,也让虚拟细胞不再只是分子清单,而是具有细胞组织逻辑的预测系统。

04 细胞的动态响应与主动学习

与静态结构相对应,文章强调需要刻画细胞在时间维度上的动态变化。细胞不是静止的,它会随着营养、温度、药物、环境压力和遗传改变不断调整自身状态。研究团队系统梳理了基因扰动、化学扰动和环境扰动三类数据来源,这些数据揭示了细胞在不同条件下的响应模式。

尽管酵母已有大量扰动数据,但当前研究仍存在条件覆盖不足、时间分辨率有限、组合扰动空间过大以及单细胞精度不足等问题。因此,论文提出引入主动学习策略,将模型预测与实验设计结合起来(图3)。

具体而言,模型首先预测不同扰动条件下的细胞响应,并评估自身不确定性;随后优先选择信息增益最大的实验条件进行验证;自动化平台执行实验并产生新的蛋白组、代谢组、表型和生长数据;这些新数据再用于更新模型。这一闭环过程类似今天ChatGPT等AI系统的持续迭代:模型不是一次性完成,而是在数据、反馈和训练中不断升级。

图3 闭环主动学习驱动虚拟酵母的更新迭代

05 代谢与合成生物学模块示例

作为具体实现示例,文章详细介绍了代谢与合成生物学模块的设计。该模块整合基因组、转录组、蛋白组、代谢组和生长曲线等数据,用于预测代谢通量、代谢物水平及其在不同遗传和环境条件下的变化(图3)。

在计算上,该模块采用混合架构:一方面利用预训练模型提取遗传与环境信息的表示,另一方面通过生成模型预测蛋白质和代谢物水平;与此同时,引入基因组规模代谢模型作为约束,以保证预测结果符合基本生物化学规律。这一模块的目标不仅是解释已有数据,还包括根据模型预测反向设计遗传或环境条件,以实现特定代谢产物的优化。

这也是虚拟酵母最容易被公众理解的实用价值之一。酵母早已不是实验室中的单一模式生物,它本身就是重要的工业生物生产底盘。从面包、啤酒、葡萄酒到白酒等传统发酵体系,酵母都参与了酒精和风味物质的形成;在现代合成生物学中,酵母还可用于生产药物前体、食品酶、氨基酸、有机酸、香精香料、营养补充剂相关成分,以及化妆品或保健品中的多种活性分子。

虚拟酵母的意义在于,它有望把这些生产过程从“不断试错”推进到“先预测、再设计、再验证”。如果模型能够预测怎样改造菌株、调节培养条件或组合扰动,就能更高效地提升目标产物产量,降低研发成本。

06 项目组织与实施路径

在实施层面,文章提出以多学科协作的方式推进虚拟酵母开发,包括生物学、数据与技术、人工智能以及应用四个核心方向。不同团队分别负责数据生成、模型开发、实验验证及应用转化,共同构建从基础数据到预测模型、再到实际应用的完整链条。

整个项目被划分为多个阶段,从单一模块的验证出发,逐步扩展到多模块集成,最终构建完整的细胞级系统。短期阶段将重点验证代谢与合成生物学模块的预测能力;中期阶段实现2–3个细胞器系统的模块集成;长期阶段则目标是将所有功能模块整合为统一的虚拟酵母智能体。研究团队预计,实现这一目标可能需要5至10年的持续发展。

更进一步,虚拟酵母的意义还在于方法迁移。一旦在酵母中形成稳定的数据标准、模型架构和闭环实验流程,这套方法就有望迁移到其他真核细胞和更复杂的生命系统中,比如人体的癌细胞、神经细胞等。酵母是虚拟细胞研究的起点,也是一座通向更广泛AIVC系统的桥。

总结

总体而言,文章提出的是一个构建具有可操作性的AI细胞模型的系统性框架,而非追求构建一个完全精确的“数字孪生”细胞。其核心在于通过模块化设计、多模态数据整合、生成式建模以及闭环实验体系,将细胞建模从静态描述推进到可预测、可干预的层面。

虚拟酵母被视为这一方向的起点和通用蓝图。它以酵母为例,但并不限于酵母;它服务于基础生命科学,也面向工业生物制造和未来医学应用。随着自动化实验、主动学习和多模态AI模型的发展,虚拟细胞有望成为理解生命、预测生命和设计生命的重要基础设施。

该展望文章由西湖大学郭天南团队牵头,联合多家研究机构共同完成。论文第一作者是西湖大学助理研究员钱鎏佳,郭天南为通讯作者。参与单位有:西湖大学、北京大学、上海人工智能实验室、复旦大学、斯坦福大学、苏黎世联邦理工学院、多伦多大学、法国尼斯癌症与衰老研究所、中山大学、柏林夏里特医科大学、柏林健康研究所、牛津大学、马克斯·普朗克分子遗传学研究所、卢森堡大学、巴塞尔大学、清华大学、斯特拉斯堡大学、上海交通大学、深圳大学、国家蛋白质科学中心(北京)、国际智慧医学研究院(广东)、深势科技、中国科学院深圳先进技术研究院、曼彻斯特大学、威康桑格研究所、中国科学院深圳合成生物学研究院、中国科学院天津工业生物技术研究所、国家合成生物技术创新中心、欧洲分子生物学实验室、德国心血管研究中心、广州国家实验室、广州医科大学、布鲁克瑞士、武汉迈维生物科技等。课题获得国家自然科学基金、国家重点研发计划、浙江省相关科研计划、西湖大学、人体蛋白质组导航计划等多方支持。具体基金项目和致谢信息以论文正式发表版本为准。

西湖大学蛋白质组复杂科学实验室(Guomics)是依托西湖大学、西湖实验室(生命科学和生物医学浙江省实验室)和医学蛋白质组全国重点实验室成立的一个多学科交叉的AI蛋白质组学实验室。实验室长期从事蛋白质组学相关研究,联合人工智能,构建虚拟细胞,解析生物过程的原理,助力疾病诊疗。团队诚邀有志于虚拟细胞研究的优秀本科生、研究生及博士后研究人员加盟!实验室官网:guomics.com

8月3日至8日,西湖大学医学院蛋白质组复杂科学实验室主办的 Westlake AIVC Week 2026,值得你专程来一趟杭州。这不是一场传统意义上的学术会议。我们将这一周设计为 “4天硬核培训 + 2天深度研讨” 的全程沉浸式体验,邀请国内外顶尖专家共聚杭州,探索从质谱分析、空间蛋白组到AI驱动的蛋白质组学新范式。我们进一步聚焦人工智能虚拟细胞(AI Virtual Cell, AIVC),期待与你探讨:如何用AI重构我们对蛋白质网络、细胞状态和生命规则的理解。我们还面向全国(及海外)研究生、博士后、青年学者,公开征集与本次会议主题相关的论文摘要及海报,期待你的投稿。

7月1日,西湖大学医学院郭天南团队联合多家国际国内研究机构在Nature发表了一篇关于虚拟细胞构建路径的述评文章。文章总结了西湖大学组织的多次国际研讨会的思想碰撞成果,提出一套构建虚拟细胞的系统性理论框架,旨在通过AI建立能够理解、模拟、预测细胞行为并实现理性重设计的AI智能体系统。文章以酵母为例,但是这套理论框架也可以适用于人体、动物、植物、微生物等各类细胞。

该述评提出了一个“虚拟酵母(virtual yeast)”的总体框架。以酿酒酵母(Saccharomyces cerevisiae)为模型对象,系统整合先验生物学知识、细胞空间架构和动态扰动状态,建立既具生物学约束、又具预测能力的细胞级AI智能体。文章提出了一套可验证、可迭代、可迁移的虚拟细胞架构设计与实现路径。这一框架强调,虚拟细胞不是简单的“数字复制品”,也不是追求一次性复刻所有分子细节的理想化数字孪生,而比较现实的目标是围绕明确生物学问题建立可预测、可解释、可实验验证的功能模块,让模型能够帮助科学家理解细胞如何运行、预测细胞在扰动下如何响应,并指导下一步实验和应用设计。

论文地址:

https://www.nature.com/articles/s41586-026-10574-9

01 基于AI智能体架构的虚拟细胞系统

研究团队首先将虚拟酵母定义为一个AI驱动的智能体系统,而不是单一模型。真实细胞内部包含遗传调控、代谢网络、细胞器通讯、应激响应和蛋白质降解等多层级过程,如果把所有问题都交给一个黑箱模型处理,不仅难以解释,也难以验证。

为降低细胞复杂性,研究团队将酵母细胞划分为八个功能模块,包括膜系统、遗传枢纽、线粒体能量代谢、胞质代谢、生物合成网络、细胞骨架、应激处理器以及降解系统(图1)。每个模块由针对特定生物功能的数据和算法驱动,作为相对独立的计算单元运行。

这些模块在统一框架中协同工作,通过信息交换共同模拟细胞行为(图1)。系统上层引入由大语言模型支持的规划与推理机制,用于理解研究问题、拆解分析任务,并在不同功能模块之间进行选择和协调:当研究者提出一个问题时,系统可以判断需要调用哪些功能模块、整合哪些数据类型、采用哪些机制约束,从而实现跨功能、跨模态的协同推理。这种以功能为中心组织模型的方式,有助于提高虚拟细胞的可解释性和计算可行性。

图1 虚拟酵母AI agent的概念路线图

02 功能建模与AI方法框架

在方法层面,论文提出通过结合表征学习模型与生成模型来构建“功能智能”(图2)。表征学习模型用于从基因组、转录组、蛋白组、代谢组、显微成像和文献知识中提取稳定的生物学表示;生成模型则用于推断未观测状态、模拟动态变化、预测扰动响应,并在实验数据不足时生成具有生物学约束的候选状态。

支撑这一系统的,是三个关键数据支柱(图2)。第一是先验知识,包括基因、蛋白质、代谢网络、蛋白互作、调控通路和已有机制模型;第二是空间结构信息,包括细胞核、线粒体、内质网、液泡、膜系统和蛋白复合体等亚细胞架构;第三是动态状态,即细胞在遗传、化学、环境扰动下产生的多组学动态响应。

一个理想的完整的虚拟细胞,不能只知道细胞“有什么”,还要知道这些分子“在哪里”,更要知道当环境变化、基因被扰动或化合物加入时,细胞“会怎样变化”。不同类型的数据通过专门模型进行编码并统一对齐,形成跨模态表征;生成模型进一步用于重建细胞状态并预测变化趋势。同时,系统引入代谢约束、知识图谱、因果推断和生物物理规律,以提升模型预测的生物学合理性。

图2 虚拟酵母每个功能模块的结构框架

03 细胞的空间结构建模

文章将细胞的空间结构视为虚拟细胞建模的关键基础。细胞内部并不是分子随机混杂的空间,许多生命过程都依赖特定位置和结构:基因在细胞核中调控表达,线粒体参与能量代谢,内质网和高尔基体参与蛋白质加工与运输,液泡和蛋白酶体负责降解与回收。

因此,理想的虚拟细胞需要把空间信息纳入模型。相关数据来源包括空间转录组、空间蛋白组、荧光显微成像、超分辨成像、冷冻电镜断层扫描和体积电镜等。这些技术分别在不同分辨率和通量水平上提供细胞内部结构信息。高分辨率数据可提供精确结构约束,高通量数据则用于捕捉群体层面的变化。

在建模方面,生成式方法可用于从不完整或低分辨率数据中重建更完整的空间结构,从而形成统一的空间表示框架。这个空间层为后续动态建模提供了必要的结构约束,也让虚拟细胞不再只是分子清单,而是具有细胞组织逻辑的预测系统。

04 细胞的动态响应与主动学习

与静态结构相对应,文章强调需要刻画细胞在时间维度上的动态变化。细胞不是静止的,它会随着营养、温度、药物、环境压力和遗传改变不断调整自身状态。研究团队系统梳理了基因扰动、化学扰动和环境扰动三类数据来源,这些数据揭示了细胞在不同条件下的响应模式。

尽管酵母已有大量扰动数据,但当前研究仍存在条件覆盖不足、时间分辨率有限、组合扰动空间过大以及单细胞精度不足等问题。因此,论文提出引入主动学习策略,将模型预测与实验设计结合起来(图3)。

具体而言,模型首先预测不同扰动条件下的细胞响应,并评估自身不确定性;随后优先选择信息增益最大的实验条件进行验证;自动化平台执行实验并产生新的蛋白组、代谢组、表型和生长数据;这些新数据再用于更新模型。这一闭环过程类似今天ChatGPT等AI系统的持续迭代:模型不是一次性完成,而是在数据、反馈和训练中不断升级。

图3 闭环主动学习驱动虚拟酵母的更新迭代

05 代谢与合成生物学模块示例

作为具体实现示例,文章详细介绍了代谢与合成生物学模块的设计。该模块整合基因组、转录组、蛋白组、代谢组和生长曲线等数据,用于预测代谢通量、代谢物水平及其在不同遗传和环境条件下的变化(图3)。

在计算上,该模块采用混合架构:一方面利用预训练模型提取遗传与环境信息的表示,另一方面通过生成模型预测蛋白质和代谢物水平;与此同时,引入基因组规模代谢模型作为约束,以保证预测结果符合基本生物化学规律。这一模块的目标不仅是解释已有数据,还包括根据模型预测反向设计遗传或环境条件,以实现特定代谢产物的优化。

这也是虚拟酵母最容易被公众理解的实用价值之一。酵母早已不是实验室中的单一模式生物,它本身就是重要的工业生物生产底盘。从面包、啤酒、葡萄酒到白酒等传统发酵体系,酵母都参与了酒精和风味物质的形成;在现代合成生物学中,酵母还可用于生产药物前体、食品酶、氨基酸、有机酸、香精香料、营养补充剂相关成分,以及化妆品或保健品中的多种活性分子。

虚拟酵母的意义在于,它有望把这些生产过程从“不断试错”推进到“先预测、再设计、再验证”。如果模型能够预测怎样改造菌株、调节培养条件或组合扰动,就能更高效地提升目标产物产量,降低研发成本。

06 项目组织与实施路径

在实施层面,文章提出以多学科协作的方式推进虚拟酵母开发,包括生物学、数据与技术、人工智能以及应用四个核心方向。不同团队分别负责数据生成、模型开发、实验验证及应用转化,共同构建从基础数据到预测模型、再到实际应用的完整链条。

整个项目被划分为多个阶段,从单一模块的验证出发,逐步扩展到多模块集成,最终构建完整的细胞级系统。短期阶段将重点验证代谢与合成生物学模块的预测能力;中期阶段实现2–3个细胞器系统的模块集成;长期阶段则目标是将所有功能模块整合为统一的虚拟酵母智能体。研究团队预计,实现这一目标可能需要5至10年的持续发展。

更进一步,虚拟酵母的意义还在于方法迁移。一旦在酵母中形成稳定的数据标准、模型架构和闭环实验流程,这套方法就有望迁移到其他真核细胞和更复杂的生命系统中,比如人体的癌细胞、神经细胞等。酵母是虚拟细胞研究的起点,也是一座通向更广泛AIVC系统的桥。

总结

总体而言,文章提出的是一个构建具有可操作性的AI细胞模型的系统性框架,而非追求构建一个完全精确的“数字孪生”细胞。其核心在于通过模块化设计、多模态数据整合、生成式建模以及闭环实验体系,将细胞建模从静态描述推进到可预测、可干预的层面。

虚拟酵母被视为这一方向的起点和通用蓝图。它以酵母为例,但并不限于酵母;它服务于基础生命科学,也面向工业生物制造和未来医学应用。随着自动化实验、主动学习和多模态AI模型的发展,虚拟细胞有望成为理解生命、预测生命和设计生命的重要基础设施。

该展望文章由西湖大学郭天南团队牵头,联合多家研究机构共同完成。论文第一作者是西湖大学助理研究员钱鎏佳,郭天南为通讯作者。参与单位有:西湖大学、北京大学、上海人工智能实验室、复旦大学、斯坦福大学、苏黎世联邦理工学院、多伦多大学、法国尼斯癌症与衰老研究所、中山大学、柏林夏里特医科大学、柏林健康研究所、牛津大学、马克斯·普朗克分子遗传学研究所、卢森堡大学、巴塞尔大学、清华大学、斯特拉斯堡大学、上海交通大学、深圳大学、国家蛋白质科学中心(北京)、国际智慧医学研究院(广东)、深势科技、中国科学院深圳先进技术研究院、曼彻斯特大学、威康桑格研究所、中国科学院深圳合成生物学研究院、中国科学院天津工业生物技术研究所、国家合成生物技术创新中心、欧洲分子生物学实验室、德国心血管研究中心、广州国家实验室、广州医科大学、布鲁克瑞士、武汉迈维生物科技等。课题获得国家自然科学基金、国家重点研发计划、浙江省相关科研计划、西湖大学、人体蛋白质组导航计划等多方支持。具体基金项目和致谢信息以论文正式发表版本为准。

西湖大学蛋白质组复杂科学实验室(Guomics)是依托西湖大学、西湖实验室(生命科学和生物医学浙江省实验室)和医学蛋白质组全国重点实验室成立的一个多学科交叉的AI蛋白质组学实验室。实验室长期从事蛋白质组学相关研究,联合人工智能,构建虚拟细胞,解析生物过程的原理,助力疾病诊疗。团队诚邀有志于虚拟细胞研究的优秀本科生、研究生及博士后研究人员加盟!实验室官网:guomics.com

8月3日至8日,西湖大学医学院蛋白质组复杂科学实验室主办的 Westlake AIVC Week 2026,值得你专程来一趟杭州。这不是一场传统意义上的学术会议。我们将这一周设计为 “4天硬核培训 + 2天深度研讨” 的全程沉浸式体验,邀请国内外顶尖专家共聚杭州,探索从质谱分析、空间蛋白组到AI驱动的蛋白质组学新范式。我们进一步聚焦人工智能虚拟细胞(AI Virtual Cell, AIVC),期待与你探讨:如何用AI重构我们对蛋白质网络、细胞状态和生命规则的理解。我们还面向全国(及海外)研究生、博士后、青年学者,公开征集与本次会议主题相关的论文摘要及海报,期待你的投稿。
问询(中文)

公众号