慢病毒 股票代码
688238
腺相关病毒 股票代码
688238
业务咨询

分层拆解“虚拟细胞”发展脉络、应用边界与核心瓶颈

时间:2026-08-03 热度: 965

如果说AlphaFold解决了“蛋白质长什么样”的问题,那么虚拟细胞要回答的是一个更复杂、更根本的问题:


"细胞在干嘛,以及如果我们干预它,会发生什么?"


这不再是一个停留在纸面上的科学幻想。虚拟细胞(Virtual Cell)的概念可追溯至1993年,当时系统生物学的先驱者们尝试以数学微分方程描述细胞周期的核心调控机制。真正的范式转变发生在2024年。Bunne等人在《Cell》杂志上正式定义了AI虚拟细胞(AI Virtual Cell, AIVC)——一个基于大规模神经网络的多尺度、多模态模型,能够跨分子、细胞和组织三个层面表示和模拟生物学行为。该定义将虚拟细胞从“手工搭建的机理方程组”重新定位为“数据驱动的通用表示学习器”,标志着从假设驱动向AI原生方法论的历史性迁移。截至2025年底,全球已有超过15个研究团队发布了面向单细胞数据的基础模型,训练数据规模从数百万到数亿细胞不等。


图1虚拟细胞发展史(Saurabh Bhardwaj. et al. arXiv 2025)


什么是虚拟细胞?


计算生物学与系统生物学致力于在硅基(in silico)环境中重构细胞系统,从而诞生了“虚拟细胞”(Virtual Cell)。


虚拟细胞的目标,远比“在计算机里画一个细胞”要宏大得多。它旨在跨越分子模态和物理尺度,预测细胞在基因突变、药物干预或环境压力下的全转录组及表型响应。想象一下:你可以在计算机里“培养”一个细胞——给它“喂”不同的药物,观察它如何反应;“敲掉”某个基因,看它会不会“生病”;甚至预测它在复杂扰动下会走向死亡还是分化。


这不是科幻电影,而是虚拟细胞正在实现的目标。


简单来说,虚拟细胞是在计算机中构建的、能够模拟真实细胞行为的数字模型。它不再是传统意义上用数学公式描述几个基因相互作用的“小模型”,而是基于海量单细胞数据,利用AI大模型训练出的“细胞数字孪生”。


图2虚拟细胞概念示意(Bunne et al., Cell 2024)


为什么现在火了?


随着高通量单细胞多组学技术(如scRNA-seq、空间转录组学)的爆发,以及生成式AI、大语言模型的飞跃,该领域在过去几年间经历了深刻的范式转移。虚拟细胞的概念可以追溯到1993年。但过去三十年,它一直停留在“用方程描述几个基因”的阶段。真正的范式转变发生在2024年前后——大模型和单细胞测序技术的交汇,让虚拟细胞从手工搭建的“小作坊”走向了数据驱动的“大工厂”。驱动力来自三个方面:


数据爆炸

细胞测序技术让科学家能以单细胞分辨率读取成千上万个基因的表达情况。今天,公开可用的单细胞数据已达数亿级别:CZ CELLxGENE Census整合了1.62亿人类细胞,Arc Institute的Virtual Cell Atlas整合了超过3亿细胞。这为训练大模型提供了"燃料"。


AI大模型的迁移


将Transformer架构应用于单细胞数据,让模型能够“理解”细胞的语言——基因表达模式。scGPT、Geneformer、scFoundation等模型相继问世,参数规模从数千万到数千亿不等。


扰动数据的积累


光有“正常细胞”的数据还不够,虚拟细胞需要知道细胞在各种干预(药物、基因敲除、环境变化)下如何响应。这正是从“相关性”走向“因果性”的关键一跃。


图3 首次提出AIVC构建的“三大数据支柱”(先验知识、静态架构、动态状态)与闭环主动学习框架(Qian et al. Cell Research 2025)


虚拟细胞能做什么?


虚拟细胞的产业价值,在于它填补了分子层面(如AlphaFold预测的蛋白质结构)与组织/患者层面(如临床试验)之间的空白。具体而言,有三个核心应用场景:


1、靶点发现与验证


传统上,科学家发现一个新靶点,需要在实验室里一个一个"敲掉"基因,看细胞会怎样。费时费力,而且很多组合根本做不完。


虚拟细胞可以在计算机里进行大规模虚拟基因敲除。GEARS模型能预测单个甚至多个基因同时被扰动后的转录组变化,在未见过的基因组合预测上表现突出。Geneformer预测的心肌病靶点PLN和GSN,经CRISPR实验验证确实能显著改善心脏微组织的收缩功能。从"试错"到"预测",这是靶点发现逻辑的根本性转变。


2、药物响应预测


一个新化合物,在细胞上会起什么作用?传统上只能做湿实验——合成、培养、测试,周期长、成本高。


虚拟细胞可以直接预测药物扰动后的基因表达变化。STATE模型在1亿扰动细胞上训练后,扰动区分度提升了50%,差异表达基因识别准确率提升了2倍。虽然距离"精确预测"还有距离,但在早期筛选和优先级排序上已具备辅助价值。


3、毒性筛选


药物失败的最大原因不是无效,而是毒性。传统上用动物实验预测人类毒性,准确率有限。


虚拟细胞结合iPSC(诱导多能干细胞)技术,可以在计算机上模拟药物对人心肌细胞的影响。hiPSC-CM虚拟细胞平台成功预测了阿霉素和曲妥珠单抗的心脏毒性,33,418例虚拟患者的模拟结果与临床观察一致。如果虚拟细胞能在药物进入人体前就识别出毒性风险,将大幅降低后期失败率。


图4系统地展示了AI驱动的虚拟细胞模型在临床前研究中的整个生命周期


三大技术路线


当前虚拟细胞的研究可以归纳为三大技术路线:


深度生成模型


深度生成模型(Deep Generative Models)是当前最主流的技术路线。变分自编码器(VAE)及其衍生架构(如scGen、CPA)通过编码器-解码器结构学习细胞的低维潜表示,并在潜空间中执行扰动响应预测。2023年后,Flow Matching和Diffusion Models被引入单细胞领域,Altos Labs在Virtual Cell Challenge 2025中的获奖方案即采用了流匹配生成模型。这类模型的优势在于能够建模细胞状态的完整分布(而非仅均值),但面临训练不稳定和计算成本高的挑战。


图神经网络


图神经网络(Graph Neural Networks, GNN)路线以GEARS为代表,其核心创新在于将基因本体(Gene Ontology, GO)功能图谱嵌入网络架构,利用基因之间的已知功能关系引导预测。GEARS在组合扰动预测(即预测两个基因同时被编辑后的效应)上表现突出,因为它能够沿功能图谱传播单个基因扰动的信号至相关基因模块。该路线的局限在于对先验知识图谱的依赖性——对于功能未被充分注释的基因或非编码区域,GNN的预测能力显著下降。


物理信息神经网络


物理信息神经网络(Physics-Informed Neural Networks, PINN)代表了将生物学先验硬编码入网络架构的尝试。半机制模型(semi-mechanistic models)的倡导者认为,纯数据驱动的架构因“生物学先验知识缺失”而注定遇到瓶颈。Kovacevic等人(2025)提出的框架强调将实验设计的第一性原理、扰动顺序的数学建模以及技术噪声的参数化整合入损失函数。该路线在实际应用中已展示改进:使用修正损失函数的神经ODE模型在iPSC时间序列数据集上实现了更快、更鲁棒的收敛。然而,PINN的泛化能力受限于先验知识的完整性,且设计成本远高于端到端学习方法。


图5 虚拟细胞模型的工作流程图


三大挑战


尽管前景诱人,虚拟细胞领域仍面临深层次的挑战。


挑战一:深度学习未超越线性基线


Ahlmann-Eltze等人在《Nature Methods》上发表的基准测试发现,在四个标准Perturb-seq数据集上,"没有任何深度学习模型能够一致地超越均值预测或线性模型"。Virtual Cell Challenge 2025中,几乎所有模型在MAE指标上劣于基线。


这不是说深度学习没有价值,而是说明当前架构与单细胞数据的稀疏性、高维性和低信噪比特性之间存在根本性错配。注意力机制捕获的主要是"共表达"而非"调控信号"。


挑战二:Benchmark指标的系统性缺陷


Virtual Cell Challenge 2025暴露了三大指标缺陷:


🔹PDS (Perturbation Discrimination Score)可被策略性操纵:单纯增加预测幅度就能提升分数

🔹DES (Differential Expression Score) recall几乎为零:模型无法可靠识别哪些基因被扰动影响

🔹MAE (Mean Absolute Error) 全面失效:几乎所有模型在MAE指标上劣于基线


更关键的是,Systema框架揭示了一个深层问题:现有模型的高分数主要由"系统性变异"(如细胞应激等非特异性效应)驱动,而非真正的扰动特异性机制。


挑战三:从预测到验证的鸿沟


即使模型在计算机上表现良好,距离真正的药物研发还有很长距离。


🔹仅14%的AI预测分子在临床前研究中显示出验证信号

🔹虚拟细胞预测差异表达基因的recall几乎为零,意味着无法可靠识别哪些基因被扰动影响

🔹从细胞系到原代细胞、从体外到体内、从动物到人类,每一层外推都引入新的不确定性


未来发展与前景


虚拟细胞代表了一种可能性:未来,药物研发可能不再是"先合成、再测试、失败了再换",而是"先计算、再验证、成功了再推进"。


这条路还很漫长,但方向已经清晰。


参考文献

1.Saurabh Bhardwaj. et al. Virtual Cells: From Conceptual Frameworks to Biomedical Applications. arXiv, 2025.

2.Bunne, C. et al. How to build the virtual cell with artificial intelligence. Cell, 2024.

3.Ma, C. et al. AI-driven virtual cell models in preclinical research: technical pathways, validation mechanisms, and clinical translation potential. npj Digital Medicine, 2026, 9: 25.

4.Qian, L., Dong, Z. & Guo, T. et al. Grow AI virtual cells: three data pillars and closed-loop learning. Cell Research, 2025, 35: 319–321.

5.Ahlmann-Eltze, C., Huber, W. & Anders, S. et al. Deep learning-based prediction of perturbation effects in single-cell RNA sequencing data. Nature Methods, 2025.

6.Roohani, Y. et al. GEARS: A graph neural network for predicting perturbation effects. Nature Biotechnology, 2024.

7.Lotfollahi, M. et al. Predicting cellular responses to complex perturbations in high-throughput screens. Nature Methods, 2023.

8.Yinlei Hu. et al. Benchmarking algorithms for single-cell multi-omics prediction and integration. Nature Methods, 2023.

9.https://arcinstitute.org/news/virtual-cell-challenge-2025-wrap-up


年度福利 | 单细胞活动重磅开启!


我们提供单细胞全流程服务,从样本接收、标准化前处理、文库构建、上机测序到生信分析,专属技术团队全程跟进,助力各位老师快速推进课题、产出高质量成果。


样本接收

标准化前处理

文库构建

上机测序

生信分析


无论是临床疾病机制探究、动物模型验证,还是药物靶点挖掘、免疫调控机制解析等各类科研场景,均可一站式高效落地、精准结题。


临床疾病机制探究

动物模型验证

药物靶点挖掘

调控机制解析


电话咨询(158 0035 3038),免费获取定制化单细胞方案,抢占科研优惠先机!


一键拨号 一键导航
扫码反馈

扫一扫,反馈当前页面

咨询反馈
扫码关注

和元生物

返回顶部