
我们构建了一个针对基因极简细菌 JCVI-syn3A 的全细胞空间动力学模型,该模型模拟了约 100 分钟的细胞周期。我们以四维(空间和时间)方式模拟了完整的细胞周期,包括所有遗传信息过程、代谢网络、生长和细胞分裂。通过整合混合计算方法,我们模拟了形态转变的动态过程。生长由脂质和膜蛋白的插入驱动,并受荧光成像数据的约束。染色体复制和分离受染色体蛋白的基本结构维持机制控制,类似于布朗动力学模拟中的凝聚素 (SMC) 和拓扑异构酶蛋白,复制速率则响应代谢产生的脱氧核苷三磷酸 (dNTP) 池。该模型能够捕捉到我们 DNA 测序中测得的复制起点与终点比率,并重现其他实验测量结果,例如倍增时间、mRNA 半衰期、蛋白质分布和核糖体计数。由于随机性的存在,每个复制细胞都是独一无二的。我们不仅可以预测分配到子细胞的平均行为,还可以预测它们之间的异质性。

代码与数据:https://github.com/Luthey-Schulten-Lab/Minimal_Cell_4DWCM
请索引第119篇论文
![]() | ![]() |

2026年3月,伊利诺伊大学厄巴纳-香槟分校(UIUC)Zaida Luthey-Schulten团队在《Cell》发表论文《Bringing the genetically minimal cell to life on a computer in 4D》,把基因组最小细菌 JCVI-syn3A 的整个细胞周期,在三维空间加时间(4D)里完整跑了一遍——从出生、生长、DNA复制到对称分裂,平均时长约105分钟,与实验测得的倍增时间几乎吻合。

这不是一张漂亮的细胞示意图,而是真正"算"出来的细胞:10纳米分辨率的立方晶格上,绿色是膜,黄色和紫色是核糖体(无活性/有活性),蓝红两色是母子染色体,灰色是蛋白质,橙色是RNA。每一个颗粒都遵循基于真实测量的动力学规则运动。

01 为什么要选"最小细胞"下手
很多人第一反应是:为什么不直接模拟大肠杆菌?答案是——复杂到没法验证。
JCVI-syn3A 只有493个基因、543 kbp环状染色体、约105分钟倍增时间。它是J. Craig Venter研究所把 Mycoplasma mycoides 基因组一路"减肥"减出来的极简生命体,每个基因都至关重要,没有冗余通路来混淆模型。
更关键的是,它的"数据厚度"在细菌里数一数二:转录组、蛋白质组、冷冻电镜断层扫描(cryo-ET)、染色体接触图谱、代谢地图、DNA测序——几乎所有建模需要的定量数据都有。
选最小细胞,不是因为它简单,而是因为只有它,我们才有可能把"所有零件"都算清楚、都对得上实验。
02 核心招式:把四种计算方法"焊"在一起
传统全细胞模型有两个极端:一端是近原子分辨率的分子动力学,能抓结构但只能跑毫秒级;另一端是把细胞当"均相搅拌釜"的稳态模型,能跑代谢通量但丢失了空间。
这篇论文的杀手锏是混合多尺度架构——在同一套代码里同时跑四种计算方法,通过"钩子"函数在时间上同步:
RDME(反应-扩散主方程):50微秒一步,在10纳米晶格上追踪空间异质性和局域反应,是整个模型的"父方法"
CME(化学主方程):处理转录、tRNA充电等"充分搅拌"的随机反应
ODE(常微分方程):求解代谢网络(糖酵解、核苷酸合成、脂质合成、转运)
BD(布朗动力学,LAMMPS GPU加速):模拟染色体作为粗粒化聚合物的物理运动
每12.5毫秒,RDME求解器被中断一次,去和CME、ODE、BD交换数据;每4秒更新一次染色体构型;每1秒同步一次全局代谢状态。
计算代价有多大? 模拟一个细胞跑完105分钟的生物时间,需要在GPU上连续计算4-6天。本研究一共模拟了50个复制细胞。

03 染色体:用物理法则"挤"出两条子染色体
这是全文最精彩的部分之一。染色体被建模为10 bp一串的珠子(每珠直径3.4纳米),用弹性蠕虫链模型描述弯曲和拉伸,持久长度45纳米。

论文里处理了几个关键机制:
DNA复制采用"火车轨道模型"——复制叉独立地沿着母染色体的两条臂前进,子代染色体的珠子在母链对应位置的居中处出现。复制速率100 bp/s(来自 Mycoplasma capricolum 的测量值),并实时响应代谢提供的dNTP池浓度。
SMC环挤出模拟凝缩蛋白类似物的作用:锚点每4秒随机重选,铰链每0.4秒朝一个方向"卷绕"约20个珠子(≈200 bp)。这个速率来自体外酵母condensin实验。
拓扑异构酶通过周期性把"硬核排斥"切换成"软拓扑排斥"来实现——让DNA链能互相穿过,解开缠结。论文明确指出:如果没有拓扑异构酶效应,染色体根本无法在有限时间内解开。
12 pN的"虚构排斥力"——这是论文坦诚承认的一个"不得已"。为了让两条子染色体可靠地分开到两个子细胞里,作者们在两条子染色体之间施加了一个12 pN的反向力(相当于5 kBT/1.7 nm)。
这个12 pN的力是"几何约束"而非物理机制。Syn3A基因组里找不到ParABS、Min系统、MukBEF等已知分隔系统的同源基因,真正的分隔机制仍是未解之谜。作者估计,如果用更精细的SMC模型替代这个虚构力,单次细胞模拟时间会拉到"数周"。
04 模型算得准不准?让实验数据说话
这是交叉学科研究的灵魂:模型不是自说自话,而是要用独立实验来验证。
论文做了几组漂亮的对拍:
倍增时间:模拟平均105分钟,实验也是105分钟。
ori:ter比值(复制起点与终点的测序深度比):模拟预测1.28,作者对Syn3A做DNA测序得到的实验值是1.21。这个比值之所以重要,是因为它编码了B期(出生到复制起始)、C期(复制时长)、D期(复制到分裂)的时间分配。模拟给出的时间是B≈5分钟、C≈46分钟、D≈54分钟。
细胞形态:作者对1319个JCVI-syn3B细胞做了荧光成像统计,约79.5%为球形/长球形,4.9%处于分裂态,4.2%出芽,还有约11%存在"胞内胞"结构。模拟采用的几何分裂模型(两个重叠球)与成像结果匹配良好。
核糖体数量:模拟预测分裂时平均881个核糖体,与实验观察相符。
mRNA半衰期:模拟得到的平均和中位数半衰期落在枯草芽孢杆菌单个mRNA观测范围内(<1到20分钟)。

05 大分子复合物的"装配经济学"
图5揭示了一些反直觉的发现。

活性分数:约55%的核糖体在翻译、70%的RNA聚合酶在转录、10%的降解体在降解。RNAP的高活性是因为模型用了更精确的装配化学计量——RNAP总数从187降到了93。
蛋白翻倍不足:在一个细胞周期里,大多数蛋白质的拷贝数没能完全翻倍。中位数只到初始值的2倍以下。原因有三:①翻译效率受mRNA寿命和转录速率影响;②长基因(>3kb)尤其吃亏;③模型没有多聚核糖体(polysome)——每个mRNA同时只能被一个核糖体翻译,而实验中Syn3A有20%-40%的核糖体是多聚体形式。
复制起始的高度敏感性:当作者把DnaA结合ssDNA的速率从100 mM⁻¹s⁻¹(之前均相模型用的平均值)换成140 mM⁻¹s⁻¹(带有强/中等结合特征的DNA构造测量值)时,复制起始从"12个细胞都不启动"变成"几乎所有细胞都在15分钟内启动"。这说明在空间模型中,扩散限制让结合动力学变得极度敏感。
81个基因在50个模拟细胞中偶尔完全不被转录——但这些基因多为低丰度且功能未知,且最大不超过3/50的细胞跳过,连续两代都跳过的几率仅0.36%。
06 分配到子细胞:本质是随机扩散
因为所有分子都在3D晶格上做随机扩散,分裂时谁去哪个子细胞,模型自动给出答案。

结果令人意外又合理:分配分布接近二项分布,没有任何子细胞偏向性。核糖体、降解体、跨膜蛋白PtsG、单体蛋白GapDH——全都是随机分配。唯一的非随机迹象来自降解体:当大段DNA被推到膜附近时,外周膜上的降解体被排挤,造成轻微的分配偏移。
换句话说,细胞在分子分配层面是"掷骰子"的,而正是这种随机性,让50个复制细胞个个不同——但又都能顺利完成分裂。

07 给AI+交叉学科研究的几点硬核启发
读完这篇论文,作为交叉学科研究者,我觉得有几条启示值得记下来:
第一,混合多尺度不是权宜之计,而是必由之路。 从微秒级的生化反应到数小时级的细胞周期,跨度达9个数量级。没有任何单一算法能通吃。RDME+CME+ODE+BD的耦合范式,为"AI for Science"提供了一个重要参照:当神经网络难以覆盖全尺度时,"符号主义(物理方程)+ 随机模拟 + 数据同化"的混合架构可能是更稳的路线。
第二,实验数据同化决定了模型的天花板。 这篇论文能算准,是因为它"喂"进了蛋白质组、转录组、cryo-ET、DNA测序、荧光成像等海量数据。未来的"虚拟细胞"平台,核心竞争力不在于算法多花哨,而在于能不能把多组学数据系统地"同化"进模型。这与AI领域的"物理信息神经网络(PINN)"思路异曲同工。
第三,模型的"破绽"往往是最有价值的科学问题。 12 pN虚构力暴露了我们对Syn3A染色体分离机制的无知;蛋白翻倍不足暴露了多聚核糖体的关键作用;NTP池偏低提示代谢网络里还缺关键的平衡效应。每一个"模型算不准"的地方,都是下一个实验的切入点。
第四,随机性不是噪声,是生命本身。 50个复制细胞各有各的命运,但都能活下来完成分裂——这正是鲁棒性(robustness)与可变性(variability)的统一。对AI研究者而言,这意味着用确定性深度学习去"预测"细胞行为是有天花板的,随机过程建模不可回避。
第五,计算成本仍是卡脖子问题。 4-6天GPU时间换一个细胞周期,50个复制细胞就是巨大的算力消耗。这给"用AI加速科学计算"留下了巨大空间——能否用神经网络替代部分BD或RDME计算?能否用神经ODE思路压缩混合算法的通信频率?这都是交叉学科可以发力之处。
08 写在最后:这只是"地板",不是"天花板"
论文作者在讨论部分坦言,未来还需要加入:多聚核糖体、操纵子结构的耦合转录、FtsZ聚合动力学驱动分裂、转录-翻译耦合、膜蛋白的共翻译转位……
Syn3A是"地板"——已知最简单的、能独立生长分裂的生命体。所有更复杂的生物,都是在它之上叠加更多基因、更多反馈回路、更多失效与适应方式。这个4D模型提供的是一个"平台",理论上可以把额外生物学一层层叠上去。
从AI+交叉学科的视角看,这项工作真正的价值不在于"模拟了一个最小细胞",而在于它证明了:当计算方法、实验数据、理论物理、定量生物学四股力量真正拧成一股绳时,我们有能力在计算机里"重新发明"生命的基本运作原理。
下一次当你训练一个大模型来预测细胞状态时,不妨想想这篇论文——也许比起追求更大的参数规模,先把空间异质性、随机性、多尺度耦合这三件事做实,才是"虚拟细胞"真正的破局点。



内容中包含的图片若涉及版权问题,请及时与我们联系删除





评论
沙发等你来抢