Skip to content

系统建模、参数推断与实验检验

系统模型把关于组成、相互作用和边界条件的假设写成可计算的关系,再把这些关系产生的预测交给实验检验。它既可以追踪分子浓度随时间怎样变化,也可以在缺少完整动力学参数时限定代谢通量的可行范围,还可以把细胞、组织和器官尺度上的过程连接起来。模型的价值不由方程数量决定,而在于它是否明确回答了一个生物学问题,并使不同机制在观测或扰动下给出可以区分的结果。1

网络拓扑及其边语义、反馈回路的确定性动力学以及随机、空间和群体过程分别见生物网络结构与网络模体反馈、开关与振荡随机动力学、空间模式与群体系统。这些模型进入推断阶段后,需要选择模型边界,由数据约束参数,识别不可辨识性,整合组学证据,并用尚未参与拟合的扰动检验模型。

模型的问题、边界与观测量

建模首先要确定系统的空间边界、时间范围和分析单位。同一条丝裂原活化蛋白激酶(mitogen-activated protein kinase,MAPK)信号通路可以被写成一个受体到转录因子的分子反应网络,也可以被粗粒化为“输入—激酶活性—细胞命运”三个状态;肝脏葡萄糖代谢可以按单细胞酶反应、肝小叶空间梯度或全身器官交换来描述。边界以外的过程成为输入、输出、外部参数或噪声来源。若营养供给、细胞生长或组织血流在实验中持续变化,却被模型当作常量,所得参数会吸收这些未建模变化。

一个动力学模型可概括为

\[ \frac{\mathrm d\mathbf{x}}{\mathrm dt} =\mathbf{f}(\mathbf{x},\mathbf{u},\theta), \qquad \mathbf{y}=\mathbf{h}(\mathbf{x},\phi)+\varepsilon. \]

\(\mathbf{x}\) 是模型内部的状态变量,\(\mathbf{u}\) 是实验施加的输入,\(\theta\) 是反应或转移参数向量;实验真正记录的是观测量 \(\mathbf{y}\)。观测函数 \(\mathbf{h}\) 把内部状态映射为荧光、蛋白条带、细胞比例或代谢物峰面积,\(\phi\) 可包含比例因子、背景和检测饱和参数,\(\varepsilon\) 表示测量误差。实验只能看到状态的组合、相对变化或有限时间窗口,这一观测限制与动力学本身共同造成参数推断困难。

模型的输出须与问题对应。研究适应时,应预测峰值、恢复时间和稳态偏差;研究开关时,应预测阈值、滞后区和状态占比;研究代谢时,应区分代谢物池量、交换通量与净通量。先规定要解释的观测量和可接受的预测误差,才能判断模型是否需要增加空间、随机性、细胞异质性或额外反应。

三类模型的信息层次

机制模型、现象模型和约束模型对信息作出不同取舍。一个研究常先用现象模型概括数据结构,再以机制模型解释局部过程,同时用约束模型限定大规模网络的可行状态。

模型家族 保留的核心信息 典型输出 主要检验方式
机制模型 反应、转运、调控或状态转换的因果结构及速率关系 时间轨迹、稳态、阈值、波长、状态分布 改变特定反应边、输入波形或初始状态,比较完整动力学
现象模型 数据中稳定出现的输入—输出关系、增长曲线、潜变量或经验尺度律 趋势、特征时间、分类与预测分布 在独立样本和新条件中检验预测及残差结构
约束模型 化学计量、质量守恒、反应方向、容量和环境交换边界 可行通量空间、通量范围及目标条件下的候选状态 测量摄取/分泌、同位素通量或扰动后的可行性变化

机制模型中的每一条边也有分辨率。质量作用速率可以展开到结合、构象变化和催化步骤,也可以把数个快过程压缩成 Hill 函数或有效速率常数。粗粒化参数只在所拟合的条件和尺度内有意义:一个包含转录、翻译和降解延迟的“有效时间常数”,不能直接解释成某一种分子的寿命。若两种模型在当前实验下产生相同输出,它们就是当前证据下等价的候选,而不是由拟合优度自动选出唯一机制。

化学计量矩阵与代谢网络的可行运动

代谢网络由 \(m\) 种内部代谢物和 \(n\) 个反应组成时,可用化学计量矩阵 \(\mathbf{S}\in\mathbb{R}^{m\times n}\) 记录每个反应消耗和生成的化学计量数。令通量向量为 \(\mathbf{v}\),内部代谢物量为 \(\mathbf{x}\),则

\[ \frac{\mathrm d\mathbf{x}}{\mathrm dt}=\mathbf{S}\mathbf{v}. \]

在选定时间尺度内把内部代谢物池视为准稳态,可写成 \(\mathbf{S}\mathbf{v}=\mathbf{0}\)。这条式子要求每种内部代谢物的总生成与总消耗相抵,并不要求单个反应达到热力学平衡,也不表示代谢物浓度为零。交换反应把营养摄取、产物分泌和生物量形成接到系统边界;反应可逆性、营养条件、酶容量和热力学信息进一步给出

\[ \mathbf{l}\leq\mathbf{v}\leq\mathbf{u}. \]

由此得到的是一个可行通量空间。网络结构和边界条件排除了违反守恒或容量的状态,却常留下许多彼此不同的通量分配。基因组注释、反应数据库与代谢网络重建怎样形成 \(\mathbf{S}\),以及矩阵求解和软件实现,见生信栏目的代谢约束与通量平衡;这里关注这些约束所支持的系统推断。

通量平衡分析的目标函数与可行空间

通量平衡分析(flux balance analysis,FBA)通常在稳态和通量上下界之上加入线性目标:

\[ \max_{\mathbf v}\;\mathbf{c}^{\mathsf T}\mathbf{v} \quad\text{subject to}\quad \mathbf{S}\mathbf{v}=\mathbf{0},\qquad \mathbf{l}\leq\mathbf{v}\leq\mathbf{u}. \]

\(\mathbf{c}\) 选择要最大化或最小化的通量组合,例如特定培养条件下的生物量生成、三磷酸腺苷(adenosine triphosphate,ATP)维持或副产物形成。FBA 不需要为每个酶指定速率常数,因而能处理规模很大的代谢网络;它预测满足约束并符合所设目标的候选通量状态,代谢物浓度的时间轨迹则需由动力学模型描述。2

最优目标值相同的通量解可能不唯一。平行通路、可逆循环和未受测量约束的交换反应会形成替代最优解;逐个求每条反应在保持目标值条件下的最小与最大值,可得到通量变异范围。若某条反应的范围很窄,说明当前约束已强烈限定它;范围很宽则表示多种通量分配仍与同一表型相容。通量范围也依赖网络完整性、反应方向和外界交换界限,错误的缺失反应或能量生成循环会造成看似精确却不具生理意义的结果。

目标函数是可检验的生物学假设。快速生长微生物在特定实验条件下可能接近生物量最大化,维持期细胞、分化组织或受胁迫细胞却可能同时权衡能量、还原力、蛋白成本和存活。研究者可比较不同目标、加入测得的摄取和分泌速率,或直接问哪些反应在所有可行状态中都必需。删除基因、改变培养基或限制氧供后,预测的生长与交换通量应由独立实验检验;预测失败可指向目标假设、基因—反应映射或网络结构中的缺口。

稳态附近的代谢控制分配

FBA 主要利用守恒和边界约束,代谢控制分析(metabolic control analysis,MCA)则在一个具体稳态附近询问酶活性的小变化怎样传到系统通量和代谢物浓度。对通量 \(J\) 和反应活性参数 \(E_i\),归一化通量控制系数为

\[ C_{E_i}^{J}=\frac{\partial\ln J}{\partial\ln E_i}. \]

在经典连续稳态模型的适用条件下,各反应的通量控制系数满足 \(\sum_i C_{E_i}^{J}=1\)。控制因而可分散在多步反应、转运和分支之间,并随营养、需求与酶饱和度重新分配;“限速酶”的控制程度同样依赖这些条件。局部反应对底物和效应物的弹性怎样与系统控制系数连接,见代谢控制分析3

MCA 的实验需要小幅、可定量地改变单个反应活性,并在新的稳态测量通量和中间物池。酶表达梯度、可调抑制、等位基因剂量或急性降解都可提供扰动;只比较完全敲除与野生型,常会触发补偿、状态转换或生长差异,超出局部系数的解释范围。不同扰动幅度得到的响应曲线还能检验线性近似何时失效,并显示控制是否在网络中重新分配。

参数灵敏度与预测变化

对预测量 \(y_i\) 和参数 \(\theta_j\),局部归一化灵敏度可写为

\[ S_{ij}(t)=\frac{\partial\ln y_i(t)}{\partial\ln\theta_j}. \]

它回答在当前参数点附近小幅改变 \(\theta_j\) 时,某个时间和条件下的预测怎样变化。灵敏度随时间、初始状态和输入而异:一个参数可能强烈影响早期峰值,却几乎不改变晚期稳态;也可能只在阈值附近显现。局部灵敏度适合追踪具体机制路径,全局灵敏度则在预先规定的参数范围和分布上同时改变多个参数,比较方差贡献、交互和非线性区域。

低灵敏度有几种不同含义。它可能表示系统对该参数的生物学鲁棒性,也可能只是当前观测量、时间窗口或输入没有激发相关过程。高维系统的灵敏度矩阵常呈“松散”结构:少数组合方向显著改变输出,许多参数组合可大幅变化而保持相似预测。Gutenkunst 等在多种系统生物学模型中系统展示了这种参数敏感性的宽谱分布;这说明精确预测某些系统量有时不需要每个微观参数都被精确估计,但参数本身的机制解释仍须接受可辨识性检验。4

鲁棒性也必须指明对象。系统可以对单个酶量变化保持稳态通量,却对联合扰动或环境改变非常敏感;某组参数可以维持平均响应,却改变噪声、恢复时间或代谢成本。灵敏度分析因此应围绕要保持的表型和现实扰动范围设计,并分别报告不同输出的敏感程度。

参数推断中的观测模型与误差模型

参数估计把模型预测与观测数据连接起来。若在条件 \(k\)、时间 \(t_i\) 观测到 \(y_{ik}\),模型给出预测 \(\hat y_{ik}(\theta)\),一种常见的加权残差目标为

\[ Q(\theta) =\sum_{i,k}\frac{\left[y_{ik}-\hat y_{ik}(\theta)\right]^2} {\sigma_{ik}^{2}}. \]

当误差独立且近似正态、\(\sigma_{ik}\) 已合理描述测量尺度时,最小化 \(Q\) 对应最大似然估计。计数、比例、删失值、检测下限和随信号增大的误差需要相应的概率模型;把所有读出无条件当成同方差正态数据,会使高强度或低强度区域取得不恰当权重。生物重复、技术重复和同一样本的时间序列也具有不同相关结构。

多个时间序列和实验条件可以全局拟合:由生物学决定哪些速率在条件间共享,哪些初值、输入强度或观测比例因子允许变化。非线性动力学的目标函数常有多个局部极小值,因而要从多组初值重复优化,并比较所得参数与预测;若各次拟合落在不同参数区,却产生同样输出,这本身就是可辨识性线索。频率学方法可由似然曲率、剖面似然或重采样给出区间,贝叶斯方法则把先验与似然组合为参数后验。先验可以表达已测速率和物理范围,也可能在数据薄弱时主导结论,因此须用先验预测和敏感性分析检查。

观测函数要显式表示实验。免疫印迹常给相对强度而非绝对分子数,荧光报告可能有成熟延迟和饱和,单细胞测量又会混合真实细胞差异与检测噪声。若比例因子、背景和批次偏移未写进观测模型,动力学参数会被迫解释测量过程。参数估计的算法、误差分布、置信区间和贝叶斯计算属于统计实现层,相关基础见从机制到概率模型后验预测和模型检查5

参数可辨识性

结构可辨识性是在模型结构、输入与观测函数已经确定,并假定连续、无噪声且信息无限精确的理想数据时,判断参数能否由输出唯一恢复。若输出只依赖两个参数的乘积 \(\theta_1\theta_2\),任何保持乘积不变的参数对都会给出同一输出;单独的 \(\theta_1\)\(\theta_2\) 结构上不可辨识,乘积却是可辨识的参数组合。增加同类重复数据不能解除这种结构退化,需要改变参数化、增加新的观测量或施加能区分两条路径的输入。

实际可辨识性讨论有限时间点、测量误差和实验范围下的不确定性。参数可以在理想条件下唯一,却因为过程过快、采样过稀、输入幅度太小或观测窗口未覆盖恢复阶段而只有单侧界限。更多重复能降低测量噪声,延长时间序列或加入新扰动可激发原先不可见的动力学;选择哪一种改进,应根据不可辨识性来自噪声、时间范围还是缺少独立观测决定。

剖面似然把一个参数固定在一系列数值上,每次重新优化其余参数,再观察最佳目标函数怎样上升。存在明确谷底并在两侧跨过置信阈值时,数据给出有限区间;平坦方向表示其他参数可以补偿该参数变化。Raue 等用这一方法区分结构和实际不可辨识性,并把结果用于模型缩减和后续实验规划。6 Fisher 信息矩阵或局部参数相关可以快速提示近退化方向,马尔可夫链蒙特卡洛(Markov chain Monte Carlo,MCMC)后验可以显示非线性相关、多峰和参数组合,但任何一种数值方法都须结合模型结构、参数边界和收敛诊断解释。

参数不可辨识不等于所有预测都不可用。多个参数集可能给出相同的稳态输出,却对新输入后的瞬态产生不同预测;此时新实验能同时区分参数和机制。反过来,某个目标预测也可能在宽广参数集合上都很稳定,即使单参数区间很宽。研究应同时报告参数不确定性和目标预测的不确定性,避免用一组最佳参数代表所有相容模型。

模型选择、独立条件与残差结构

候选模型应先按生物学问题和可观测差异提出,再比较它们对数据的解释。增加反应和参数通常能降低训练残差,却也会扩大可补偿方向。赤池信息准则(Akaike information criterion,AIC)、贝叶斯信息准则(Bayesian information criterion,BIC)、交叉验证或贝叶斯模型比较各有前提,只能在响应、似然和观测集合可比时使用;信息准则差异也不能替代对守恒、时间尺度和参数可辨识性的检查。

残差保留了模型遗漏的结构。刺激后所有早期时间点都被低估,可能表示缺少快速支路;误差随信号强度增大,可能需要异方差观测模型;不同批次呈一致偏移,则应建模批次或校准差异。只展示拟合曲线而不展示原始数据、误差和残差,会掩盖模型以错误方式获得相似轨迹的情况。

真正有力的验证来自未参与估计的条件。可以留出整条时间序列、另一种输入波形、不同剂量、另一细胞背景或一个组合扰动。随机留出同一轨迹中的零散时间点主要检验插值,不能代表模型对新实验的外推能力。模型若以多个可行参数集形成集合,应让整个集合对新条件作预测区间,再判断观测是否落入范围以及失败集中在哪个机制分支。

组学数据的约束、先验与观测层

转录组、蛋白质组和代谢组可以缩小模型的候选状态,却不能按一一对应关系直接替换反应速率。转录本丰度影响潜在酶量,蛋白丰度更接近催化容量,磷酸化和复合物装配提示活性状态;真实通量还取决于底物、产物、热力学驱动力、区室、转运和竞争支路。把低表达反应收紧上界是一种模型假设,其阈值与映射规则需要通过已知活性和独立通量数据校准。

代谢物浓度提供池量和热力学约束,却不是通量本身。稳定同位素示踪记录标记碳在代谢物及其同位素体中的重新分配;结合原子映射、摄取与分泌速率和同位素平衡模型,才能估计分支、交换和循环通量。\(^{13}\)C 代谢通量分析由动态标记模式获得的信息,正是普通浓度快照所缺少的“网络在运动”证据。7 代谢组数据处理、化合物鉴定、通路映射和多组学矩阵整合见通路、代谢网络与通量

组学也可进入统计层:用蛋白丰度为参数建立条件性先验,用单细胞表达区分亚群模型,或把未观测调控活动写成潜变量。这里须保留测量层与机制层的距离。相关的多组学模式可以帮助提出共同调节模块,只有时间顺序、边级扰动、直接结合或代谢示踪等证据加入后,模型才更接近因果机制。

多尺度模型的接口变量

从分子到器官的模型跨越很大的长度与时间尺度。离子通道在毫秒内改变膜电流,细胞兴奋和收缩发生在毫秒到秒,组织灌流与代谢需求又在更长时间和空间上反馈。Physiome 框架把生化、生物物理和解剖信息连接到细胞、组织和器官功能,强调模型必须处理尺度之间的接口,而不是把所有过程塞进同一组方程。8

常见连接方式包括时间尺度分离、模块耦合和混合模型。若快速结合相对于慢速蛋白表达接近准稳态,可以用有效输入—输出函数替代全部快速步骤;细胞模型向组织模型输出耗氧率、收缩力或分泌通量,组织模型再把氧浓度、机械负荷或激素水平反馈给细胞。离散细胞与连续信号场可组成基于个体(agent-based)模型—偏微分方程混合系统,随机分子模块也可嵌入确定性的组织背景。

接口变量必须有一致的单位、空间支持和守恒关系。单细胞分泌速率乘以细胞密度后才可进入组织体积源项,组织平均氧浓度也未必等于每个细胞周围的局部值。不同尺度上分别拟合出的“有效扩散系数”或“反应速率”不能直接互换;被粗粒化掉的结构会以记忆、延迟、相关噪声或条件依赖参数出现。多尺度模型应先保证每个模块在自身尺度上可检验,再验证模块连接后是否产生新的、可观测的系统行为。

候选模型分歧的实验设计

好的实验不只增加数据量,还把系统推入候选模型预测最不同的区域。采样时间应覆盖输入前基线、快速峰值、恢复和新稳态;剂量应跨过线性区、阈值和饱和区;脉冲、阶跃、周期输入与撤除刺激可分别显露时间常数、适应、迟滞和相位响应。基于灵敏度或 Fisher 信息的最优设计可以选择最能缩小目标参数区间的条件,预测差异最大的设计则更适合区分模型结构。9

扰动也应与网络边相对应。删除整个节点会同时破坏催化、支架、定位和反馈,改变结合位点、催化活性、降解速率或特定调控边能给出更清晰的机制检验。急性、可逆扰动减少长期补偿;恢复野生型或只恢复某一功能的救援实验(rescue experiment)可判断表型来自目标机制还是一般细胞损伤。单扰动用于估计局部作用,组合扰动则揭示冗余、协同和替代通路。

前瞻预测必须在实验开始前固定模型版本、输入条件、观测量和判定标准。若看到结果后不断改动网络和参数,模型可以成为解释工具,却不再构成对原预测的独立检验。失败同样提供信息:时间相位正确但振幅错误,通常指向增益或观测尺度;稳态正确而瞬态错误,提示时间尺度或隐藏中间体;特定背景下整体失败,则可能暴露模型边界外的宿主差异。这样的失败模式决定下一轮应修正结构、参数、观测模型还是实验条件。

可复现模型的完整假设链

模型论文和知识库应让另一位研究者能够从同一输入重现图表与预测。所需信息包括方程或反应规则、状态与参数的生物学含义、单位、初值、边界条件、输入波形、观测函数、误差模型、参数来源、估计方法和模拟条件。只公开一段代码而没有参数表和数据映射,或只给方程而没有事件、归一化与数值设置,都不足以恢复原分析。

系统生物学标记语言(Systems Biology Markup Language,SBML)、细胞模型语言(CellML)、仿真实验描述标记语言(Simulation Experiment Description Markup Language,SED-ML)和 COMBINE 归档(COMBINE Archive)等标准用于交换模型、模拟任务和关联文件,BioModels 等数据库进一步检查模型编码与论文描述是否一致,并尝试复现实验结果。BioModels 对已发表模型的系统复核显示,缺少参数、初始条件或结构不一致会使相当一部分模型无法直接复现;标准格式服务于假设、实体和计算过程的明确表达,而非仅作为文件扩展名。10

从模型建立到知识增长可以形成连续闭环:先界定问题和尺度,写出结构与观测模型;再用灵敏度和可辨识性判断现有数据能够约束什么;随后由参数集合产生带不确定性的预测,选择能最大区分候选机制的扰动;最后把新结果用于保留、修改或舍弃模型。系统生物学的核心不在于让模型永久正确,而在于让模型持续暴露假设,并让实验能够明确地修正这些假设。

参考资料与延伸阅读


  1. Alon U. An Introduction to Systems Biology: Design Principles of Biological Circuits, 2nd ed.. Chapman & Hall/CRC, 2020;Klipp E, Liebermeister W, Wierling C, Kowald A, Lehrach H, Herwig R. Systems Biology: A Textbook. Wiley-Blackwell, 2011. 

  2. Orth JD, Thiele I, Palsson BØ. What is flux balance analysis?. Nature Biotechnology. 2010;28(3):245–248. 

  3. Fell DA. Metabolic control analysis: a survey of its theoretical and experimental development. Biochemical Journal. 1992;286(Pt 2):313–330. 

  4. Gutenkunst RN, Waterfall JJ, Casey FP, Brown KS, Myers CR, Sethna JP. Universally sloppy parameter sensitivities in systems biology models. PLoS Computational Biology. 2007;3(10):e189. 

  5. Ashyraliyev M, Fomekong-Nanfack Y, Kaandorp JA, Blom JG. Systems biology: parameter estimation for biochemical models. The FEBS Journal. 2009;276(4):886–902. 

  6. Raue A, Kreutz C, Maiwald T, et al. Structural and practical identifiability analysis of partially observed dynamical models by exploiting the profile likelihood. Bioinformatics. 2009;25(15):1923–1929. 

  7. Sauer U. Metabolic networks in motion: \(^{13}\)C-based flux analysis. Molecular Systems Biology. 2006;2:62. 

  8. Hunter PJ, Borg TK. Integration from proteins to organs: the Physiome Project. Nature Reviews Molecular Cell Biology. 2003;4(3):237–243. 

  9. Kreutz C, Timmer J. Systems biology: experimental design. The FEBS Journal. 2009;276(4):923–942. 

  10. Tiwari K, Kananathan S, Roberts MG, et al. Reproducibility in systems biology modelling. Molecular Systems Biology. 2021;17(2):e9982;另见 EMBL-EBI BioModels 的模型复现检查说明。 

页面讨论

使用 GitHub 登录后可参与整页讨论;评论独立保存在 GitHub Discussions 中。