Skip to content

多组学整合

基因组、表观组、转录组、蛋白质组、代谢组和表型记录不同分子对象与时间尺度。多组学研究把这些数据层纳入同一研究设计,以辨认跨层共享和各层特有的变化,并检验它们能否共同支持预测或机制假说。独立生物学重复由采样设计决定,因果关系则需要时间或扰动证据。

整合首先是样本和观测过程的对应问题。同一受试者、同一时间、同一组织、同一细胞或同一次采集物的分装代表不同强度的匹配;计数、离子强度、离散基因型和相对丰度在统一数值尺度后仍保留各自的观测含义。各层应先在自己的生成模型下完成质量控制,再根据研究任务选择特征拼接、潜变量、样本网络、通路映射或预测模型。

以下从样本匹配和分层预处理出发,比较早期、中间、后期与层级整合,继而讨论无监督表示、监督预测、通路和网络、时间与扰动证据。代谢组的采样、质谱/核磁共振信号、化合物鉴定、定量和通量推断见代谢组学;转录组和蛋白质组的观测模型分别由相邻专题展开。

多组学研究设计始于采样

多组学中的“同一样本”可以有几种层次。分样匹配(split-sample)设计把一次采集物分装给不同平台,最接近共同生物状态;重复匹配(replicate-matched)设计在同一条件下准备平行样品,允许不同提取流程却增加重复间差异;来源匹配(source-matched)设计在同一受试者和时间采集不同组织或体液,保留个体配对但测量不同生物区室。设计必须与研究问题一致:同一受试者的血液转录组和粪便代谢组表示个体配对,二者来自不同局部系统。1

不同组学最好共享随机化和阻断方案。若所有病例的蛋白质组在一批测量、对照在另一批测量,即使转录组批次平衡,整合模型仍可能把蛋白质组的技术差异当成跨层信号。样品标识、时间、组织、细胞组成、提取批次和临床协变量要在所有矩阵中使用同一受控元数据,并在整合前核对一对一或一对多关系。

完整匹配的数据允许直接比较个体内跨层协变。部分样品缺少一个完整组学区块时,缺失原因可能与样品量、疾病严重度或平台失败相关;仅分析完整个案(complete case)会改变研究人群。某些潜变量和核方法可以在部分缺失下估计模型,但未测区块的缺失机制仍需明确。若各组学来自互不重叠的队列,通常在通路、网络、效应统计量或外部知识层作间接整合;真实个体内相关需要重叠样本。2

样本量应围绕最终任务和最弱数据层规划。增加一种组学会增加特征维数、缺失机会和验证负担,独立生物学重复数仍由采样单位决定。若主要目标是预测,训练、调参与独立测试的划分应在任何跨层特征选择之前确定;若主要目标是机制,时间点、扰动和组织来源通常比额外加入一个横断面矩阵更重要。

各数据层的独立预处理

整合前,每个数据层都应在其生成模型下完成质量控制。基因型是离散的等位基因状态,核糖核酸测序(RNA sequencing,RNA-seq)是受测序深度和离散计数影响的丰度,蛋白质组含肽段到蛋白推断,代谢组包含多离子与鉴定不确定,微生物相对丰度还受到组成性约束。把所有矩阵转成标准分数(z-score)可以统一数值尺度,但各观测过程的差异仍须在模型与解释中保留。

预处理应保留样本级和特征级不确定性。低质量样品、批次、检测限和注释置信度可成为权重、协变量或敏感性分析条件;若预先将它们压成一个“干净矩阵”,整合模型会失去区分技术波动与真实层间差异的信息。协变量调整还要避免删除研究所需的生物效应,例如细胞组成既可能是混杂因素,也可能是处理发挥作用的中介。

特征映射有两种基本轴。以样本为轴的整合要求各矩阵行对应同一实验单位,但列可以完全不同;以生物实体或通路为轴的整合需要把变异、胞嘧啶—磷酸—鸟嘌呤二核苷酸(cytosine–phosphate–guanine dinucleotide,CpG)、转录本、蛋白和代谢物映射到基因、反应或网络节点。多对多映射、异构体和物种差异必须保留,方阵化时也应记录候选名称和映射规则。

每层的归一化、变换和特征选择参数都应只从训练样本估计。若先在全队列中校正批次、选择差异分子或构建相关网络,再做预测交叉验证,测试样本的信息已经进入模型。无监督步骤也可能泄漏结局相关结构,因此完整预处理管线应在每个重采样折内重新拟合。

早期、中间与后期整合

早期整合把各组学特征按样本拼接为一个大矩阵,再交给回归、聚类或机器学习模型。它实现直接、便于检验跨层交互,但特征数多、尺度差异大,变量丰富的数据层容易主导距离和损失函数。层内相关还会让某一生物过程因拥有更多测量特征而被重复加权。正则化、分层惩罚和数据层权重需要在验证框架中确定。

中间整合让多个矩阵共同学习低维表示、核或样本网络,同时保留每层的观测模型。它可以分离共享变化与组学特异变化,或寻找在多个数据层一致的样本邻域。潜因子和嵌入坐标是模型得到的数学表示,需要通过载荷、方差解释、通路和外部表型赋予生物学注释。

后期整合先分别分析每一层,再合并效应量、排序、分类概率、簇或通路结果。它容易复用成熟的单组学流程,也能处理样本不完全重叠;代价是特征级跨层交互在前期已被压缩。定量整合需要预先定义的合并规则、统计模型或共同验证;在讨论中并列几张差异列表提供的是概念联系。

顺序或层级整合利用生物方向逐步传递候选,例如先由遗传变异限定调控区域,再检查表达和代谢关联;知识驱动整合则把特征投射到通路、反应或调控网络。这些方法提高可解释性,却依赖注释数据库的覆盖和先验方向。选择策略应由任务、样本匹配和可验证命题决定。3

无监督潜变量与样本网络

无监督整合在不使用结局标签的情况下寻找主要变异、共同因子和样本亚群。多组学因子分析(Multi-Omics Factor Analysis,MOFA)把每个组学矩阵分解为共享的样本因子和各层载荷,并可估计一个因子在每层解释的方差。某个因子可能在转录组和蛋白质组都很强、在代谢组较弱,也可能只属于单一层;这种分解比要求所有数据层同步变化更符合真实调控。4

潜因子仍可能主要代表批次、性别、细胞组成或样品质量。解释时应把因子与技术元数据、已知协变量和外部表型关联,检查高载荷特征在独立数据中的稳定性。模型能处理部分缺失或估计未测值,插补后的具体分子丰度属于模型推断值;下游统计应将其与实验观测值区分。

相似性网络融合(Similarity Network Fusion,SNF)先在每个组学中建立样本相似网络,再通过迭代传播融合邻域,适合从多视图发现样本亚型。5 结果依赖每层距离、邻居数、尺度与网络构造;若一种组学主要记录批次,相似网络会把该批次结构带入融合。新亚型应通过重采样稳定性、单层对照、外部队列和临床或功能差异验证,二维可视化的清晰分隔用于展示而非独立证明。

联合与个体变异解释(Joint and Individual Variation Explained,JIVE)、共惯量分析、典型相关和多区块偏最小二乘(partial least squares,PLS)等方法从不同目标分离共同与特异变异或最大化跨块协方差。高相关潜轴可能由少数离群样品驱动,也可能在两个组学中分别对应不同技术因子。选择维数、稀疏度和组件数必须通过重采样或预设准则,并报告未被共同空间解释的层特异信息。

监督整合与预测

监督整合直接利用疾病、处理、连续表型或生存结局寻找跨组学特征。DIABLO 等稀疏多区块方法同时选择能够区分类别且在数据层间协变的变量,形成由转录本、蛋白和代谢物共同组成的候选签名。6 多核学习可为每个组学建立核并学习组合权重,后期 stacking 则把单层模型的预测交给第二层模型。

这类模型尤其容易过拟合,因为特征远多于独立样本,且同一结局同时参与组件、变量和参数选择。评估时应先按实验单位划分训练与测试,再在训练集内部完成所有过滤、插补、尺度、特征选择、组学权重和超参数搜索;嵌套交叉验证估计内部泛化误差,独立队列检验平台、中心和人群迁移。技术重复、同一受试者的不同时间点或同一组织的多个切片必须留在同一数据划分中。

预测性能还应与单组学和临床基线比较。多组学模型可能主要由一个数据层驱动,每层消融可以量化额外组学的稳定增益。校准、类别不平衡、置信区间、独立测试和决策场景共同用于区分可重复预测与仅在训练队列中形成的分子故事。

候选生物标志物需要从特征层返回化学和生物学层。未知代谢峰进入分类器后仍保持原有鉴定层级;高度相关的一组分子可能代表同一离子簇、同一细胞比例或同一批次。独立定量方法、标准品、靶向质谱、组织或时间验证应在模型之外重新测量候选。

通路、反应与网络层整合

通路层整合把各组学先映射到共同的基因集或反应集,再比较方向和证据。这能在不同测量单位之间建立语义桥梁,也降低维数;同时会丢失异构体、区室和未知特征。通路富集的背景集合、标识符映射、物种和数据库版本必须分别为每层定义;多个组学产生的显著 P 值存在样本和生物过程相关,需要使用相应的联合统计模型。

反应中心的整合更贴近代谢机制。基因变异和表观调控影响酶表达潜力,转录本和蛋白量描述表达层,修饰和代谢物反映活性环境,通量刻画物质流。方向一致的跨层链条很有启发性,例如酶量、底物、产物和同位素流共同改变;真实网络还包含可逆反应、多酶复合物、同工酶、旁路和跨区室运输,因此“酶升高—底物下降—产物升高”只是候选解释之一。

相关网络以样本间协变建立边,知识网络使用已知反应、调控或相互作用建立边。前者可发现数据驱动模块,却容易受共同批次、细胞组成和闭合尺度影响;后者便于解释,却偏向研究充分的通路。将二者结合时应标明每条边来自相关、数据库、物理反应还是实验扰动,避免把混合来源网络画成一个已经证明的动态机制。通路富集中的背景选择见功能注释、富集与功能预测,异质边和多层网络的表示见生物网络与系统生物学

时间、扰动与因果解释

横断面多组学能发现共同变化,因果方向还需时间、遗传或扰动证据。遗传变异相对稳定,但表达、蛋白和代谢物之间存在反馈;疾病、药物、饮食和细胞组成又可同时影响所有层。两个分子跨组学相关还可能由共同原因、反向作用、选择偏倚和测量误差解释。

时间序列可提供先后信息。密集采样有助于区分快速代谢响应与较慢的转录或蛋白变化,重复测量模型还需处理个体基线和不规则时间间隔。时间领先相关会受到不同平台采样时间误差、各层响应速度和未测混杂影响,因果判断仍需扰动或其他识别条件。

扰动实验提供更强证据。基因敲除、酶抑制、底物脉冲、药物处理和营养切换可检验候选链条,并用救援(rescue)实验或正交测量区分直接与间接效应。分子数量性状位点(molecular quantitative trait locus,molecular QTL)、共定位、孟德尔随机化和中介分析利用遗传或统计假设研究方向关系,但仍依赖工具变量有效、无水平多效性、模型正确和样本可比等条件。不同方法识别的效应范围应与其假设相匹配。

可信的机制通常来自多种独立证据汇合:一致的时间顺序,结构明确且定量可靠的代谢物,酶活或通量改变,针对性扰动与恢复,以及不同批次、模型或人群中的重复。多组学用于缩小可检验机制空间,实验验证则检验其中的具体链条。

数据共享与可复现报告

多组学报告需要给出各矩阵的样本交集、缺失区块、独立预处理、特征映射、整合目标、算法版本、随机种子、超参数、训练—验证划分和每层贡献。应同时保存未整合的单组学结果与整合对象,使读者能判断结论来自哪一层,以及整合是否真正增加信息;文件、参数、环境和来源记录的组织方式见命令行、工作流与可重复研究。多组学研究面临样本少、特征多、数据层不平衡、注释不全和共享困难等长期挑战,透明的失败模式和替代模型与成功结果同样重要。7

最终结论应对应证据层级。单层可重复的特征变化、跨层共同因子、经独立测试的预测和由时间与扰动支持的机制,分别属于不同强度的声明。把样本匹配、观测模型和验证过程保留在整合结果旁,才能判断新增数据层是否真正增加了可检验信息。

参考资料与延伸阅读


  1. Chu SH, et al. Integration of metabolomic and other omics data in population-based study designs: an epidemiological perspective. Metabolites, 2019, 9(6): 117. 

  2. Pinu FR, et al. Multi-omics integration in biomedical research—a metabolomics-centric review. Analytica Chimica Acta, 2021, 1141: 144–162. 

  3. Jendoubi T. Approaches to integrating metabolomics and multi-omics data: a primer. Metabolites, 2021, 11(3): 184. 

  4. Argelaguet R, et al. Multi-Omics Factor Analysis—a framework for unsupervised integration of multi-omics data sets. Molecular Systems Biology, 2018, 14(6): e8124. 

  5. Wang B, et al. Similarity network fusion for aggregating data types on a genomic scale. Nature Methods, 2014, 11: 333–337. 

  6. Singh A, et al. DIABLO: an integrative approach for identifying key molecular drivers from multi-omics assays. Bioinformatics, 2019, 35(17): 3055–3062. 

  7. Tarazona S, Arzalluz-Luque A, Conesa A. Undisclosed, unmet and neglected challenges in multi-omics studies. Nature Computational Science, 2021, 1: 395–402. 

页面讨论

使用 GitHub 登录后可参与整页讨论;评论独立保存在 GitHub Discussions 中。