Skip to content

代谢组学

代谢物处在生物化学反应的底物、中间体和产物层。它们的丰度会受到基因型、酶活性、营养、微生物、药物、昼夜节律和环境条件共同影响,因此能够灵敏地记录一个生物系统在特定时刻的状态。代谢组学试图在明确的样品和条件中系统测量这些小分子,并从变化模式追溯可能的反应、调控和表型联系。

代谢物接近表型,但上游变化与代谢物丰度之间没有固定的放大关系。稳态缓冲、旁路反应、区室隔离和底物供给可能吸收上游变化,外源摄入和清除也可独立造成显著波动。异构体、加合离子、未知天然产物和来源混合,使小分子的命名、鉴定与跨研究比较成为代谢组学最困难的环节之一。

代谢组数据还可与基因组、转录组和蛋白质组共同解释,但跨层比较要先解决样本匹配和各层观测模型。相关的研究设计、潜变量、样本网络、监督预测与因果边界由多组学整合单独展开;以下集中讨论从小分子样品到化合物、浓度、通路和通量结论的证据链。

代谢组、代谢物与测量对象

“代谢组”总是相对于一个边界定义。它可以指某种细胞在一段处理时间后的胞内小分子,也可以指组织、血浆、尿液、培养上清或整个生物体中的可检测化合物。胞内代谢组强调细胞自身的反应网络;培养基和体液中的外代谢组还包含摄取、分泌、运输与清除的综合结果。植物和微生物研究常区分初生代谢物与物种特异的次生代谢物,医学样品中则会同时检测食物、药物、宿主与微生物来源的分子。

“内源化合物”只是代谢组的一部分。一个血浆峰可能来自人体酶反应、肠道菌转化、饮食摄入、药物代谢或采样材料污染;它也可能是原分子在离子源内形成的碎片。研究者需要保留样品来源、物种、组织、亚细胞区室、采样时间和暴露信息,再据此判断信号的生物来源。

代谢物丰度描述某一时刻的池大小,代谢通量描述物质通过反应网络的速率。一个中间体可以因生成与消耗同时加快而维持近似恒定,也可以因下游阻塞而积累,却伴随通量下降。常规代谢组的峰面积或浓度提供池大小信息;反应方向和速率通常需要稳定同位素示踪、时间序列及相应的代谢模型。1

历史上,代谢轮廓分析(metabolic profiling)常指一组已知化合物的定向测量,代谢指纹分析(metabolic fingerprinting)强调以整体谱图区分样品,代谢组动态分析(metabonomics)着重生物系统对刺激或疾病的动态代谢响应。今天这些用语在不同领域仍有交叠。清晰的报告应直接说明测量对象、覆盖范围和分析目的。

研究设计与分析前变异

代谢反应快,样品离开原环境后仍可能继续变化。组织缺血时间、细胞收集速度、代谢淬灭、离心温度、冻融次数、保存时间和提取溶剂都会改变结果。饮食、运动、药物、昼夜时间、年龄、性别、发育阶段和微生物组成也是常见生物变异来源。研究问题应在采样前转化为可记录的条件、随机化方案、阻断因素和排除标准。

实验单位决定统计重复。来自同一动物的一块组织被重复进样,产生技术重复;同一细胞培养皿分成多个提取管,仍属于一个生物学重复。病例—对照、处理—对照和时间序列应在提取板、自动进样器顺序和仪器批次中交错安排,避免研究组别与分析批次重合。盲化样品标签可减少人工峰审查和质量排除中的期待偏倚。

代谢组覆盖对样品量和提取化学敏感。极性代谢物、脂质和挥发性化合物往往需要不同溶剂或平台,一次提取对各类别的回收率也不同。若还要测转录组或蛋白质组,应在设计阶段决定采用同一样品的分装、平行生物学重复,还是不同组织来源。每种方案具有不同的“匹配”含义,必须保存原始样品、分装、提取物和仪器文件之间的标识符关系。

靶向、非靶向与示踪策略

靶向代谢组预先确定待测化合物,依据标准品的保留时间、离子和碎片选择监测信号。三重四极杆上的选择反应监测(selected reaction monitoring,SRM)/多反应监测(multiple reaction monitoring,MRM)可在复杂基质中获得较高选择性;同位素标记内标、基质匹配校准曲线和方法验证还可支持绝对浓度。覆盖范围由目标清单界定,清单外化合物需要其他采集方法发现。

非靶向代谢组尽可能广泛地采集可重复检测的信号,先形成以质荷比、保留时间和强度描述的特征矩阵,再逐步聚类离子、获取碎片并注释结构。色谱、离子化模式、质量范围、采集速度和数据处理参数共同规定了“非靶向”方法可见的化学空间,其中保留未知或未预期变化,结果常以相对丰度和不同置信度的注释表达。

半靶向或广靶向策略处在二者之间,使用预建离子、保留时间或碎片库扩大目标数目,同时维持较稳定的定量流程。同一个“广靶向”数据集可能使用标准品、公共谱库或仅由预测的离子跃迁建立目标,报告时应列明每种化合物实际拥有的鉴定和定量证据。

稳定同位素示踪回答来源和流向问题。向系统加入 \(^{13}\mathrm{C}\)\(^{15}\mathrm{N}\) 或氘标记底物后,分析不同代谢物的同位素体分布及其随时间的变化,可以判断碳或氮进入哪些产物。示踪信号受天然同位素丰度、示踪剂纯度、交换反应、池大小和非稳态过程影响;标记进入某产物证明原子贡献,具体反应路径还需结合网络和其他示踪信息。代谢通量分析则在明确的稳态或动态假设下联合拟合数据。

质谱与核磁共振平台

气相色谱—质谱(gas chromatography–mass spectrometry,GC–MS)适合挥发性或经衍生化后可挥发的小分子。气相色谱提供较高分离度,电子轰击产生的碎片谱在标准条件下具有较好的库间可比性,保留指数可进一步支持匹配。糖、有机酸和氨基酸等极性分子常需化学衍生化;衍生效率、多个衍生物和热不稳定性都会影响峰的数目与强度。

液相色谱—质谱(liquid chromatography–mass spectrometry,LC–MS)覆盖范围广。反相色谱偏向中等至疏水分子,亲水相互作用色谱有助于保留高极性代谢物;正、负离子模式又偏好不同官能团。电喷雾离子化灵敏但受基质效应影响,同一化合物可产生质子化、去质子化、钠/铵加合物、二聚体、同位素峰和源内碎片。因此一个化合物可能对应多个峰,一个峰也可能包含共洗脱信号。

毛细管电泳—质谱(capillary electrophoresis–mass spectrometry,CE–MS)按电荷和电泳迁移率分离离子型、高极性化合物,可补充 LC–MS 对部分中心碳代谢物的覆盖。离子迁移谱还能在质荷比和保留时间之外提供碰撞截面相关维度。每增加一个维度都会改善某些分离,也同时引入校准、数据库覆盖和跨平台对齐的新要求。

核磁共振(nuclear magnetic resonance,NMR)记录核自旋在磁场中的化学环境。它的灵敏度通常低于质谱,谱峰也可能严重重叠,却具有样品破坏少、响应较可预测、结构信息丰富和跨批次稳定等优点。合适的内标和采集参数可支持定量,一维 \(^1\mathrm{H}\) 谱适合高通量轮廓,二维或异核实验可帮助解决重叠和结构归属。NMR 数据需要锁场、匀场、脉冲序列、温度、相位与基线处理的完整记录,并以质量控制确认平台稳定性。2

不同平台观察的是相互重叠而不相同的化学空间。将 LC–MS、GC–MS 和 NMR 结果合并时,应保留平台来源、离子模式和鉴定证据,并识别同一化合物在多个平台上的重复测量。平台间一致可以增强证据,平台间缺失则可能来自各自检测边界。

原始信号与特征矩阵

LC–MS 原始数据由随保留时间变化的质谱和色谱组成。处理流程通常先作质心化或直接读取轮廓(profile)数据,再检测连续扫描中形成的色谱峰,校正保留时间漂移,在样品间建立对应特征,并对漏检位置重新提取信号。峰宽、噪声、最小强度、质量误差和对齐窗口会改变最终特征表;同一原始文件用不同参数处理,可能产生明显不同的候选峰集合。

接着要把同位素、加合离子、二聚体和源内碎片归入可能的中性分子。若错误地把钠加合峰当作质子化分子,后续分子式和数据库候选会整体偏离。共洗脱和强度相关有助于分组,在复杂样品中的同源关系还需碎片或标准品支持;数据依赖串联质谱(tandem mass spectrometry,MS/MS)也可能在隔离窗内混入多个前体的碎片。保留原始特征、离子注释、归组关系和每一步软件版本,才能追溯“代谢物表”是如何生成的。

GC–MS 处理需要从共洗脱信号中解卷积碎片谱,并用保留指数和谱库比较化合物。NMR 流程则包括傅里叶变换(Fourier transform)、相位和基线校正、化学位移对齐、峰拟合或谱段积分。简单分箱可以降低位移小变动的影响,也会把相邻代谢物混入同一变量;目标谱拟合能直接给出候选浓度,但受参考谱库与重叠模型限制。

开放格式把数据层分开保存。mzML 用于交换质谱的谱图、色谱和采集元数据,mzTab-M 面向代谢组与脂质组的定量结果和注释;二者应与原始厂商文件、样品元数据和处理参数一同保存。3 最终矩阵至少要把每个特征连接到原始文件、样品、检测平台、保留时间/化学位移、离子或谱峰证据、处理版本和质量标记。

质量保证、空白与批次漂移

质量保证从系统适用性开始。已知混合物可检查质量准确度、保留时间、峰形、灵敏度和碎片采集;溶剂空白观察系统背景,经过完整提取流程的过程空白(process blank)还能发现试剂、塑料、柱流失和样品间携带污染。生物样品中检测到的峰还需与空白信号比较,空白接近或超过样品时应优先考虑非生物来源。

由研究样品等量混合的汇总质量控制样品(pooled quality control sample,pooled QC)代表本批次常见基质和特征范围。批次开始的重复进样可使色谱柱和离子源进入相对稳定状态,随后穿插的 pooled QC 用于监测特征级精密度、保留时间和随进样顺序的响应漂移。长期参考样品或标准参考物质则帮助比较批次和实验室。pooled QC、空白和独立生物学重复分别评价仪器漂移、污染与生物变异。4

漂移校正通常根据 QC 随进样顺序的变化为每个特征拟合曲线,再调整生物样品。若处理组与进样顺序完全重合,数学模型无法区分生物效应与仪器漂移;若 QC 太少,复杂曲线又容易过拟合。校正模型应通过留出或交叉验证检查,并保存校正前后 QC 变异、缺失率和被排除特征的理由。

批次效应还可来自提取日期、操作者、板位、色谱柱、离子源清洁和仪器维护。主成分分析(principal component analysis,PCA)中按批次分开的样品提示问题,校正方法需结合漂移模式和实验设计选择,校正后还要检查残余混杂。平衡设计、随机进样、统一操作、充分 QC 和在统计模型中保留可解释的批次变量共同构成控制策略。

化合物注释与鉴定置信度

代谢组分析首先检测特征,化合物名称来自后续注释与鉴定。高分辨率质谱给出某种离子的精确质荷比和同位素模式,可以缩小分子式范围;同分异构体具有相同分子式,立体异构体甚至可能有相似碎片。精确质量命中数据库产生候选,唯一命名还需碎片、保留性质或标准品证据。5

证据可逐层累积:正确识别离子种类和单同位素峰;分子式与同位素分布相容;实验 MS/MS 与参考或预测碎片相符;色谱保留性质支持候选类别;最后由同一实验室、同一方法下的真实标准品匹配保留时间和质谱。NMR 的一维、二维谱和加标实验可提供独立结构信息。位置异构体、双键位置或立体化学无法区分时,应报告到化学类别、分子式或候选集合。

代谢组学标准倡议(Metabolomics Standards Initiative,MSI)把与同法标准品的多项匹配、谱库或理化性质支持的推定注释、化合物类别和未知信号分成不同层级。6 后来的体系对公式、候选结构和确定结构作了更细划分。由于不同文献中的层级编号可能不同,报告应同时列出实际证据:质量误差、加合物、保留时间、碎片、谱库与版本、匹配分数、标准品及采集条件。

一个分子还可能生成多个相关特征。把质子化峰、钠加合峰和同位素峰分别送入统计和通路分析会重复计算一次化学变化,过早合并共洗脱峰又可能把不同化合物压成一个变量。注释表应保留“特征—离子—候选化合物—已确认化合物”的多对多关系,并允许未知特征继续参与无偏统计。

人类代谢组数据库(Human Metabolome Database,HMDB)、生物学相关化学实体数据库(Chemical Entities of Biological Interest,ChEBI)、脂质图谱(LIPID MAPS)、MassBank、全球天然产物社会分子网络(Global Natural Products Social Molecular Networking,GNPS)等资源提供结构、命名、谱图或生物背景,但覆盖对象和证据层次不同。HMDB 收录人体相关代谢物及其浓度、谱图和疾病等信息,为当前物种和样品中的候选提供背景而非样品特异存在证据。7 搜索时应限制元素、物种、样品类型和可能来源,记录数据库发布版与访问日期,并使用稳定化学标识符避免名称同义和盐形式造成的映射错误。

定量、归一化与尺度

非靶向 LC–MS 的峰面积通常表示同一特征在同一方法中的相对响应。不同化合物的离子化效率、回收率和动态范围差异很大,跨化合物比较摩尔浓度需要各自校准。绝对定量需要标准曲线、适当内标和经验证的线性范围、准确度、精密度、回收率、基质效应、检出限及定量限;稳定同位素标记的同分子内标最能跟随提取与离子抑制,但实际项目常只能为一部分目标配置。

样品归一化要对应生物问题。组织质量、细胞数、总蛋白、DNA、尿肌酐、渗透压或样品体积分别适合不同对象,并各自带有测量误差和生物含义。总离子流、中位数、概率商等数据驱动方法可减少某些整体差异,却假设大多数特征的变化结构满足相应条件。若处理造成全局代谢物池变化,强行把总信号拉齐可能删除真实效应。

归一化之后常进行对数或广义对数变换以缓和右偏和方差随均值增加,再按中心化、单位方差或 Pareto scaling 调整变量权重。单位方差使低丰度噪声与高丰度稳定峰获得相近影响,Pareto scaling 较温和,未缩放则由高方差特征主导。尺度选择应由分析任务和噪声结构决定,并在训练数据上估计参数后原样应用于验证集。

来自相对丰度或闭合总量的数据可能具有组成性约束:一个成分上升会迫使其他比例下降,即使其绝对量不变。代谢组不总是严格组成数据,但使用总和归一化后会引入类似依赖。相关和差异分析应说明所用尺度,绝对生产或消耗需要绝对定量或通量证据。

缺失值、过滤与统计推断

空白污染、峰检测失败、低于检出限、离子抑制、超出动态范围和化合物真实缺失都可产生空白单元,对应不同缺失机制。统一填为最小值的一半会把处理参数和检测限制造的模式伪装成生物差异,只保留完整特征则可能偏向高丰度分子。分析前应结合原始色谱、组内检出率、空白、QC 和信噪比判断缺失来源,并把过滤、重新提取峰和插补分开记录。

特征过滤通常考虑空白/样品比、pooled QC 变异、稀疏程度、稀释线性和最低信号。阈值应适合方法并在查看研究结局前确定。过滤后的每个特征仍需保留去向日志,避免在“清洗”中静默删除只在某处理组出现、却有可信原始峰的生物学信号。

单变量分析应匹配独立、配对、重复测量或分层设计,报告效应量、置信区间和多重检验校正。代谢特征之间高度相关仍需相应的多重比较控制。差异倍数和显著性应与峰质量、鉴定置信度和独立验证共同报告;一个统计上显著的未知特征仍应以未知特征身份报告。

PCA 是无监督降维,可用于观察主要变异、异常样品和 QC 聚集,但主成分未必对应研究处理。偏最小二乘判别分析(partial least squares discriminant analysis,PLS-DA)、正交偏最小二乘判别分析(orthogonal PLS-DA,OPLS-DA)等监督方法会主动寻找与分组最相关的方向,在小样本高维数据中很容易得到漂亮分离。特征选择、缺失插补、尺度变换和参数调整必须嵌入交叉验证,并使用标签置换、嵌套验证,最好再以独立队列评价;使用全体数据挑峰后再交叉验证会发生信息泄漏。2

通路映射、代谢网络与通量

通路分析先要把特征映射到稳定化合物标识符,再连接到具体物种、细胞区室和反应。一个质量特征可能对应多个候选,一种代谢物又可能参与许多反应;不同数据库对通路边界、可逆性和名称的定义也不完全相同。直接用候选名称做富集会把注释不确定性隐藏为确定的通路命中。

过度代表分析把显著代谢物集合与背景集合比较,背景应是本平台在当前样品中实际可检测和被分析的代谢物。拓扑方法再考虑代谢物在反应网络中的位置。对未鉴定 LC–MS 特征,一些方法可在允许质量误差和多候选映射下寻找通路层面的聚集;这适合生成假说,每个峰的具体化合物身份仍需独立鉴定。

反应网络为转录、蛋白和代谢物提供共同语义:基因编码酶,蛋白催化反应,代谢物连接底物与产物。然而 mRNA 丰度、酶蛋白量、活性和通量之间存在翻译、降解、修饰、别构和底物限制。某酶和下游产物同时升高也可能由共同调控、细胞组成或反馈造成。结构化网络帮助提出方向明确的机制候选,真实物质流则需示踪或通量测量。

稳定同位素数据可把池大小与原子流动结合;约束代谢模型和 13C 代谢通量分析则在化学计量、交换反应和稳态假设下估计通量。模型结果依赖反应边界、区室、未测交换和测量误差,必须报告可辨识性、替代解与实验条件。代谢网络越完整,未知支路和细胞异质性带来的不确定性也越需要显式表达。

数据共享与可复现报告

一个可复现项目需要从受试者或生物样品追溯到分装、提取、批次、原始文件、处理特征和最终注释。代谢组报告应保存采样与保存、提取和衍生化、色谱柱与流动相、离子源、质量分析器、采集模式、校准、进样顺序、空白、QC、内标、处理软件与参数、过滤和漂移校正、鉴定证据及定量单位。最终命名代谢物表需要与峰、污染判定和候选结构证据一同保存。

MetaboLights 是跨物种、跨平台的开放代谢组研究库,代谢组学工作台(Metabolomics Workbench)接受靶向与非靶向的 MS 和 NMR 数据及实验元数据。8 提交时应连接原始文件、处理结果、样本属性和方法,使用稳定研究登录号;受控人类表型还要遵循同意范围与访问控制。公共存储同时检验样品标识、元数据和各数据层能否相互解释。

最终结论应对应证据层级。可重复的检测信号变化、由谱图和标准品支持的化合物身份、经校准的浓度以及由示踪和模型约束的通量,分别属于不同强度的声明。把原始信号、处理参数、化学证据和统计不确定性连接起来,才能让代谢组结果继续接受跨平台复核和实验修正。

参考资料与延伸阅读


  1. Jang C, Chen L, Rabinowitz JD. Metabolomics and isotope tracing. Cell, 2018, 173(4): 822–837. 

  2. Powers R, et al. Best practices in NMR metabolomics: Current state. TrAC Trends in Analytical Chemistry, 2024, 171: 117478;NIST publication record。 

  3. Martens L, et al. mzML—a community standard for mass spectrometry data. Proteomics, 2011, 11(3): 369–371;Hoffmann N, et al. mzTab-M: a data standard for sharing quantitative results in mass spectrometry metabolomics. Analytical Chemistry, 2019, 91(5): 3302–3310. 

  4. Broadhurst D, et al. Guidelines and considerations for the use of system suitability and quality control samples in mass spectrometry assays applied in untargeted clinical metabolomic studies. Metabolomics, 2018, 14: 72. 

  5. Alseekh S, et al. Mass spectrometry-based metabolomics: a guide for annotation, quantification and best reporting practices. Nature Methods, 2021, 18: 747–756. 

  6. Sumner LW, et al. Proposed minimum reporting standards for chemical analysis. Metabolomics, 2007, 3: 211–221;Metabolomics Society, Metabolite Identification and MetFAIR task groups。 

  7. Wishart DS, et al. HMDB 5.0: the Human Metabolome Database for 2022. Nucleic Acids Research, 2022, 50(D1): D622–D631. 

  8. EMBL—EBI, MetaboLights;NIH Common Fund, Metabolomics Workbench data repository。 

页面讨论

使用 GitHub 登录后可参与整页讨论;评论独立保存在 GitHub Discussions 中。