Skip to content

生物信息学

生物信息学(bioinformatics)把生命科学中的样品、测量和已有知识转化为可以保存、比较与计算的对象,再用算法、统计模型和数据库证据回答生物学问题。它处理的可以是一条核酸序列、一组质谱峰、一个细胞的表达谱、一套蛋白质坐标或一张分子网络;这些数据看起来很不相同,却都需要说明对象如何产生、怎样编码、经过哪些处理,以及结论能够支持到什么程度。生物学、计算机科学、数学和统计学由此在同一条推断链上共同工作。1

这门学科的核心工作超出单纯的软件使用。数据库检索、序列比对、聚类、结构预测和机器学习模型只在问题、数据与评价方式相互匹配时才有意义。一个成熟的分析既要理解实验读出,也要检查标识符、版本、坐标和缺失机制;既要能运行程序,也要知道目标函数、零模型和误差从哪里进入;最后还要把代码、参数、环境和中间产物保存到足以复核的程度。国际生物信息学教育框架因此同时把生命科学、数据科学、计算机科学、数据管理和专业实践列为核心能力。2

从生命过程到可计算对象

生物信息学分析始于一次对象转换。测序仪读取荧光或离子电流,质谱仪记录离子的质荷比与强度,显微或空间平台记录位置和信号,公共数据库则把实验提交、参考序列、人工审校和计算注释组织为相互连接的记录。研究者实际计算的是读段、峰、计数、坐标、图和标签,而这些数字怎样对应原来的分子、细胞与个体,取决于取样、实验设计和数据模型。

同一生物实体常有多套标识和版本。一个“基因”可能指基因座、转录本、蛋白质产物或数据库中的稳定记录;一个变异坐标只有在物种、组装、染色体名称和坐标约定明确后才可重现;一条蛋白质序列更新后,旧位点编号也可能失去对应。把名称匹配当成实体匹配,会在数据合并之前就制造错误。因此,登录号、版本、参考坐标、样本元数据和来源记录属于分析本身,并须从分析开始便进入记录。

数据对象还决定可以提出什么结论。读段支持对样品中分子片段的观察,表达矩阵描述特定测量条件下的相对丰度,结构坐标是实验数据或计算模型的解释,网络边则可能代表物理接触、遗传互作、相关或数据库推断。计算可以增强、比较和组合这些证据,却不能让输入获得它原本没有的时间顺序、空间分辨率或因果对照。

分析链的成立条件

完整分析先把研究问题写成可观察的比较:分析单位是什么,哪些样本彼此独立,处理和对照怎样设置,主要结局与混杂因素如何定义。随后才选择测量平台、参考集合和计算方法。若实验单位、时间点或群体覆盖不足,后续再精细的算法也只能更准确地分析一个受限的数据集。

原始信号经过碱基判读、峰提取、图像分割或谱图处理,形成可计算记录;质量控制再检查污染、批次、文库复杂度、检测下限、参考偏倚和异常样本。过滤与归一化会改变哪些对象进入分析以及它们之间的数值关系,所以阈值、背景集合和变换方式必须与研究问题一起确定。未检出同时涵盖真正缺失与受平台、样品量或算法限制而未被观测到的情况。

模型把数据与问题连接起来。序列比对需要替换得分和空位代价,基因识别需要关于状态与信号的假设,差异分析需要设计矩阵和误差分布,系统发育需要替换模型与树搜索,机器学习还要分开训练、调参与测试。模型输出是条件于输入、参数和假设的估计或预测;显著性、置信分数与分类概率对应不同的统计量和评价目标,彼此不可互换。

分析的最后一步是回到生物对象。候选基因、差异通路、结构模型或网络模块需要同独立数据、已有知识和实验验证相互核对,并写明替代解释。与此同时,原始数据、处理脚本、软件版本、参数、随机种子和运行环境应形成可追溯记录。这样便形成一条可以检查、重算和在新材料中继续检验的证据链。

数据、计算与工作流

生物数据、格式与数据库从样本、研究、实验、运行和分析记录之间的关系出发,说明登录号、版本、参考坐标以及 FASTA、FASTQ、GFF、BED、SAM/BAM/CRAM、VCF/BCF 和 PDBx/mmCIF 等格式承载的语义。页面同时区分提交型档案、参考集合、知识库、本体和整合平台,并展开批量访问、标识符映射、可查找、可访问、可互操作与可复用(Findable, Accessible, Interoperable and Reusable,FAIR)原则及受控访问。它回答的是“数据究竟是什么、从哪里来、怎样可靠地连接”。

算法、统计与计算基础建立复杂度、动态规划、优化、概率模型、统计推断和机器学习评价的共同语言。学习重点是辨认一个程序在优化什么、近似在哪里发生、训练集与测试集是否独立,以及多重比较、类别不平衡和数据泄漏会怎样改变结果。

命令行、工作流与可重复研究把单次操作组织为可追踪的分析过程:文件流和 shell 负责组合工具,脚本与版本控制保存变化,环境和容器固定依赖,工作流系统表达任务之间的输入输出关系,日志、测试和运行清单记录实际发生了什么。这些实践使同一分析可以在本机、集群或云端迁移,也让失败能够定位、结果能够复核,并支持 FAIR 数据管理。3

测序与序列

测序技术、读段与质量控制沿样品分子、平台信号、碱基判读和 FASTQ 进入读段质控,涵盖链终止测序、早期分离方法和并行平台的方法史,并区分短读长、PacBio HiFi 与 nanopore 读段各自的误差和证据边界。序列比对与数据库搜索进一步讨论替换得分、空位模型、动态规划、FASTA/BLAST、E-value、序列谱(sequence profile)模型、多序列和全基因组比对,使“相似”能够解释为有条件的对应关系,并与同源和相同功能相区分。

序列特征、基因识别与功能位点从开放阅读框、调控信号、重复和密码子偏好进入核糖核酸(ribonucleic acid,RNA)结构、蛋白质理化性质、信号肽、跨膜拓扑、结构域、无序、定位和翻译后修饰预测。经验规则、经典算法和现代模型共同说明可预测范围与置信度,并接受独立证据检验。

基因组

基因组组装、变异与比较分析把读段关系转成组装图和单倍型,再沿参考比对、小变异、结构变异、分相、注释、共线性、基因家族与泛基因组展开。表观基因组与三维基因组分析则把脱氧核糖核酸(deoxyribonucleic acid,DNA)修饰、蛋白富集、染色质可及性、染色质构象捕获(chromosome conformation capture,3C)及其高通量版本 Hi-C 的读出转为比例、峰、状态和接触矩阵。两页共同强调参考坐标、重复、倍性、细胞混合和实验化学怎样限制可见对象。

分子组学

转录组测量与 RNA 测序(RNA sequencing,RNA-seq)分析从定量聚合酶链式反应(quantitative polymerase chain reaction,qPCR)、微阵列、表达序列标签(expressed sequence tag,EST)和基因表达系列分析(serial analysis of gene expression,SAGE)的经典测量进入群体 RNA-seq、转录本结构与 RNA—蛋白结合,沿群体样本、表达矩阵和统计比较建立分析链。单细胞与空间转录组学则以细胞或捕获位置为观测单位,讨论细胞条形码(cell barcode,barcode)、唯一分子标识符(unique molecular identifier,UMI)、稀疏矩阵、簇与轨迹、空间域和细胞邻域。两页共同强调取样位置、文库组成、归一化和观测模型怎样限制表达结论。

蛋白质组与质谱数据分析连接二维电泳、蛋白芯片、酵母双杂交与现代液相色谱—串联质谱(liquid chromatography–tandem mass spectrometry,LC–MS/MS),追踪峰、谱图、肽段、蛋白质和蛋白质形态(proteoform)之间的推断层级。数据依赖型采集(data-dependent acquisition,DDA)、数据非依赖型采集(data-independent acquisition,DIA)、靶向采集、目标—诱饵、错误发现率(false discovery rate,FDR)、蛋白推断、定量、修饰定位、互作与空间蛋白质组,都必须区分“没有证据”与“证据表明不存在”。

代谢组学从小分子采样、质谱法(mass spectrometry,MS)与核磁共振波谱法(nuclear magnetic resonance spectroscopy,NMR)信号、特征提取、质量控制、鉴定和定量进入通路、示踪与通量,并区分特征、离子、候选结构和确定化合物之间的证据层级。多组学整合则从跨平台样本匹配和各层观测模型进入早期、中间、后期及层级整合;潜变量、样本网络和预测模型只有在验证设计中增加可复核信息,才构成跨层证据。

结构生物信息学

结构生物信息学把实验坐标、结构比较、比较建模、穿线(threading)、从头预测和 AlphaFold 类模型放在同一条历史与证据链中。结构模型可用于提出结合、催化、变异和动力学假说,但局部置信度、构建体、构象状态、复合物组成及实验数据始终决定解释边界。

功能注释与预测

功能注释、富集与功能预测区分对单个实体作出的功能断言、对基因集合进行的富集检验和对未知对象提出的预测。序列同源、结构域、基因组语境、结构、基因本体(Gene Ontology,GO)、京都基因与基因组百科全书(Kyoto Encyclopedia of Genes and Genomes,KEGG)、Reactome 与网络证据可以相互补充,但标识符映射、背景集合、注释偏倚、多重检验和实验验证决定结果能够推进到哪一步。

分子进化与系统发育

分子进化与系统发育分析从取样和位置同源进入替换模型、距离法、最大简约、最大似然、贝叶斯推断、分支支持、分子钟、基因树—物种树及选择与群体历史统计。树是取样、比对、模型和搜索共同形成的推断对象,图形次序本身不提供祖先、进步或确定性。

生物网络与系统生物学

生物网络与系统生物学组织物理互作、遗传互作、调控、共表达、代谢和知识关系,继而讨论中心性、模体、社区、传播、功能预测与多层网络。静态拓扑可以描述关系格局;要解释反馈、稳态和扰动响应,还需布尔、微分方程、随机或代谢约束模型,并以时间序列和干预实验检验。

证据层级与可重复性

生物信息学结果常跨越多层证据。原始仪器信号和实验记录最接近观测,经过处理后形成读段、峰、计数或坐标;数据库再保存这些对象、人工审校和自动注释;统计模型估计关系与不确定性;预测模型把已知模式推广到未观察对象;机制解释则需要把这些结果同干预、时间顺序和生物学过程连接。越过其中任何一层都可能得到有用假说,但必须明确跳过了什么。

公共数据库和大样本仍然受到多种偏倚影响。参考基因组代表有限个体,数据库记录集中在研究充分的物种和分子,实验平台偏向容易提取、扩增、离子化或定位的对象,阴性结果也较少进入档案。训练模型时,同源序列、同一患者、同一批次或网络相邻实体若跨越训练与测试集合,还会造成信息泄漏。评价因此要围绕真正的新样本、新家族、新时间或新实验条件设计,以随机拆分下的高分作为唯一目标会高估泛化能力。

可重复研究要求另一位研究者能够从相同数据和分析说明重现计算结果;独立实验是否得到一致观察,则是更强也不同的检验。FAIR 原则使数据和其他数字研究对象更容易被发现、取得、互操作和复用,并与分级开放、隐私保护、知情同意、许可和长期维护共同构成数据治理。4 生物信息学的可靠性最终来自问题、实验、数据、模型、计算记录和验证彼此衔接。

阅读路径

第一次系统学习时,可以先读生物数据、格式与数据库算法、统计与计算基础命令行、工作流与可重复研究,建立对象、方法与过程三套共同语言;随后依次进入测序与序列、基因组和分子组学。结构、功能、系统发育和网络专题适合在掌握相应数据对象后选读,因为它们经常同时调用前面多种数据与模型。

如果从一个具体课题进入,则可沿实际证据链阅读。研究一个未知蛋白时,可从序列搜索与特征预测进入结构、功能注释、蛋白质组和网络;研究一种表型变异时,可从测序和基因组分析进入表达、表观组、多组学与通路;研究谱系历史时,则从同源序列、比对和基因组比较进入系统发育。每条路径都应回到同一组检查:样本是谁,数据怎样产生,实体如何标识,模型假设是什么,评价是否独立,结论还缺哪一种验证。

生物信息学最重要的学习成果,是能够把一张结果图重新展开成完整的研究过程。读者既要看懂序列、矩阵、树、结构和网络,也要能追问它们由哪些原始对象生成、哪些步骤改变了数据、哪些替代解释仍然存在。经典算法、现代组学和机器学习由此成为在不同证据条件下协同工作的研究方法。

参考资料与延伸阅读


  1. EMBL-EBI. About EMBL-EBI: frequently asked questions. 该机构将生物信息学界定为结合生物学、计算机科学、数学和统计学以分析、解释生命科学数据的交叉领域,并将数据库、软件工具和算法列为其基础设施组成。 

  2. Brooksbank C, et al. The ISCB competency framework v. 3: a revised and extended standard for bioinformatics education and training. Bioinformatics Advances. 2024;4(1):vbae166。该框架以生命科学、数据科学、计算机科学和专业实践组织 13 项能力,并把数据管理与 FAIR 实践纳入训练目标。 

  3. Wilson G, et al. Good enough practices in scientific computing. PLOS Computational Biology. 2017;13(6):e1005510。该文从数据管理、软件、协作、项目组织、工作追踪和写作说明科研计算的基础实践。 

  4. Wilkinson MD, et al. The FAIR Guiding Principles for scientific data management and stewardship. Scientific Data. 2016;3:160018。FAIR 面向人和机器对数字研究对象的发现与复用,并明确是指导原则而非某一种技术标准。 

页面讨论

使用 GitHub 登录后可参与整页讨论;评论独立保存在 GitHub Discussions 中。