生物数据、格式与数据库¶
生物信息学中的“数据”很少只是碱基、氨基酸或一列测量值。一条测序读段来自某次实验和某个样本,一段基因组坐标依附于特定组装版本,一个蛋白质名称可能对应多个物种、基因、剪接异构体和成熟产物,一项功能注释还要说明它来自直接实验、序列推断还是自动传播。文件保存这些对象的某种表示,数据库则进一步保存对象之间的关系、版本、证据和来源。离开这些上下文,即使文件能够被软件读入,分析对象也可能已经发生改变。
公共生物数据库由多种机构和协作网络共同维护,分别承担提交数据归档、参考序列与专家注释建设、多来源坐标整合以及本体、通路或结构化知识维护等任务。理解这些分工,比记忆数据库名称更重要;它决定了一个记录能否作为原始观察、参考对象、功能断言或检索入口来使用。
从样本到数字记录¶
一次组学研究通常同时产生若干层次的对象。研究项目说明总体目的和设计,生物样本记录物种、组织、处理、个体和采样条件,实验记录文库构建、仪器与测定策略,运行记录承载实际产生的读段文件,组装、比对、定量和变异检测则生成派生分析。美国国家生物技术信息中心(National Center for Biotechnology Information,NCBI)的 BioProject 与 BioSample、序列读取档案(Sequence Read Archive,SRA)的 Study—Experiment—Run 关系,以及欧洲核苷酸档案库(European Nucleotide Archive,ENA)的相应对象,共同把研究、样本、实验、运行和文件表示为相互连接而彼此有别的记录。1
在这些对象之上,还会形成参考序列、基因模型、蛋白质条目、结构模型、变异断言和功能注释。它们与原始观测之间的距离不同,维护方式也不同。数据库因而可以按主要职责分成几类,但同一资源可能兼有多种职责。
| 资源类型 | 主要保存内容 | 典型例子 | 阅读时首先确认 |
|---|---|---|---|
| 原始或提交型档案库 | 提交者产生的读段、组装、序列、表达矩阵、结构坐标及相关元数据 | INSDC 的 GenBank/ENA/DDBJ、SRA、GEO、BioStudies、wwPDB | 谁提交、何时提交、对象是否更新、质量控制做到哪一步 |
| 参考集合、知识库与断言档案 | 从公开数据中选择、校验、整合或人工注释的记录,以及带证据的提交断言 | RefSeq、UniProtKB、ClinVar | 选择标准、注释证据、审校状态、版本和冲突断言 |
| 坐标浏览与整合平台 | 在特定基因组组装上叠加基因、变异、表达、保守性等注释轨道 | Ensembl、UCSC Genome Browser、NCBI Genome Data Viewer | 物种、组装、注释发布版、轨道来源和坐标制度 |
| 本体、分类与通路知识系统 | 受控术语、关系、功能断言、通路和分子对象之间的知识图 | GO、Sequence Ontology、InterPro、KEGG | 术语版本、关系类型、证据代码、物种和许可 |
“原始”记录通常已经经过测序平台的碱基识别、档案库的格式校验,有时还包括标准化副本;“人工审校”记录也可以包含计算推断或传播字段。记录中的提交者、处理过程、引用、证据代码和交叉引用共同说明具体字段的来源与证据强度。
标识符、版本与坐标¶
登录号与显示名称¶
稳定标识符用于指向数字对象,显示名称则方便人阅读。基因符号、蛋白名称和网页标题可能重名或改名,唯一身份需要登录号及其适用版本。国际核酸序列数据库合作组织(International Nucleotide Sequence Database Collaboration,INSDC)在核酸序列中采用 accession.version:小数点前的登录号标识记录系列,序列发生改变时小数点后的版本号递增;只写登录号通常会指向当前版本。基因组组装也有独立登录号,例如提交型 GenBank 组装以 GCA_ 开头,RefSeq 组装以 GCF_ 开头,两者即使配对,版本号也可能不同。2
不同资源按照各自的数据模型定义“稳定”。Ensembl 尽量让基因、转录本、蛋白和外显子标识符(identifier,ID)跨发布版延续,但基因模型发生根本变化时旧 ID 仍可能退役;UniProtKB 的主登录号适合长期引用,而 UniRef 聚类每次发布都会重新计算,代表序列改变时聚类 ID 也可能改变。稳定标识符可以减少身份漂移,生物学模型和数据库规则的演化则由版本与历史映射继续记录。3
引用记录时应保留能够重建对象的最小身份集合:数据库名称、登录号及版本、数据库发布版或访问日期,以及必要的组装、样本和分析登录号。下载整个集合时,还要记录查询式、筛选条件、返回字段和文件校验和。网页链接或基因符号需要与这些身份字段配合,才能在数月后找回同一对象。
基因组坐标的参照系¶
基因组坐标至少由物种、组装版本、序列区域、区间起止、链方向和坐标约定共同定义。chr1:100-200 只有同时说明 GRCh37 或 GRCh38 等组装及端点约定,才构成完整的数据对象。BED 通常使用从 0 开始、左闭右开的区间,GFF3 和许多浏览器显示采用从 1 开始、两端包含的区间;VCF 的 POS 也是从 1 开始的位置,但结构变异还需要结合 END、符号等位基因和断点语义解读。跨格式换算需要处理坐标原点和端点约定,跨组装转换还涉及组装差异、间隙、重复序列和无法映射的区段。4
序列本身也可以成为身份依据。全球基因组学与健康联盟(Global Alliance for Genomics and Health,GA4GH)的 refget 用由序列内容计算的标识符取得参考序列,能发现“名称相同、内容不同”或“名称不同、内容相同”的情况。内容寻址负责确认序列本体,物种、组装角色和生物学注释则由常规元数据补充。5
文件格式及其语义边界¶
文件格式是一份关于字段、顺序、数据类型和缺失值的约定。扩展名只提示可能的格式,文件是否符合规范还需要实际校验;同一格式也可能有不同版本、可选标签和实现差异。可靠流程会在读入时校验格式,在输出中保留版本声明、字段定义和参考对象。
| 格式 | 主要对象 | 核心语义 | 解读要点 |
|---|---|---|---|
| FASTA | 一条或多条核酸或蛋白质序列 | > 开头的描述行后接序列;描述行的内部字段没有统一通用模式 |
描述行名称需另行映射到稳定 ID;碱基质量、坐标和注释来自其他字段或文件 |
| FASTQ | 测序读段及逐碱基质量 | 每条记录包含名称、序列、分隔行和等长质量字符串 | 同时确认质量编码、配对关系和档案库可能提供的简化质量值 |
| GenBank/ENA flat file | 带注释的核酸记录 | 记录元数据、特征表、位置表达式、限定词、引用和序列 | 分别核对 feature 的证据来源,并保留复合位置和链方向 |
| GFF3/GTF | 基因组特征及层级关系 | 序列区域、来源、特征类型、坐标、链、phase 和属性;GFF3 可用 ID/Parent 表达层级 |
按各自的属性规则解析 GFF3 与 GTF,并显式处理排序和父子关系 |
| BED/bedGraph | 基因组区间与轨道数值 | BED 是从 0 开始的左闭右开区间;后续列随 BED 子型扩展 | 从浏览器或其他坐标制转换时,同时换算原点和端点 |
| SAM/BAM/CRAM | 读段与参考序列的比对 | SAM 为文本,BAM 为相应二进制编码;CRAM 强调参考相关压缩;header、FLAG、CIGAR 和可选标签共同定义记录 | 起点需与软剪切、缺口、补充比对及参考身份共同解读;CRAM 还需锁定参考 |
| VCF/BCF | 变异位点、等位基因、基因型和注释 | header 声明参考、INFO/FORMAT 字段与版本;BCF 是二进制编码 | 一个 VCF 行可包含多等位和复杂事件,解读时需结合规范化、倍性与缺失基因型 |
| PDBx/mmCIF | 大分子结构模型及实验元数据 | 以数据字典定义的类别、键值和表格表达实体、实验、坐标、装配体与修订史 | 原子坐标需与实验对象、非对称单元/生物装配体和残基编号映射共同读取 |
SAM/BAM/CRAM、VCF/BCF 和 BED 的现行规范由 GA4GH 大规模基因组学工作组维护;GFF3 的规范由 Sequence Ontology 社区维护。FASTQ 则来自长期形成的事实标准,历史上存在多种质量编码,因此档案库和分析软件仍需明确实现约定。PDBx/mmCIF 自 2014 年起成为 PDB 档案的标准格式,旧式定宽 PDB 格式不再扩展,且无法完整表示一些大型结构。678
大数据格式常与压缩和索引共同工作。bgzip 压缩的 VCF 可由 tabix 或 CSI 按区间访问,BAM 常配 BAI/CSI,CRAM 需要参考序列身份能够被可靠解析。索引是依赖主体文件的派生加速结构;移动、重命名或更新主体文件后,应重新检查索引和校验和是否仍匹配。
核酸档案与基因组资源¶
INSDC 与参考序列¶
INSDC 把日本 DNA 数据库(DNA Data Bank of Japan,DDBJ)、ENA 和 NCBI 的核酸档案连接成共同的公共记录体系。成员接收原始读段、样本和项目元数据、组装序列、功能注释及派生分析,分配可引用的登录号,并定期交换公开数据与更新。GenBank、ENA 和 DDBJ 是共享记录的协作归档入口,三处命中通常对应同一项公共记录。它们保存提交者记录和科学史,也可能保留冗余、错误或后来被修订的注释。9
RefSeq 在 INSDC 公开序列之上建立参考集合,使用自动流程、协作注释和不同程度的人工审校,提供基因组、转录本和蛋白质的整合记录。“非冗余”和“参考”描述资源的生产策略;一个物种可以有多条参考序列,不同 RefSeq 条目的人工审阅程度也有差异。分析时应说明使用的是提交型 GCA_ 组装还是 RefSeq GCF_ 组装,并记录具体版本。10
BioProject 描述一个研究计划,BioSample 描述被测的生物材料,SRA/ENA 的实验与运行记录再连接文库和文件。把这些登录号共同保存下来,可以区分生物重复、技术重复、同一样本的不同测定,以及一个项目中多种数据类型。基因组调查序列(genome survey sequence,GSS)、表达序列标签(expressed sequence tag,EST)和 dbEST 等历史分区记录了早期基因组探查序列和表达序列标签。现代表达分析主要使用参考基因组、转录本集合和高通量表达档案,这些历史分区则用于追溯早期基因模型、互补 DNA(complementary DNA,cDNA)克隆和方法史。
组装、注释与坐标浏览¶
Ensembl、加州大学圣克鲁兹分校基因组浏览器(University of California, Santa Cruz Genome Browser,UCSC Genome Browser)和 NCBI Genome Data Viewer 以基因组组装为坐标骨架,整合基因模型、转录本、变异、同源关系、调控和比较基因组信息。UCSC 以轨道叠加和区间浏览见长,Table Browser、数据下载和 track hub 支持批量提取与自定义数据;Ensembl 还提供稳定 ID 历史、BioMart、表述性状态转移应用程序编程接口(Representational State Transfer application programming interface,REST API)和发布版档案。浏览器把多来源证据并置,每条轨道的来源、生成方法、发布日期和组装决定其适用范围。11
UniGene 曾在参考基因组尚不充分时把 EST 和转录本按基因聚类,也曾用于近似表达谱和 cDNA 克隆索引。NCBI 已于 2019 年关闭其网页界面;保留下来的构建服务于历史追溯,现代基因与转录本检索则转向 NCBI Gene、RefSeq、Ensembl 及相应表达档案。Ensembl Genomes、SRS、Sequin 等历史入口同样可能已经改名、退役或改变功能。登录号、发布版档案和正式 API 比网站点击路径更适合长期记录。12
蛋白质、结构与功能知识系统¶
UniProt 将蛋白质序列的归档、功能注释和去冗余检索分成不同资源。UniProtKB 是功能知识库,其中 Swiss-Prot 部分由人工审校,TrEMBL 部分以计算注释为主并等待进一步审校;UniParc 按精确氨基酸序列去冗余,为每条独特序列分配 UniParc 标识符(UniParc identifier,UPI),并保存它在来源数据库中的出现历史;UniRef100、UniRef90 和 UniRef50 则按相同性或相似性与覆盖度聚类,以减少序列搜索空间。聚类成员共享序列相似性,具体功能仍须逐成员核验;UniRef 的代表和聚类 ID 也可能随发布版改变。Proteomes 资源把蛋白集合连接到具体基因组组装,一个物种可以有多个 proteome ID。13
世界蛋白质数据库(Worldwide Protein Data Bank,wwPDB)由 RCSB PDB、PDBe、PDBj 等伙伴共同管理同一套实验大分子结构档案。一个蛋白质数据库(Protein Data Bank,PDB)条目包含坐标,还包含实验方法、样品实体、配体、装配体、质量指标和修订历史。CATH、SCOP 等资源在结构档案上建立结构域或折叠分类,SWISS-MODEL Repository 等保存计算模型。结构档案、结构分类和计算模型分别对应不同的数据对象与证据来源;具体的结构质量、预测置信度和结构比较将在结构生物信息学展开。
基因本体(Gene Ontology,GO)由分子功能、生物学过程和细胞组分三个相互关联的本体组成,GO 注释则是“某个基因产物以某种关系关联某个 GO 类”的带引用和证据代码断言。因此,GO 同时提供本体和注释知识库;注释缺失表示当前记录中尚无相应断言,功能存在与否仍需其他证据判断。InterPro 整合蛋白质家族、结构域和功能位点的签名模型,京都基因与基因组百科全书(Kyoto Encyclopedia of Genes and Genomes,KEGG)组织基因、KEGG ORTHOLOGY(KO)、通路、反应、化合物、疾病和药物等对象。术语命中、模型匹配和通路着色分别提供不同强度的功能线索,机制结论还需要实验或其他独立证据。14
表达、变异与表型数据¶
基因表达综合数据库(Gene Expression Omnibus,GEO)保存研究者提交的微阵列、测序及其他高通量功能基因组数据。其 Platform、Sample 和 Series 分别描述测量平台、样本记录和相关样本构成的研究;由 GEO 团队整理的 DataSet 是其中一个子集,因此部分 GEO Series(GSE)具有对应的 GEO DataSet(GDS)。欧洲原 ArrayExpress 网页界面已于 2022 年关闭,数据和登录号迁入 BioStudies 的 ArrayExpress collection;高通量测序研究的原始读段通常再连接到 ENA,而处理后矩阵、样本注释和方案保留在研究级记录中。15
变异资源按对象和用途分工。单核苷酸多态性数据库(database of Single Nucleotide Polymorphisms,dbSNP)聚合短变异及其提交记录,dbVar 主要保存人类结构变异研究和断言,ClinVar 归档提交者对人类变异—疾病或药物反应关系的分类、证据和修订历史。ClinVar 可以同时呈现一致与冲突的断言,NCBI 工作人员负责数据模型和记录质量,临床分类本身来自提交者。在线人类孟德尔遗传数据库(Online Mendelian Inheritance in Man,OMIM)主要是基因与遗传表型的文献型知识资源,国际人类基因组单体型图计划(International HapMap Project,HapMap)则是具有重要历史意义的群体单倍型项目;两者用于文献知识和群体参考,而通用变异归档由 dbSNP、dbVar 等资源承担。16
miRBase、RNAcentral、DNA 元件百科全书(Encyclopedia of DNA Elements,ENCODE)、Expression Atlas、PRIDE、MetaboLights 等资源分别服务于非编码 RNA、调控元件、表达汇总、蛋白质组和代谢组。SMD、CGED、BodyMap、HGBASE、CANSITE、SPAD、ProNet 等历史资源名称反映了专业数据库的发展,其中许多入口已经关闭、合并或改变维护范围。检索历史文献时可以用原名称追溯;建立新流程时则应确认当前维护者、最后发布版、数据许可和可替代的公共档案。
检索、批量访问与标识符映射¶
数据库检索首先要把生物学问题转换成对象约束。例如寻找“人 TP53”时,应区分基因、某个转录本、某条蛋白质序列、一个基因组区间、一个变异或一项功能断言,并指定物种与参考版本。关键词适合发现候选记录,登录号适合取得已知对象,序列相似性搜索适合寻找相关序列,坐标查询适合提取与某个组装区间相交的注释。BLAST、BLAT 和 FASTA 属于序列搜索算法,它们的评分与统计边界将在序列比对与数据库搜索说明。
网页界面适合探索单条记录,重复任务和大规模下载则应使用正式 API、批量导出或版本化数据发布。NCBI 的 Entrez 与 E-utilities、欧洲分子生物学实验室欧洲生物信息学研究所(European Bioinformatics Institute,EMBL-EBI)各资源的 REST API、UniProt REST、Ensembl REST/BioMart、UCSC Table Browser 和下载服务器都能返回结构化结果。调用时应遵守速率限制和服务政策,分页获取完整结果,并把请求参数、返回格式和失败重试写进分析记录;手工复制网页表格容易截断,且难以重现。17
标识符映射(identifier mapping,ID mapping)是有生物学含义的关系查询。一个基因可以对应多个转录本和蛋白异构体,一条蛋白序列可以出现在多个物种或组装中,旧 ID 可能拆分、合并或退役。映射结果应保留来源数据库、目标数据库、物种、发布版、关系类型和一对多结果,并在后续过滤前报告有多少输入未映射、映射为多个对象或发生版本变化。
一个可复现的数据子集至少应留下以下信息:
- 研究对象、物种、样本和基因组组装;
- 数据库及发布版、登录号版本或访问日期;
- 完整查询式、筛选条件、返回字段和排序/分页方式;
- 下载 URL 或 API endpoint、软件版本和必要的身份验证范围;
- 文件大小、校验和、压缩与索引方式;
- ID 映射表、排除记录及其理由。
这些内容将在命令行、工作流与可重复研究中进一步转化为脚本、环境和工作流记录。
FAIR、开放与受控访问¶
可查找、可访问、可互操作与可复用(Findable, Accessible, Interoperable and Reusable,FAIR)原则强调全局唯一标识符、丰富且可检索的元数据、标准协议、共享的知识表示、明确许可和来源。“可访问”允许访问协议包含认证和授权;敏感数据即使受控,只要元数据可发现、申请条件清晰、获准后能以标准方式取得,仍可具有较高的 FAIR 程度。18
INSDC 公开档案要求公开数据可自由访问,因此不接收必须受控访问的基因组数据。涉及可识别的人类基因型、表型和临床资料时,应依据知情同意和数据使用条件进入 dbGaP、EGA 等受控资源;研究者需提交用途明确的数据访问申请,并在获准的环境和期限内使用。公开摘要、数据字典和研究级元数据不能被反向用于规避个体数据的访问限制。19
可复用还包括许可、伦理和群体语境。技术上的可下载性与再分发许可属于不同条件;群体数据集获批用于疾病研究时,其同意范围还可能限制身份推断、商业用途或与其他数据链接。使用数据库前应同时阅读资源许可、提交者声明、同意范围和引用要求,并在发表时引用数据集登录号、具体版本及数据库的推荐文献,使数据生产者和维护者都能获得可追踪的贡献记录。
数据库记录的证据边界¶
数据库把分散证据集中到可检索的记录中,同时保留其不完整和冲突。提交型档案中的记录可能含错误;自动注释会传播训练数据和同源推断的偏差;人工审校受文献范围与时间限制;同一基因在不同组装、注释管线和物种中可能具有不同边界。检索结果为空既可能反映对象确实缺失,也可能来自名称不一致、物种或版本错误、权限限制、索引延迟或查询条件过严。
阅读一条记录时,可以依次检查其身份、对象、来源和结论:登录号及版本指向什么;它代表样本、序列、模型还是断言;字段来自提交、计算还是审校;引用和证据代码支持到哪一层;与其他记录的交叉引用是一一对应、近似映射还是仅为相关链接。只有把这些问题回答清楚,数据库结果才从“搜索命中”转化为可用于分析和论证的证据。
参考资料与延伸阅读¶
- INSDC. About the International Nucleotide Sequence Database Collaboration.
- NCBI. The NCBI Handbook;Sequence Identifiers.
- EMBL-EBI Training. Introductory bioinformatics pathway;EMBL-EBI, programmatically.
- UniProt Consortium. UniProtKB、UniRef 与 UniParc 文档。
- Gene Ontology Consortium. Gene Ontology overview;Introduction to GO annotations.
- GA4GH Large Scale Genomics Work Stream. SAM/BAM, CRAM, VCF/BCF and BED specifications.
- The Sequence Ontology. GFF3 specification.
- wwPDB. PDBx/mmCIF General FAQ.
- Wilkinson MD, et al. The FAIR Guiding Principles for scientific data management and stewardship. Scientific Data. 2016;3:160018.
-
NCBI 对 BioProject 与 BioSample的定义,以及 INSDC 对 project、sample、experiment、run、assembly 和 analysis 等对象的最小规范,共同说明研究、材料、测定和文件是相互连接而非彼此等同的记录。 ↩
-
NCBI Sequence Identifiers解释
accession.version;Genome assembly versioning and status说明GCA_、GCF_组装登录号及其独立版本规则。 ↩ -
Ensembl 的档案与稳定 ID 说明记录 ID 延续、退役和历史映射;UniProt 建议以主登录号链接 UniProtKB,并说明 UniRef 聚类标识会随重算改变。 ↩
-
UCSC 文档明确区分 BED 的 0-based、half-open 坐标与其他 1-based 表示;GA4GH hts-specs维护 BED、SAM/BAM/CRAM 与 VCF/BCF 的现行规范。 ↩
-
GA4GH refget specification定义按序列摘要标识并取得参考序列的接口,同时要求服务返回算法、长度等元数据。 ↩
-
GA4GH Large Scale Genomics Work Stream, Specifications of SAM/BAM and related high-throughput sequencing file formats. ↩
-
The Sequence Ontology, GFF3 specification. ↩
-
wwPDB 的 PDBx/mmCIF General FAQ说明标准格式、数据字典及旧 PDB 格式的表达限制。 ↩
-
INSDC 的组织说明列出成员、公开数据交换、持久标识符、数据范围与开放访问原则;其技术规范维护共同的特征表、受控词汇和提交标准。 ↩
-
NCBI About RefSeq说明其综合、非冗余、持续维护的参考集合及自动计算、协作和人工审校等不同生产路径。 ↩
-
UCSC Genome Browser User Guide说明组装坐标、注释轨道、Table Browser 和自定义轨道;Ensembl Archives说明发布版档案与 ID 历史。 ↩
-
NCBI 在 2019 年退役 UniGene,同时保留旧构建用于历史访问;这也是区分历史数据库名称与当前数据入口的实例。 ↩
-
UniProt 对 UniProtKB、UniRef、UniParc和 Proteomes分别给出知识库、聚类、精确序列档案和组装相关蛋白集合的定义。 ↩
-
GO Consortium 的本体概览与注释说明区分术语图和带证据断言;KEGG overview列出其基因、KO、通路、化学物质、疾病与药物等对象体系。 ↩
-
NCBI GEO Overview说明 Platform、Sample、Series 和 DataSet 的关系;EMBL-EBI 的迁移公告说明 ArrayExpress 数据与登录号进入 BioStudies collection。 ↩
-
NCBI 对 ClinVar的说明强调它归档提交断言、证据、冲突和版本,而非自行改写分类;dbVar保存人类结构变异研究,适用范围与 dbSNP 不同。 ↩
-
NCBI 将 E-utilities作为 Entrez 的公共 API;EMBL-EBI 的程序化访问课程说明用 REST API 自动取得并连接多类生物数据。 ↩
-
Wilkinson 等提出的 FAIR 指导原则明确涵盖唯一标识符、丰富元数据、标准协议、共享词汇、许可与 provenance,并允许在必要时使用认证和授权。 ↩
-
INSDC 说明公开档案不接收必须受控访问的数据;EMBL-EBI 将 EGA用于敏感人类遗传、表型和临床数据,NCBI 的 dbGaP则以同意分组和数据访问申请管理个体级基因型—表型数据。 ↩
页面讨论
使用 GitHub 登录后可参与整页讨论;评论独立保存在 GitHub Discussions 中。