系统发育与生物分类¶
生物分类(biological classification)把可识别的生物组织成名称稳定、便于交流的类群,系统发育(phylogeny)则研究这些类群从共同祖先分化而来的历史。林奈式阶元、比较形态、胚胎和化石资料建立了早期分类的主体;DNA、蛋白质和基因组数据后来提供了数量更大的独立性状。形态用于识别结构同源、功能转变和灭绝类群,分子资料则比较遗传变化。现代系统学把它们共同放进可检验的谱系假说。
分类、命名与谱系¶
分类学、命名法与系统学¶
分类学(taxonomy)负责描述、鉴定、命名和划分类群;命名法(nomenclature)规定名称怎样建立、引用和确定优先权;系统学(systematics)的范围更广,还要推断类群之间的演化关系。界、门、纲、目、科、属、种等阶元提供了嵌套的信息框架,双名法则让一个物种以属名和种加词组成的学名被跨语言识别。阶元的相对高低表示分类层级,不同类群中的“科”或“目”也可具有不同年代、物种数和形态差异。
命名规则维持名称的唯一性与连续性,却不裁定某一群究竟应包含哪些物种。以动物为例,《国际动物命名法规》明确把分类判断与命名规则分开:研究者可以依据新证据改变类群范围,法规负责在新的分类边界下确定应使用的名称。1 因此,分类修订可能导致组合名、异名或阶元变化;这表示谱系假说和类群界定改变,并不意味着旧标本的形态描述随之失效。
林奈建立等级分类时尚无共同祖先理论。达尔文以后,嵌套分类逐渐被解释为分支历史:同一类群成员因继承共同祖先的性状而聚在一起,新的分支证据又可反过来修订分类。现代分类通常优先承认进化支或单系群,并系名称仍可在生态、形态或教学语境中使用,但需明确其类群范围。分类名称是交流工具,系统发生树则是关于历史关系的证据模型。2
同源性、性状状态与同塑性¶
建树的基本数据是可比较的性状(character)及其状态。四足动物的肱骨无论形成翼、鳍状肢还是前肢,都因来自共同祖先的同一结构而同源;鸟翼与昆虫翅都用于飞行,作为翅的功能却独立形成,属于功能类似。研究者要先界定观察单位,再判断相似来自共同继承、趋同、平行演化还是返祖式逆转。
祖征和衍征总是相对于指定的内群与比较层级而言。一个性状在大范围类群中是衍征,进入较小进化支后可以成为其共同祖征。共同衍征(synapomorphy)为某一进化支提供证据,单一类群独有的自衍征有助于诊断,与姐妹群的关系则需其他共享性状支持。由趋同、平行或逆转形成的相似称为同塑性(homoplasy);遇到同塑性时,需要比较更多彼此独立的性状、功能条件和发育来源。
单系群、并系群与多系群¶
单系群(monophyletic group)包括一个共同祖先及其全部后代,也称进化支。鸟类构成单系群;若把鸟类纳入,鳄类、蜥蜴、蛇、龟与鸟等共同组成的相应爬行动物大支也可以是单系的。判断单系性需要先指定树和类群边界,尚未命名或已经灭绝的后代在概念上同样属于该支。
并系群(paraphyletic group)包括共同祖先,却排除了这个祖先的一部分后代。“爬行纲”若排除鸟类,仍可指称羊膜动物演化史中一组重要的鳞片、卵膜和骨骼比较对象,其类群范围属于并系结构;在要求类群与分支一一对应的系统分类中,通常把缺失的后代补回,或改用范围更明确的名称。
多系群(polyphyletic group)把来自不同支系的成员按趋同功能或表面相似聚在一起,却排除足以连接这些成员的最近共同祖先及其相应后代。“温血动物”若仅指鸟和哺乳动物便是典型例子,因为高而稳定的代谢与体温调节在两支中分别演化。多系性的关键在于定义性状未在所划定群体的最近共同祖先中形成。
系统发生树的结构与阅读¶
末端、节点、分支与拓扑¶
树梢或末端节点代表本次分析中的操作分类单元(operational taxonomic unit,OTU),可以是物种、种群、个体、化石、病毒样本、基因或单倍型。分支表示谱系延续,内部节点表示所采样后代的共同祖先位置或一次分化事件。内部节点通常是推断出的祖先谱系,而非已发现的一件祖先标本;现生树梢的纸面位置也不改变它与其他现生类群的姐妹关系。
从同一节点分出的两个进化支互为姐妹群。判断亲缘远近时要比较最近共同祖先:共享更近内部节点的两个类群亲缘更近,纸面上的左右距离、上下高低或标签相邻都不构成证据。围绕一个节点旋转分支只改变显示顺序,不改变拓扑;矩形树、斜线树和圆形树也可以表达同一组关系。多分叉(polytomy)可能表示几个谱系在很短时间内近乎同时分开,也可能表示现有数据尚未解析分枝顺序,应结合图注区分硬多分叉和未解析关系。3
拓扑只记录谁与谁共享哪些分支。树上的性状标记、祖先状态、地理范围和分化年代都是在拓扑之上进一步重建的结果。任何一棵由数据推断的树都是假说;新增类群、重新编码形态、改变序列比对或采用更合适的模型,都可能让局部节点改变。
有根树、无根树与外群¶
有根树(rooted tree)指定了全树最早的方向,因此能够区分祖先侧与后代侧,讨论性状变化方向和分枝先后。无根树(unrooted tree)只表达各末端之间的连接关系。同一棵无根拓扑在不同分支上置根会得到不同的历史解释,所以定根需要外群、时钟或其他独立证据。
外群定根把一个已由独立证据确定在内群之外、又没有远到无法可靠比较的类群加入分析。外群与内群之间的连接位置帮助极化性状,并把根放在相应分支上。外群太近时可能实际落在内群之内,太远时多重替换和同塑性会误导定根;使用多个合适外群并比较形态、化石或已知谱系关系通常更稳健。中点定根、严格或松弛分子钟定根也各有假设,不能与外群定根混为同一操作。
分支长度与树的尺度¶
分支长度的含义取决于树型和比例尺。支序图(cladogram)只表达拓扑,线段长短通常没有数量意义;系统发生图(phylogram)的长度常表示每个位点预期替换数或其他性状变化量;时间树(chronogram)的横轴或分支长度表示年代。阅读时先识别比例尺与图注,较长分支可能表示更多分子替换,并不对应演化等级或必然更多的形态变化。
即使长度表示分子变化,分支也同时受时间与替换速率影响。相同年代的两支可以因世代时间、突变率和选择约束不同而长度不同;相同长度也可能由短时间快速变化或长时间缓慢积累产生。节点顺序、遗传距离和绝对年代是三个需要分别估计的量。
从比较性状到可分析数据¶
形态、化石与分子性状¶
形态矩阵把牙齿、骨骼、花器、细胞结构或其他同源特征编码为离散或连续状态。化石常有大量缺失项,却能直接记录已灭绝的性状组合、分支最低年龄和形态转变顺序;现生 DNA 树需要化石资料才能恢复这些信息。形态性状可能相关,例如同一骨骼复合体的多个测量受到共同发育机制控制,因此性状定义、独立性和个体变异都需要在建树前审查。
分子数据可来自核苷酸、氨基酸、插入缺失、基因有无和基因组结构。线粒体、叶绿体和核基因各有遗传方式,编码区不同密码子位置承受不同选择,快速位点在深时可能饱和,过度保守位点在近缘类群中又缺少信息,因此不同数据可能支持不同局部树。形态与分子证据的权重取决于研究尺度和模型适配程度。
同源序列、直系同源与序列比对¶
序列建树先要确认比较对象同源,再把来自共同祖先位置的碱基或氨基酸排在同一列。多序列比对(multiple sequence alignment,MSA)由此是一组位置同源假说。插入缺失多、结构域重排或序列已经高度分化时,同源列判断错误会让后续算法产出数值完整但生物含义不可靠的树。2
用于推断物种关系时还要区分直系同源与旁系同源。直系同源拷贝的最近共同祖先处发生物种分化,旁系同源拷贝则源于基因复制;若不同物种抽到复制事件两侧的隐藏旁系同源,所得树主要描述基因家族复制史。基因结构、共线性、拷贝数和初步基因树可以共同检验正交关系。发生重组的序列不同区段可能拥有不同历史,此时一条整合序列也未必适合用单树表示。
完成取样、性状编码或序列比对后,研究者得到分类单元乘性状的矩阵。缺失数据、模糊状态、比对不确定区和不同分区的模型都应明确记录。推断程序回答所给矩阵与模型中的问题,未采样类群、错误标签和污染需要在数据质控阶段处理。
系统发生树的推断方法¶
最大简约法¶
最大简约法(maximum parsimony,MP)在候选拓扑中寻找解释全部性状状态所需变化步数最少的树。基本过程是确定内群和外群、建立性状矩阵、在候选无根树上标记每个性状的最少变化数、求和比较树长,再依据外群或其他证据定根。它直接保留每一性状的祖征、衍征、趋同和逆转信息,尤其适合训练形态性状怎样支持或冲突于不同分支。
“最少步数”是优化准则。性状可在同一位置多次改变,长分支会积累平行变化或逆转;在某些速率极不均匀的树上,最大简约甚至会随着数据增加而稳定支持错误的长枝聚类,即长枝吸引。4 实际数据的候选树数量随分类单元数剧增,通常依靠启发式搜索寻找短树,并报告并列最优树与节点冲突。
距离法与邻接法¶
距离法先把每对分类单元之间的差异压缩成距离矩阵。原始差异比例会漏掉同一位点上的重复替换,通常需用替换模型校正。邻接法(neighbor joining,NJ)从星状树开始,用包含每个分类单元总距离的准则选择使整棵树总枝长下降最多的一对邻居,合并后更新矩阵,直到得到完整无根树。它依据校正后的全局距离准则选择邻居,也允许谱系具有不同速率;严格时钟假设则更接近 UPGMA 的条件。5
邻接法速度快,能处理很大的距离矩阵,并可使用校正后的核苷酸或蛋白质距离。压缩成两两距离会丢失各比对列中具体状态和变化方向的信息,复杂的位点异质性也只能通过距离模型间接表达。它适合快速探索、初始树和某些大规模任务;结果仍需要支持度、模型适配和其他方法比较。
最大似然法¶
最大似然法(maximum likelihood,ML)在给定树 \(T\) 和替换模型参数 \(\theta\) 时计算观察到数据 \(D\) 的概率,即 \(L(T,\theta)=P(D\mid T,\theta)\),再寻找似然较高的拓扑、枝长和参数。它把转换与颠换、碱基频率、位点间速率差异和不变位点等过程写入模型,因此能够显式处理简约法隐含忽略的一部分多重替换。
Jukes—Cantor 模型假设四种碱基频率相同且各类替换速率相同;Kimura 双参数模型区分转换与颠换;一般时间可逆模型(GTR)允许六类交换率并估计碱基频率。常见的 \(+\Gamma\) 用伽马分布描述位点间速率异质性,\(+I\) 表示一部分位点在所考察时间内不变。GTR、\(\Gamma\) 和 \(I\) 各自代表不同假设,“GTR+\(\Gamma\)+\(I\)”的适用性取决于数据。模型选择可用似然与复杂度惩罚比较候选模型,并从候选集合中选出相对合适者。6
似然搜索同样面对巨大的树空间,软件通常交替优化拓扑、枝长与模型参数。给定树和模型还可重建内部节点的祖先状态,进而估计某次替换最可能位于哪条分支;这种定位是以树和模型为条件的历史推断。模型若严重遗漏组成偏倚、异速演化、重组或位点依赖,较高似然也可能对应系统性偏差。因此,模型诊断、分区方案、替代模型和取样敏感性属于推断过程的一部分。
贝叶斯系统发生推断¶
贝叶斯系统发生推断(Bayesian phylogenetic inference)估计给定数据后的树与参数后验分布:\(P(T,\theta\mid D)\propto P(D\mid T,\theta)P(T,\theta)\)。似然描述模型下出现数据的概率,先验表达分析前对树、枝长、速率或时间参数的分布假设。树空间无法直接遍历时,马尔可夫链蒙特卡洛(MCMC)按后验概率采样大量树;共识树上的后验概率表示相应进化支在该模型、先验和数据下所占的后验质量。7
预烧期(burn-in)是丢弃链尚未达到稳定后验分布时的早期样本,其判据来自采样稳定性而非树的似然排名。多条独立链、有效样本量、参数轨迹和不同运行间一致性用于判断是否收敛。后验概率受先验与模型影响,与最大似然自助法百分比属于不同支持指标。
节点支持度与推断不确定性¶
非参数自助法(nonparametric bootstrap)从原始性状矩阵的列中有放回抽样,建立许多同样列数的伪重复数据集,并对每个数据集重新建树。某一分支在重复树中出现的比例就是自助支持度,它衡量当前取样性状对该分支的重复稳定性。8 例如 80% 表示该分组出现在 80% 的重采样分析中;取样类群、比对、模型和系统误差还需由其他敏感性分析覆盖。
高支持度说明数据在当前分析框架下强烈而一致;组成偏倚、长枝吸引、隐藏旁系同源或共同错误模型仍可能造成系统偏差。低支持度可能来自信息不足,也可能来自不同基因、性状或历史过程真正冲突。除自助值和贝叶斯后验概率外,还可报告候选拓扑检验、基因或位点一致性、分支长度区间和不同分析方案的敏感性。共识树、网络或冲突图还可呈现与最佳树同样合理的其他拓扑。
分子进化速率与保守性¶
观察差异与实际替换数¶
两个序列的差异比例 \(p\) 是目前不同的位点数除以可比较位点总数。一个位点在分开以后可能经历两次以上替换,也可能变回相同状态,所以观察差异 \(p\) 通常低估历史上的实际替换数。对氨基酸作最简单的独立等概率近似时,可用 \(K_{aa}=-\ln(1-p)\),等价于 \(-2.303\lg(1-p)\),把观察差异校正为每个位点替换数。它只是一种简化的泊松校正;碱基有四种状态、氨基酸有二十种且替换倾向不同,实际分析需选相应模型。
若两个谱系从共同祖先分开 \(T\) 年、速率相同且枝长都为 \(kT\),成对距离满足 \(K=2kT\),于是 \(k=K/(2T)\)。当速率不等、祖先多态未完成溯祖或采样时间不同,这个二等分不再自动成立。历史上“1 鲍林(pauling)”定义为每个氨基酸位点每年 \(10^{-9}\) 次替换,提供了早期蛋白质速率比较的量纲;现代研究通常直接写 substitutions per site per year 或 per generation。分子替换率描述突变在谱系中固定并被观察到的速率,个体新突变产生率则描述每代新增变异,两者对应不同过程。9
功能约束、保守位点与速率转换¶
不同蛋白质的平均替换速率差异很大,同一蛋白质内也有快速和缓慢位点。同一蛋白家族的整体折叠可以在大量序列替换后继续保留,催化残基、配体结合区、折叠核心和关键 RNA 结构又常受更强纯化选择而保守;表面环区或功能约束较弱的位置可积累更多替换。理化性质相近的氨基酸替换往往比破坏电荷、体积或疏水核心的变化更容易保留,但保守不表示绝对不变,快速也不表示一定受到正选择。
协变子(covarion)概念指出,一个位点是否容许变化可能随分子中其他位置和谱系背景改变。某位点可在一段历史中受强约束,在结构或互作伙伴改变后转为可变,另一个位点同时承担补偿作用。现代模型把这种现象扩展为位点速率沿谱系改变的异速演化(heterotachy),位点恒定速率模型因而是一种可检验的近似。10
选择标记要匹配时间尺度。变化较快的线粒体 DNA 或高变核区可分辨较近分化,却容易在深时饱和并受到单一遗传单元历史限制;细胞色素 c、16S rRNA 和磷酸丙糖异构酶等较保守分子可连接较远类群,在近缘种间又可能缺少足够变异。最有效的研究通常组合不同速率、不同基因组来源和不同功能约束的标记,并让各分区使用合适模型。
分子钟与分歧时间¶
严格分子钟(strict molecular clock)假设所分析标记在各分支以同一平均速率积累替换,从而把遗传距离与时间联系起来。突变机制、世代时间、代谢环境、DNA 修复、种群过程和选择约束都会使基因之间、谱系之间及同一谱系的不同时段出现速率差异。速率检验若拒绝严格钟,可以采用允许各分支速率变化的松弛分子钟(relaxed molecular clock),并估计速率变异本身。11
时间树同时需要拓扑、替换模型、时钟模型和校准。校准可来自可靠归属并有地层年龄的化石、地质或生物地理事件,以及不同采样时间的古 DNA、病毒或实验序列。化石通常给出某一进化支存在的最低年龄,祖先分枝时刻还需结合冠群或茎群位置、地层年代和年龄上下界估计。12 多个相容校准能约束速率与时间的乘积,冲突校准则可能暴露化石放置、模型或数据问题。
分歧时间应报告区间和条件,序列饱和、校准过窄、速率先验和取样不足都可压低表面不确定性。基因拷贝的共同祖先通常早于物种种群的实际分开,因此基因树节点年代与物种形成日期需要分别报告。
基因树、物种树与网状历史¶
基因树与不完全谱系分选¶
基因树描述所采样基因拷贝或单倍型的共同祖先关系,物种树描述物种或种群谱系的分开。一个物种在分化前通常已经携带多个等位谱系;若 A 先与祖先群分开,随后 B、C 很快分开,祖先多态可能跨过两次分枝继续存在。各物种后来随机保留不同等位谱系时,某个基因便可能显示 A 与 B 更近或 A 与 C 更近,而物种树实际为 B 与 C 互为姐妹。这就是不完全谱系分选或深度溯祖。
连续分枝间隔越短、祖先有效种群越大,等位谱系越难在前一次分化前完成溯祖,基因树冲突越常见。增加彼此独立的基因座能展示冲突分布;所有序列拼接分析还应与多物种溯祖模型比较,避免高支持度掩盖基因树冲突。多物种溯祖模型利用各基因树在物种树中的概率分布估计共同历史,并把基因树估计误差与真实谱系差异尽量区分。13
基因复制、丢失与旁系同源¶
基因在物种分化前复制后,两个拷贝会各自形成分支;后代又可能丢失其中一个拷贝。若物种 A 保留复制支一、物种 B 保留复制支二,两条序列的深分化会被误读成物种的深分化。基因树—物种树协调把节点解释为物种分化、复制和丢失事件,结合基因组共线性寻找隐藏旁系同源。全基因组数据使隐藏旁系同源更常被观察,也提供了更多机会显式建模复制史。
水平转移、杂交与渗入¶
水平基因转移(horizontal gene transfer,HGT)指遗传物质跨越常规亲子传递进入另一谱系。细菌和古菌可通过转化、接合、转导及其他载体获得基因;寄主—寄生者、捕食接触和共生环境增加物质接触机会,真正的转移还需序列、基因树和基因组位置等证据。病毒可以充当转移载体或把序列整合进宿主基因组,病毒来源序列与水平转移事件也需逐项判断。水平转移对抗生素抗性、代谢通路和微生物生态适应尤其重要,也会使转移基因树偏离细胞谱系树。
在能杂交的真核生物中,杂交与随后回交造成的渗入同样把基因从一支带入另一支。它与微生物水平转移共享网状信号,却有不同的群体与生殖机制。重组又能让同一染色体不同区段拥有不同基因树。早期“通用生命树”的垂直分支仍能描述许多核心遗传历史,而广泛水平转移说明单一树不足以代表所有基因;研究对象有网状过程时,系统发生网络比强迫所有信号进入一棵二叉树更合适。14
多证据系统学的解释边界¶
分类、化石、形态、分子和基因组资料处在同一推理链的不同位置。化石给出最低年代和灭绝性状组合,形态连接结构、功能与发育,序列模型估计遗传变化,基因组揭示复制、渗入和不完全谱系分选。证据一致时,共同分支获得更强支持;发生冲突时,研究者要先检查同源定义、标本与序列标签、性状相关、比对、模型、基因史和取样,再判断各证据的适用尺度。
系统发生树的用途还包括超越类群排序的比较分析。它提供控制共同祖先非独立性的比较框架,帮助重建性状、地理分布和宿主转换,选择保护演化历史的优先对象,并检验疾病传播与基因家族演化。每一个结论都继承了树、数据和模型的不确定性;区分树上的观察、推断和竞争解释,才能完成从分类表到演化历史的阅读。树上的谱系界限怎样与生殖隔离和基因流共同支持物种判断,见物种概念与物种形成;基因家族、染色体和基因组历史怎样产生不同层级的树,见分子、基因与基因组进化。
参考资料与延伸阅读¶
-
International Commission on Zoological Nomenclature. Introduction to the International Code of Zoological Nomenclature. 命名规则的历史、目的及命名法与分类判断的边界。 ↩
-
Brown, T. A. (2002). Molecular Phylogenetics. In Genomes (2nd ed.). NCBI Bookshelf. 分类到系统发生、序列比对、树推断、支持度和分子钟的教材性综述。 ↩↩
-
OpenStax. Organizing Life on Earth. Biology. 节点、姐妹群、多分叉、分支旋转与树作为可修订假说的读图说明。 ↩
-
Felsenstein, J. (1978). Cases in which parsimony or compatibility methods will be positively misleading. Systematic Zoology, 27, 401–410. ↩
-
Saitou, N., & Nei, M. (1987). The neighbor-joining method: A new method for reconstructing phylogenetic trees. Molecular Biology and Evolution, 4, 406–425. ↩
-
Kalyaanamoorthy, S., Minh, B. Q., Wong, T. K. F., von Haeseler, A., & Jermiin, L. S. (2017). ModelFinder: Fast model selection for accurate phylogenetic estimates. Nature Methods, 14, 587–589. ↩
-
Huelsenbeck, J. P., & Ronquist, F. (2001). MRBAYES: Bayesian inference of phylogenetic trees. Bioinformatics, 17, 754–755. ↩
-
Felsenstein, J. (1985). Confidence limits on phylogenies: An approach using the bootstrap. Evolution, 39, 783–791. ↩
-
Kimura, M. (1969). The rate of molecular evolution considered from the standpoint of population genetics. Proceedings of the National Academy of Sciences, 63, 1181–1188. ↩
-
Fitch, W. M. (1971). Rate of change of concomitantly variable codons. Journal of Molecular Evolution, 1, 84–96. ↩
-
Drummond, A. J., Ho, S. Y. W., Phillips, M. J., & Rambaut, A. (2006). Relaxed phylogenetics and dating with confidence. PLOS Biology, 4, e88. ↩
-
Parham, J. F. et al. (2012). Best practices for justifying fossil calibrations. Systematic Biology, 61, 346–359. ↩
-
Maddison, W. P. (1997). Gene trees in species trees. Systematic Biology, 46, 523–536. ↩
-
Doolittle, W. F. (1999). Phylogenetic classification and the universal tree. Science, 284, 2124–2129. ↩
页面讨论
使用 GitHub 登录后可参与整页讨论;评论独立保存在 GitHub Discussions 中。