Skip to content

连锁、交换与遗传作图

独立分配把不同染色体上的座位拆成彼此独立的概率事件;连锁分析则利用同一条染色体上等位组合被共同传递的倾向,反过来推断座位的相对位置。直接读出是一次减数分裂留下的配子或子代类型:交换发生在染色单体之间,重组型是交换及其后续分离的可见结果,遗传图距又是由许多次减数分裂估计出的模型量。三个层次的对应关系解释了一次交换与重组配子的区别、重组分数的 \(1/2\) 上限,以及遗传图与碱基坐标间可变的换算关系。

连锁由单倍型的共同传递显现

两个座位 \(A/a\)\(B/b\) 位于同一条染色体时,双杂合体必须同时写出相位。\(AB/ab\) 表示 \(A\)\(B\) 位于同一条同源染色体,称顺式相或偶联相;\(Ab/aB\) 表示两个相反状态分别同处一条染色体,称反式相或排斥相。仅写 \(AaBb\) 会丢失这一信息。若区间内没有可检出的重组,顺式个体产生的 \(AB\)\(ab\) 配子多于 \(Ab\)\(aB\);反式个体则相反。亲本型与重组型因而必须相对于构成杂合亲本的两条单倍型定义,不能只按“显性组合”命名。

测交使双杂合亲本的配子直接出现在子代基因型中。设亲本型子代总数为 \(N_P\),重组型为 \(N_R\),重组分数(recombination fraction)为

\[ r=\frac{N_R}{N_P+N_R}. \]

\(r\) 显著小于 \(0.5\) 时,数据支持两个座位连锁;\(r\approx0.5\) 既可能表示座位位于不同染色体,也可能表示它们在同一染色体上相距很远,已经被一次或多次交换随机化。只有结合第三个标记、染色体定位或物理坐标,才能区分这两种情形。连锁也是特定亲本和标记组合中的统计关系:等位相位不明、某类合子生活力较低、配子选择或分型错误都会改变观察计数,分析前应与真正的重组分开检查。1

某些物种或性别的减数分裂几乎不形成经典交换,例如雄性果蝇和雌性鳞翅目昆虫常呈 achiasmy。此时同染色体标记可表现为近乎完全连锁,但这是一种谱系和性别特异的减数分裂方案,并非“同一染色体上的基因天然永不重组”。

重组分数只记录交换的奇偶结果

一次发生在两条非姐妹染色单体之间的交换只产生两条重组染色单体,另外两条仍保留亲本组合。因而若一个区间在所有减数分裂中都恰好发生一次这样的交换,最终重组配子比例是 \(1/2\),而不是 1。若同一对标记之间发生两次交换,参与染色单体的组合还会决定外侧标记是否恢复为亲本相位;一般而言,奇数次有效交换更可能被两端标记读出,偶数次交换可能被遮蔽。观察到的 \(r\) 因此随距离增加而趋近 \(0.5\),不会继续线性上升。

遗传图距以 Morgan(M)或 centimorgan(cM)表示,可理解为所用模型下一个区间在一条随机传向配子的染色单体上所经历交换数的期望。一个发生在二价体上的 crossover 只涉及四条染色单体中的两条,所以二价体上的 chiasma 数与单条染色单体上的图距不能直接等同。短区间内多次交换罕见,\(d\approx r\) M,因此 \(1\%\) 重组常近似为 1 cM;这只是局部近似。较长区间须用 mapping function 把重组分数换成可加的图距。例如 Haldane 模型假定交换沿区间独立发生,给出

\[ r=\frac{1-e^{-2d}}{2},\qquad d=-\frac{1}{2}\ln(1-2r), \]

其中 \(d\) 以 M 为单位。Kosambi 函数则以另一种经验关系纳入正干涉:

\[ d=\frac{1}{4}\ln\left(\frac{1+2r}{1-2r}\right). \]

两者都是对交换分布的模型压缩,并不能精确代表所有物种、性别或染色体区域;在密集标记图上,可靠的局部区间可以相加,跨大区间再反推 \(r\) 时仍受真实交换分布限制。2

遗传距离与物理距离回答不同问题。前者由共同传递和交换概率定义,后者记录标记在 DNA 上相隔多少碱基。一个 cM 对应的碱基数会随物种、染色体、性别和局部染色质环境变化;着丝粒周围常见重组抑制,某些开放区域或特定序列附近则形成热点。遗传图通常能稳健给出标记顺序,却不能单凭 cM 数值推出精确的 bp 坐标。物理图可由细胞遗传带型、FISH、限制图谱、重叠克隆、STS 叠连群或最终的参考序列建立;现代组装把完整序列作为最高分辨率的物理坐标框架。3

两点与三点测交重建标记顺序

两点测交可估计一个区间的 \(r\),适合判断座位是否紧密连锁,却不能仅凭一对数字确定多个标记的顺序,也容易漏掉恢复亲本相位的偶数次交换。三点测交同时追踪三个座位,利用双交换对中间标记的特殊影响来确定顺序,并把长区间拆成两个较短区间。

以三杂合体与三隐性测交亲本交配为例,在不存在明显生活力差异和分型偏倚时,可按以下逻辑读取八类子代:

  1. 数量最多的一对通常是亲本型,先据此恢复三杂合亲本的两条单倍型。
  2. 数量最少的一对通常是双交换型;把它们与对应亲本型逐位比较,只有状态翻转的那个座位位于中间。
  3. 依照确定的顺序重分单交换类型。左区间的距离由该区间单交换数加双交换数后除以总数,右区间同理;双交换必须同时计入两个区间。
  4. 两个相邻区间之和给出外侧标记间的遗传图距。直接用外侧标记的重组分数会漏掉恢复亲本相位的双交换,因此通常小于这个和。

“最多为亲本、最少为双交换”是建立在稀有交换和各基因型存活相近之上的工作判据。样本量太小、区间很长、标记误判或某类后代死亡时,频数排序可能误导;正式分析应比较不同顺序下完整数据的似然,而不是只凭肉眼挑最大和最小类别。4

若两个相邻区间的单次重组概率分别为 \(r_1\)\(r_2\),在两区间事件独立且观测条件合适时,预期双重组比例约为 \(r_1r_2\)。符合系数(coefficient of coincidence)和干涉度可写为

\[ C=\frac{\text{观察双重组比例}}{\text{预期双重组比例}},\qquad I=1-C. \]

\(I>0\) 表示邻近交换少于独立模型预期,是常见的正交换干涉;\(I<0\) 表示该数据中双交换富集,但可能来自生物学聚集、样本波动、标记错误或模型不合适,不能直接归因于基因转变。交换干涉讨论交换位置之间的依赖,染色单体干涉则讨论连续交换选择哪几条染色单体是否随机,两者也不能混用。干涉强度随尺度和物种改变,单个三点测交的 \(I\) 不是染色体永久不变的常数。5

四分子把一次减数分裂的全部产物保留下来

酵母、链孢霉等真菌可把一次减数分裂的四个单倍体产物共同回收,因此不需要借助测交亲本重建配子。无序四分子只保留四个产物的集合;顺序子囊还保留减数第一次、第二次分裂以及随后一次有丝分裂形成的空间次序。对两个杂合标记,四分子可分为三类:亲二型(PD)只含两种亲本单倍型,非亲二型(NPD)只含两种重组单倍型,四型(T)同时含四种单倍型。

若只求两个标记间重组染色单体的比例,每个 T 有一半产物为重组型,每个 NPD 的全部产物为重组型,因此

\[ r=\frac{\tfrac{1}{2}T+NPD}{PD+T+NPD}. \]

同染色体紧密连锁标记通常表现为 \(PD\gg NPD\);不连锁标记在大量数据中趋向 \(PD\approx NPD\)。将这一区间换算成可加图距时仍须考虑未被两端标记直接显示的多次交换,不能把上述 \(r\) 对所有距离直接当作 cM。

顺序子囊还可定位座位与着丝粒。若标记等位基因在减数第一次分裂后已经分成两个连续区块,称第一分裂分离;若标记与着丝粒之间发生交换,姐妹等位状态要到减数第二次分裂才分开,形成 \(2:2:2:2\)\(2:4:2\) 等第二分裂分离图式。由于一次交换只有一半染色单体在标记—着丝粒区间成为重组型,短区间的着丝粒距离为

\[ d_{\text{marker--CEN}}\approx\frac{1}{2}\times\frac{N_{\mathrm{SDS}}}{N_{\mathrm{total}}}\times100\ \mathrm{cM}. \]

四分子还暴露局部非互惠信息转移。正常杂合标记在四个孢子中为 \(2:2\);若先经历一次孢子后有丝分裂,八孢子计数对应 \(4:4\)。异源双链中的错配被偏向一方修复时可出现 \(3:1\)(八孢子中的 \(6:2\))基因转变;错配保留到减数后复制再分离时,可见 \(5:3\) 或异常 \(4:4\) 的减数后分离。基因转变记录断裂附近一小段序列的非互惠结局,可以伴随 crossover,也可以来自 noncrossover 修复,不能用来解释所有远端标记的交换关系。6

交换分布连接染色体行为与遗传图

减数分裂前期的程序化双链断裂只有一部分成熟为 crossover;其余可形成 noncrossover 或基因转变。crossover 与姐妹染色单体黏连共同维持 chiasma,帮助同源染色体在第一次分裂正确取向。Spo11 起始、RAD51/DMC1 链交换和中间体拆解等分子反应见DNA重组与转座,联会、黏连与两次分离见细胞周期与细胞分裂;遗传作图读取这些反应在后代标记中留下的统计结果。

交换沿染色体并不均匀。许多物种具有保证每对同源染色体获得至少一个交换的调控趋势,相邻交换又常因干涉而保持间距;与此同时,局部热点、染色体轴结构、着丝粒和异染色质环境、结构杂合以及雌雄差异共同塑造重组景观。所谓“异染色质不重组”只能作为常见抑制趋势,不能当作绝对规则。遗传图因而是某一材料、性别、环境和估计方法下的重组地图,而不是基因组序列自带的一把恒定尺。7

有丝分裂细胞也可通过同源重组、染色体丢失或单倍体化产生体细胞分离子。杂合二倍体若在某座位与着丝粒之间发生有丝分裂 crossover,适当的染色单体分离可使断点远端大片区域成为纯合,即 loss of heterozygosity(LOH)。构巢曲霉等真菌的经典体细胞遗传利用营养缺陷标记和单倍体化推断连锁群;在人体组织中,相似结果更多用于解释克隆性嵌合和肿瘤演化。这里的事件发生在有丝分裂谱系,不能把其频率直接换算成生殖系减数遗传图距。

标记和作图群体决定可见的信息量

遗传标记只需在亲本间可区分、能稳定分型并随染色体片段传递,不一定本身造成表型。形态标记容易观察,却可能受环境、上位效应和生活力影响;细胞学标记能锚定大片染色体区域,分辨率有限;蛋白质同工酶标记读取表达产物,受组织和发育阶段约束。DNA 标记直接读取序列差异,RFLP、微卫星/VNTR、SNP 和插入缺失都可用于连锁分析。STS 更接近可重复检测的物理坐标标签;RAPD 和许多 AFLP 位点常按显性“有/无”信号计分,重复性、位点同源性和杂合识别能力必须实测,不能一概称为共显性或唯一物理位点。8

标记密度高并不自动得到可靠图谱。亲本必须在相应位点有信息性差异,分型质量、缺失率、错误率和标记间冗余需要控制;单个错误可伪造两个极近的 crossover,错误集中又会扭曲标记顺序。标记偏离期望分离比可能来自选择、基因组结构或技术误差,既不能一律删除,也不能未经检查直接进入作图。

回交与测交群体

F\(_1\) 与一个纯合亲本交配时,子代直接读取杂合亲本的一轮配子,模型简单,适合估计连锁和相位。每个子代只保存当代的一种重组结果,除非另行克隆或维持品系,其基因型不能被完全复制;图谱分辨率也受这一代群体中实际出现的重组断点数限制。

F2 群体

F\(_1\) 自交或互交形成的 F\(_2\) 同时包含两类纯合体和杂合体,两亲本等位组合较丰富。共显性标记可以区分三种基因型;显性标记或信息不足的分型方案才可能无法区分某些纯合与杂合状态。F\(_2\) 个体通常不能原样永久保存,其后代还会继续分离。

重组近交系

重组近交系(recombinant inbred lines,RILs)由杂交后连续自交或近交逐代固定,累积多代重组,每条近交系可以扩繁、共享并在不同环境中重复表型。建群时间较长,选择、漂变和残余杂合会使实际群体偏离理想模型。

双单倍体群体

双单倍体(doubled haploid,DH)把一枚单倍体配子来源的基因组加倍,可在一代内得到纯合且可重复使用的基因型。诱导、培养和再生可能对基因型产生偏倚;它固定的是一轮减数分裂的产物,初始重组数通常少于汇集多代重组的 RIL。

RIL 与 DH 常被称为“永久”群体,是因为每条固定系可扩繁并在不同环境重复表型;这种可重复性仍依赖种质维护。作图群体的大小决定能观察到多少重组断点;数量性状定位中的表型重复、环境效应和多重检验见数量遗传学

人类家系把连锁转化为似然证据

人类不能安排测交,连锁分析只能利用现有家系中表型、标记与亲缘关系。对于给定遗传模型和重组分数 \(\theta\),对数优势比(logarithm of odds,LOD)评分比较该连锁模型与不连锁模型 \(\theta=0.5\) 对同一数据的解释能力:

\[ Z(\theta)=\log_{10}\frac{P(\text{data}\mid\theta,\text{model})}{P(\text{data}\mid0.5,\text{model})}. \]

在模型和家系可合并的条件下,不同家系的对数似然比可以相加;使 \(Z\) 最大的 \(\theta\) 是该模型下的估计值。经典研究常把 \(Z\ge3\) 视为支持连锁、\(Z\le-2\) 视为排除某个区间的工作阈值,现代全基因组扫描还会按搜索范围调整证据标准。这些阈值是统计约定,不是致病性证明。外显率、表型误分、致病等位频率、标记频率、相位不确定、遗传异质性和家系选择都会改变似然;模型不清时可采用受累者分析或非参数亲属共享方法。9

连锁标记曾被用于间接诊断:当致病变异未知而附近标记与疾病单倍型在家系中共分离时,标记可提供概率信息,但标记—致病座位之间的交换、家系相位和遗传异质性会留下误判风险。直接变异检测也仍需确认检测范围、变异解释和家系共分离,临床证据与伦理边界见人类遗传学

定位克隆(positional cloning)从表型或疾病出发,经连锁区间、物理图和候选变异逐步找到基因,属于典型正向遗传路径;功能候选策略则利用已知生化或通路信息优先选择候选基因。反向遗传学从已知基因出发制造或寻找扰动再观察表型,与定位克隆的起点和推理方向不同。人—鼠体细胞杂种依据不同克隆保留哪些人染色体来完成粗尺度染色体指派,是物理定位史上的重要方法;荧光原位杂交(fluorescence in situ hybridization,FISH)、序列标记和完整参考基因组随后提供了更直接的坐标。遗传连锁负责缩小共同传递区间,物理定位与功能验证再把这个区间落实为具体基因和因果机制。

参考资料与延伸阅读


  1. 测交、相位、重组分数、三点分析和不同生物作图设计见 Brown 的教材章节 Mapping Genomes\(r=0.5\) 不能区分独立染色体与同染色体远距离标记。 

  2. Haldane 与 Kosambi mapping function 的公式、假设及长区间限制见 Lyu 等的单配子测序综述和 Baier 等对重组分数预测局限的分析。 

  3. 遗传图与物理图的单位、标记和用途见 NCBI Genome Mapping及 Brown 的 Mapping Genomes;热点会使 cM 与 bp 的对应关系随区段改变。 

  4. 三点测交由亲本型、单交换和双交换重建座位顺序的逻辑见 Mapping Genomes;频数判读依赖样本、分型和生活力前提。 

  5. 交换干涉的遗传与细胞学度量、物种差异及机制未决问题见 Chuang 与 Smith 的综述。 

  6. PD/NPD/T、第一/第二分裂分离及 gene conversion 的四分子读出见 Lorenz 与 Mpaulo 的综述\(6:2\)\(5:3\) 分别对应完整转变和减数后分离的典型八孢子计数。 

  7. crossover 保证、干涉和基因组内不均匀分布见 Chuang 与 Smith 的综述;重组热点导致遗传距离不能直接充当物理距离,见 Mapping Genomes。 

  8. 形态、蛋白质与 DNA 标记的计分方式、RFLP/微卫星/SNP 和 STS 的作图用途见 Mapping Genomes;人类连锁中微卫星与 SNP 的信息量比较见 Allen-Brady 与 Camp 的综述。 

  9. NHGRI 将 LOD score定义为两个座位邻近并共同传递的相对概率证据;参数连锁对遗传模式、外显率、等位频率和异质性的依赖见 NCBI Bookshelf Genetics, Mutations, and Polymorphisms。 

页面讨论

使用 GitHub 登录后可参与整页讨论;评论独立保存在 GitHub Discussions 中。