Skip to content

RNA转录后加工

RNA 聚合酶释放的序列只是 RNA 生命史的起点。许多初级转录本仍带有多余的前导序列、间隔区或内含子,需要切割、修剪、拼接和末端添加;另一些 RNA 要接受碱基修饰、与蛋白质装配并通过质量检查,才成为可输出、可翻译或可催化的成熟核糖核蛋白复合体。加工也决定一种转录本能形成哪些异构体以及它能存留多久,因此它既是分子成熟过程,也是基因表达的一层选择。

“转录后”描述加工相对于 RNA 合成的逻辑位置,其中许多反应在转录结束前已经开始。真核 mRNA 加帽和大量剪接发生于新生 RNA 仍连着 RNA polymerase II 时,细菌 rRNA 的切割也可在整条操纵子转录完成前启动;另一些修饰、装配和最终修剪则延续到核质、核仁、胞质或细胞器。底物、细胞区室和谱系共同决定加工路线,各类 RNA 因而具有不同次序。

RNA 成熟通过切割、添加、重排和装配建立功能边界

内切核酸酶在 RNA 内部产生新末端,外切核酸酶从已有末端逐个修剪核苷酸;连接酶、核苷酸转移酶和聚合酶又可封合断口或添加非模板序列。剪接把相隔的外显子接合,编辑改变相对于 DNA 模板的 RNA 序列,化学修饰则改变碱基或核糖的官能团而通常不改变序列长度。RNA 解旋酶、伴侣蛋白和核糖核蛋白装配因子不断重塑底物,使同一种核酸酶在恰当阶段接近反应位点。

成熟与降解共享许多酶和中间体。一个外切酶可把前体精确修到成熟末端,也可继续消化装配失败的 RNA;短的非模板尾既可能稳定并促进翻译,也可能给核酸酶提供无结构的“着陆区”。决定结果的是尾的化学组成、结合蛋白、所在区室和底物是否及时进入正确 RNP,而不是“加尾”或“切割”这一个动作本身。

细菌把 RNA 成熟与快速周转接在同一组核酸酶上

不少细菌 mRNA 的 5′ 与 3′ 边界可以直接由转录起始和终止形成,并在新生链上立即进入翻译;另一些多顺反子则经内切产生稳定性不同的片段。RNase III 加工双链区和部分反义 RNA,RNase E、RNase G、RNase J 或 RNase Y 等因谱系而异的酶可生成新末端并启动周转。5′ 三磷酸转为单磷酸、核糖体占据、RNA 二级结构和小 RNA—蛋白复合体都会改变这些切口的可及性。1

以大肠杆菌为代表的系统中,RNase E 还能作为 degradosome 支架,连接 RNA helicase RhlB、PNPase 和 enolase;许多革兰阳性菌则更多依靠 RNase J/Y 等不同组合。PAP I 或 PNPase 可在 RNA 3′ 端添加短 poly(A) 或富 A 尾,为 PNPase、RNase R 等 3′→5′ 核酸酶提供单链入口,因而常促进结构化片段和缺陷 RNA 的清除。真核成熟 mRNA 的长 poly(A) 尾常与稳定和翻译相连,两种语境不能互相套用。

细菌 rRNA 常作为含 16S、23S、5S rRNA 和部分 tRNA 的长操纵子前体产生。RNase III 等先切开成对结构,随后由 RNase E/G、RNase T、RNase PH 等不同内外切酶形成成熟末端;具体酶和先后顺序随物种、操纵子和装配状态变化。核糖体蛋白结合、rRNA 折叠和碱基修饰与修剪交错进行,装配失败的 rRNA 还会被 RNase R、PNPase 等质量控制路线清除,所以“先全部修饰,再粗切,最后细修”并非普遍顺序。1

前体 tRNA 的 5′ leader 通常由 RNase P 切除;其细菌 RNA 亚基在适当条件下具有催化活性,蛋白亚基帮助底物选择和细胞内反应。3′ trailer 可由 RNase Z 或多种外切酶处理,末端 CCA 则可能由基因直接编码,也可能由 CCA-adding enzyme 无模板添加。少数细菌 tRNA 含 group I intron,另有异常 tRNA 会被再次加尾并转入降解。成熟 tRNA 上的修饰集中于结构核心和 anticodon loop 等关键位置,但每种修饰对折叠、氨酰化或解码的贡献须逐项实验确定。2

古菌以独特装置组合真核型与原核型 RNA 代谢

古菌 RNA 代谢组合了自身特有和跨域同源的多条路线。许多古菌使用与真核 exosome 同源的环状复合体进行 3′→5′ 磷酸解和非模板加尾,另一些谱系缺少典型 exosome,改用 RNase J、aCPSF1/FttA 或其他核酸酶。mRNA 的 5′ 端状态、3′ U-rich 末端、RNA 结合蛋白和翻译共同决定稳定性,成熟与降解同样紧密衔接。

古菌 pre-rRNA 的间隔区常形成 bulge–helix–bulge(BHB)结构,可由 archaeal splicing endonuclease 切开并经连接酶封合;其他核酸酶再修剪成熟末端。box C/D small RNP 以 guide RNA 配对定位 2′-O-methylation,box H/ACA small RNP 则定位 pseudouridylation,这两类 RNA 引导装置与真核 snoRNP 同源。它们参与折叠、修饰和部分切割,却不意味着每个位点都以同一顺序加工。3

古菌 pre-tRNA 也可由 RNase P、tRNase Z、CCA-adding enzyme 和多类修饰酶成熟;部分极端例外直接转录出无 5′ leader 的 tRNA,因而不需要 RNase P。tRNA intron 往往以不局限于 anticodon loop 的 BHB motif 被内切酶识别,随后由连接酶接合。分裂 tRNA、环状置换基因和多种 BHB 变体进一步说明,成熟 tRNA 的共同三维结构可以由不同基因排列和加工路线抵达。

真核 mRNA 的帽和 3′ 端在转录过程中建立

5′ 帽与转录、加工、输出和翻译

许多 RNA polymerase II 转录本在新生 RNA 约几十个核苷酸长时开始加帽。RNA triphosphatase 先除去 5′ 端一个磷酸,guanylyltransferase 再把 GMP 以反向 5′–5′ triphosphate linkage 接到第一个核苷酸,随后 guanine-N7 methyltransferase 以 SAM 为供体生成 m⁷G cap。第一个或第二个转录核苷酸的 2′-O-methylation 可形成 cap 1 或 cap 2;这些名称描述结构层级,不是所有酵母、动物和其他真核 RNA 必经的逐级“升级”。4

核内 cap-binding complex(CBC)保护 5′ 端并参与首个内含子剪接、3′ 端形成、质量控制和 NXF1 依赖的 mRNP 输出;进入胞质后,帽结合关系会重塑为以 eIF4E 等为核心的翻译起始状态。部分 snRNA 还会把 m⁷G cap 进一步转成 trimethylguanosine cap,再返回细胞核装配 snRNP。不同 Pol II RNA 可使用特化帽、被再加帽或经剪切失去原帽,因此“所有 Pol II 产物终身保留同一帽结构”也不是定义。

切割与加尾定义多数 mRNA 的 3′ 端

在多数哺乳动物蛋白质编码转录本中,CPSF 组分识别 AAUAAA 或相关上游元件,CstF 等结合下游富 GU 序列,CPSF73 在组装后的复合体中切开 RNA。poly(A) polymerase 随后无模板加 A,PABPN1 结合新生尾并提高延伸过程性;输出后主要由胞质 PABP 接管。poly(A) 尾影响输出、翻译和稳定性,但终止密码子来自编码区本身,加尾不会一般性地“创造终止密码子”。5

同一前体常有多个 cleavage and polyadenylation sites。alternative polyadenylation(APA)若改变 3′ UTR,可增减 microRNA 或 RNA-binding protein 的调控位点;若选择内含子或 coding region 内的位点,还可能改变蛋白 C 端。位点使用由顺式序列、核心加工因子浓度、RNA-binding proteins、转录速度和染色质背景共同偏置,产生短转录本并不自动表示翻译效率一定升高。复制依赖型 metazoan histone mRNA 则由 stem-loop binding protein、U7 snRNP 和 CPSF73 等定义 3′ 端,通常不加 poly(A) 尾。6

剪接体以动态 RNA 催化中心连接外显子

major spliceosome 识别 5′ splice site、branch point、polypyrimidine tract 和 3′ splice site 的组合。U1 snRNP 起初配对 5′ 位点,U2 将 branch-point adenosine bulge 出 RNA duplex;U4/U6·U5 tri-snRNP 加入后,U4 释放,U6 与 U2 重排形成催化核心,U5 协助对齐两侧外显子。第一次 transesterification 由 branch A 的 2′-OH 进攻 5′ splice site,生成 lariat;第二次由上游 exon 的 3′-OH 进攻 3′ splice site,连接外显子。成键化学本身不改变磷酸二酯键总数,ATP 水解主要驱动装配、解旋、校验和拆卸。7

多数 U2 型内含子具有 GU–AG 边界,但位点选择还依赖周围共识序列、外显子/内含子剪接增强子与沉默子,以及 SR proteins、hnRNPs 等调控因子。次要剪接体(minor spliceosome)以 U11、U12、U4atac、U6atac 和共享的 U5 处理少量 U12 型内含子,其中既有 AU–AC 边界,也有 GU–AG 边界。spliceosome 每轮都在一个内含子上重新装配,U4 离开后由 U2/U6 重排形成催化核心。8

alternative splicing 可改变外显子纳入、互斥外显子、剪接位点选择或内含子保留。同一基因因而形成不同 5′/3′ UTR 或编码序列;一些异构体产生不同蛋白,一些受到 nonsense-mediated decay,还有一些只在特定细胞状态短暂出现。转录本被测到并不能单独证明其蛋白产物稳定或有独立功能,需结合长读长、剪接接头证据、翻译和扰动结果判断。

trans-splicing 把来自不同前体的 exon 接到一起。锥体虫等 kinetoplastids 给多数 mRNA 接上带帽 spliced leader,并用相邻的 trans-splicing 与 polyadenylation 从 polycistronic RNA 中释放单个 mRNA;部分线虫及其他真核生物也使用 spliced-leader trans-splicing。细胞器 group II intron 还可由分散转录的 RNA 片段在折叠后完成 trans-splicing。它们共享跨分子成键结果,却不是一套可互换的酶系统。9

自剪接内含子保存 RNA 催化的两种化学路线

group I intron 折叠成催化结构后,以游离 guanosine 的 3′-OH 进攻 5′ splice site,再由上游 exon 的 3′-OH 连接下游 exon,释放线性 intron。group II intron 则通常由内部 branch-point adenosine 的 2′-OH 发起,形成与 spliceosomal intron 相似的 lariat;不少 group II intron 在细胞内还需要 maturase、RNA helicase 或其他蛋白帮助折叠,并可作为 retroelement 移动。所谓 self-splicing 指某些 RNA 在适当体外条件下可催化成键,不表示它们在细胞中总能脱离蛋白独立完成成熟。10

spliceosome 的 U2/U6 RNA 催化中心与 group II intron 在构象和两金属化学上的相似性支持二者具有深层进化联系。group I、group II、spliceosomal intron 和 archaeal tRNA intron 因而应按反应化学和装置区分,而不宜排成“第一至第四类”并假定编号代表同一演化序列。

rRNA 加工与核糖体装配共同推进

哺乳动物 Pol I 产生的 47S pre-rRNA 含 18S、5.8S、28S rRNA 及 external/internal transcribed spacers;酵母等物种使用的前体名称和切割图谱不同。U3 等 snoRNP、核酸酶、RNA helicases 和 assembly factors 在核仁中逐步形成 small- and large-subunit processomes,切除 spacer 并重塑前体;Pol III 产生的 5S rRNA 从核仁外进入 large-subunit assembly。pre-40S 和 pre-60S 输出后仍在胞质完成末端修剪、因子释放和功能检查。空间组织见细胞核、染色质与核糖体11

box C/D snoRNP 通常以 guide RNA 定位 fibrillarin 催化的 2′-O-methylation,box H/ACA snoRNP 以 dyskerin/Cbf5 定位 pseudouridylation;另一些 snoRNA 主要帮助前体折叠或切割。修饰富集于核糖体功能中心附近,可改变局部结构和组装,但不是简单的“剪切取舍标记”。snoRNA 引导配对、修饰酶活性和缺失后的核糖体表型提供不同层级证据,不能只凭一个测序峰断定修饰具有必需功能。

tRNA 成熟汇合多条跨域保守而装置多样的路线

三域 pre-tRNA 通常都要形成精确 5′ 与 3′ acceptor stem、CCA 末端和折叠后的 anticodon loop。RNase P 在细菌、古菌和许多真核核内系统是 RNA 催化的 RNP,但植物细胞核和细胞器等系统可由 protein-only RNase P(PRORP)完成相同切割。3′ 端可由 tRNase Z 或外切酶形成,CCA-adding enzyme 则以成熟 tRNA 结构而非核酸模板连续选择 C、C、A。真核 cytosolic tRNAHis 的 G−1 可由 Thg1 逆向添加,细菌同一识别位常由基因编码;这些差异使相同氨酰化身份从不同前体产生。2

tRNA intron 的移除也不统一:细菌 group I intron 可自剪接,古菌与真核 tRNA splicing endonuclease 先切开 splice sites,随后由不同 ligase chemistry 接合半分子。数十种 base and ribose modifications 调整 tRNA 折叠、稳定性、aminoacyl-tRNA synthetase 识别和 anticodon decoding;缺少某项修饰的结果取决于 tRNA、密码子负荷、温度和应激。修饰不足、错误折叠或受损的 tRNA 可在核内或胞质被特异性监测并清除,成熟度因此是结构与 RNP 状态,而不是一张固定修饰清单。

RNA 编辑改变序列,化学修饰改变核苷酸状态

RNA editing 指 RNA 序列相对于其 DNA 模板发生可定位的碱基转换、插入或删除。动物 ADAR1/ADAR2 在双链 RNA 中把 adenosine 脱氨为 inosine,测序和翻译机器常把 I 读作 G;少数位点会改变蛋白质编码,大量事件位于重复序列形成的非编码双链区,并参与避免内源双链 RNA 误触发先天免疫。APOBEC1 complex 对 apolipoprotein B mRNA 的 C→U 编辑则可生成提前终止密码子。编辑的功能需逐位点验证,不能整体解释为“纠正 DNA 突变”或必然增加蛋白多样性。12

陆生植物的线粒体和质体以 C→U 编辑为主,部分谱系还有 U→C 编辑,PPR proteins 等提供位点识别;编辑可以恢复保守氨基酸、生成起始/终止密码子,也可改变非编码 RNA。动基体生物线粒体使用 minicircle 编码的 guide RNA 指引 editosome 切开 mRNA,再由 terminal uridylyl transferase、U-specific exonuclease 和 RNA ligase 完成 U 的插入或删除。gRNA—mRNA 配对指定位点和数量,这种信息输入属于动基体生物的专门机制。13

m⁶A、m⁵C、pseudouridine、2′-O-methylation 和 tRNA 高度修饰核苷等属于化学修饰。以哺乳动物 mRNA 的 m⁶A 为例,METTL3–METTL14 complex 在序列和结构语境中偏好 DRACH 相关位点,YTH-domain proteins 等 readers 将部分位点接入剪接、输出、翻译或降解;demethylases 只作用于相应底物和区室。符合 consensus motif 的位置远多于真正修饰位点,“writer/reader/eraser”也只是组织反应角色的框架,不能据 motif 或抗体富集峰直接推断确定的调控结果。14

RNA 周转和质量控制决定哪些加工产物得以积累

真核 mRNA 的常规降解多从 PAN2–PAN3 与 CCR4–NOT 缩短 poly(A) 尾开始,随后可由 DCP1/DCP2 去帽并由 XRN1 从 5′→3′ 降解,或由 Ski–exosome 从 3′→5′ 清除。核内 exosome 与 MTR4、TRAMP、NEXT 或 PAXT 类适配复合体处理 spacer fragments、过度延伸的 sn/snoRNA、错误 pre-rRNA/pre-tRNA、未正确装配的 mRNP 和 pervasive transcripts。短 oligo(A) 尾在这些监视路线中常促进底物投递到 exosome,再次说明 polyadenylation 的后果取决于复合体语境。15

翻译还为 mRNA 提供动态质检。无义介导的 mRNA 降解(nonsense-mediated mRNA decay,NMD)识别与 premature termination 相容的翻译和 mRNP context;哺乳动物 exon-junction complex、3′ UTR geometry 和 UPF factors 共同影响判定,其他真核谱系的线索不同。non-stop decay 处理缺少可用 stop codon 的 message,no-go decay 则从严重 elongation stall 和 ribosome collision 启动。三条路线既清除错误 RNA,也调节一部分正常转录本;完整 ribosome rescue 和 nascent protein quality control 见翻译与蛋白质生物合成16

细菌也把 translation state 接入 RNA 质量。无 stop codon 的 mRNA 使 ribosome 停在 3′ 端时,tmRNA–SmpB 可进入空 A site,先像 tRNA 接受 peptide,再切换到自身短 reading frame 给 nascent chain 添加 degradation tag,并释放 ribosome;RNase R 等随后帮助清除问题 RNA。该系统同时挽救 ribosome、标记不完整蛋白和促进 message decay,其核心不只是“tmRNA 兼有 tRNA 和 mRNA 的形状”。

小 RNA 成熟把序列信息装载到 Argonaute 家族

动物经典 miRNA 由 Drosha–DGCR8 Microprocessor 在细胞核内把 pri-miRNA 裁成发夹状 pre-miRNA,经 Exportin-5 输出后由 Dicer 形成约 22 nt 的双链体;其中一条链装入 AGO,构成微 RNA 诱导沉默复合物(microRNA-induced silencing complex,miRISC)。mirtron 等可绕过 Drosha,miR-451 等还可绕过 Dicer,因此发夹、长度或单链状态本身都不足以认定一个 RNA 是 miRNA。成熟 miRNA 的 seed pairing 和其余配对共同影响靶标选择,动物中常招募去腺苷酸化/去帽装置,广泛互补时也可由 AGO2 切割靶 RNA。17

siRNA 通常来自较长 double-stranded RNA,经 Dicer/Dicer-like enzymes 切成带 characteristic ends 的 duplex 后装入 Argonaute。植物、真菌和部分无脊椎动物可用 cellular RNA-dependent RNA polymerase 生成或扩增 secondary dsRNA;Drosophila、mammals 和许多其他动物没有同一扩增装置。长 dsRNA 在哺乳动物细胞还可能优先触发 innate immune response,所以“短于 21 bp 无效、长于 30 bp 一律非特异”不能作为跨生物固定阈值。18

植物 miRNA 多由核内 DCL1 处理,siRNA 则可由 DCL2/3/4 和 RDR family 形成不同长度与功能群,再装入具有偏好的 AGO;其中 24 nt siRNA 进入 RNA-directed DNA methylation,其他小 RNA 可切割 RNA、抑制翻译或在特定组织间移动。动物 piRNA 多由单链前体经不依赖 Dicer 的初级加工形成并装入 PIWI proteins,部分系统用 ping-pong cycle 扩增,3′ 末端常由 HENMT1 进行 2′-O-methylation。其转座抑制接口见DNA重组与转座,小 RNA 改变靶标表达和染色质状态的机制见基因表达调控19

加工机制需要同时读取末端、异构体与 RNP 状态

Northern blot 能显示 RNA 的长度与丰度,却常把相近异构体合为一条带;primer extension、RNase protection、5′/3′ RACE 和长读长测序可定位末端或外显子组合,但 reverse transcription、PCR、ligation 和 RNA degradation 会引入偏差。短读长 RNA-seq 对剪接接头丰度很敏感,却未必把相隔很远的外显子和 poly(A) 位点连成同一个完整分子。异构体结构最好由互补方法、扰动加工因子和直接产物验证共同支持。

编辑位点需要 RNA 与 matched DNA 比较并排除 mapping error、paralog、SNP 和 reverse-transcription artifact;化学修饰则常依赖 antibody enrichment、chemical conversion、mass spectrometry 或 direct RNA measurements,各方法分辨率和选择性不同。R-loop/RNA–DNA hybrid mapping 曾直接揭示 split genes,但今天也不能只凭一个未配对 DNA loop 推断细胞内全部剪接路线。加工因子结合、结构和 knockout phenotype 分别回答“接触什么”“如何催化”和“在细胞中是否必要”,三者不能互相替代。

参考资料与延伸阅读


  1. 细菌 mRNA、rRNA、tRNA 的加工与质量控制及不同 RNase 组合见 Deutscher 的综述;RNase E/J/Y 启动周转和谱系差异见细菌 mRNA 降解综述。 

  2. RNase P、tRNase Z、CCA 添加、tRNA intron 和跨域装置差异见 Phizicky 与 Hopper 的综述RNase P 综述。 

  3. 古菌 pre-rRNA 的 BHB 切割、box C/D/H/ACA sRNP 与修饰见 Yip 等的综述;tRNA/rRNA splicing endonuclease 的底物范围见机制研究综述。 

  4. m⁷G cap 的形成、CBC 介导的加工/输出和 cap 状态差异见 Galloway 与 Cowling 的综述。 

  5. CPSF73 cleavage、poly(A) polymerase、PABPN1 与 deadenylation 的结构和机制见 Liu 等的综述。 

  6. APA 对 3′ UTR 和 coding region 的不同后果及位点选择因素见 Tian 与 Manley 的综述;U7/SLBP 依赖的 histone mRNA 3′ end formation 见CPSF73 综述。 

  7. major spliceosome 的组装、RNA 重排、两次 transesterification 和催化中心结构见 Tholen 与 Galej 的综述及 Alberts 等的教材章节。 

  8. U12-type intron 与 U11/U12/U4atac/U6atac snRNP 的底物和结构边界见minor spliceosome 综述。 

  9. spliced-leader trans-splicing 在 kinetoplastids、nematodes 等生物中的装置和产物见跨物种综述。 

  10. group I/II intron 的 nucleophile、lariat chemistry 及其与 spliceosome 的联系见 Alberts 等的教材章节。 

  11. 真核 pre-rRNA cleavage、snoRNP 修饰和 pre-ribosome assembly 见 Turi 等的综述;核仁空间组织与当前页的分工见细胞核页面。 

  12. ADAR 对 double-stranded RNA 的 A→I editing、recoding 与 innate immune functions 见 Nishikura 的综述及 Eisenberg 与 Levanon 的综述。 

  13. plant organelle C→U/U→C editing 及 PPR factors 见 Hao 等的综述;kinetoplastid gRNA-guided U insertion/deletion 见 Read 等的综述。 

  14. METTL3–METTL14、m⁶A site context 与 reader-dependent outcomes 见 He 与 He 的综述。 

  15. nuclear exosome、MTR4/TRAMP 和异常 RNA surveillance 见 Bresson 与 Tollervey 的综述;cytoplasmic deadenylation、decapping、XRN1 与 exosome 路线见mRNA 降解综述。 

  16. NMD、NGD 与 NSD 的触发线索、ribosome collision 和正常调控底物见 Monaghan 等的综述。 

  17. canonical/non-canonical animal miRNA processing 与 Argonaute loading 见 Shang 等的综述。 

  18. Dicer、Argonaute、guide-strand selection、target cleavage 与谱系差异见 Wilson 与 Doudna 的综述;plant AGO/DCL/RDR 分工见植物 RNAi 综述。 

  19. mammalian primary piRNA processing、PIWI loading 和并非普遍存在的 ping-pong amplification 见 Fu 与 Wang 的综述。 

页面讨论

使用 GitHub 登录后可参与整页讨论;评论独立保存在 GitHub Discussions 中。