实验设计、效能与可重复统计¶
实验设计把一个生物学问题变成可以由数据回答的比较。样本进入实验以后,处理施加给谁、在哪一层随机、哪些单位彼此独立、何时测量以及哪些数据会进入分析,已经决定了主要的不确定性来自哪里。统计模型利用实际形成的随机化与重复结构组织这些信息。
经典试验设计以随机、重复和局部控制为主线。这条路径形成于农业田间试验,也自然延伸到动物、细胞、生态和分子实验。现代设计进一步明确待估量、偏倚控制、效能、缺失处理和可重复计算,由此说明每一种经典布局究竟支持什么推断。
从科学问题到待估量¶
“某处理是否有效”需要进一步展开为完整的统计问题。研究者应说明目标总体、实验单位、处理及对照、结局变量、观察时点,以及希望比较的总体量。例如,“在八周龄同品系雄鼠中,给药 14 天后肝脏甘油三酯均值相对于载体对照改变多少”已经规定了对象、处理、结局、时间和均值差;若关注的是达到病理阈值的比例、整个时间曲线或个体内变化,待估量便会不同。
待估量(estimand)是研究要估计的目标量,估计方法(estimator)是用数据计算它的规则。国际人用药品注册技术协调会(International Council for Harmonisation of Technical Requirements for Pharmaceuticals for Human Use,ICH)的 E9(R1) 指南在临床试验中用处理条件、目标总体、变量、群体层面的汇总方式和试验中事件的处理共同定义待估量。1 这种先定问题再定分析的思路也适用于一般生命科学:动物死亡、样本污染、换药或低于检出限都可能改变“比较谁、在什么条件下比较”的含义,因此相关规则应在结果出现前确定。
观察研究记录自然发生的暴露和结局,实验研究则由研究者分派处理。随机分派能在已实施的分派机制下建立处理组可比性,是因果解释的重要基础;随机抽样决定样本如何代表目标总体。二者作用不同:便利抽取的一批动物可以在内部随机分组,处理比较仍可能具有良好的内部效度,但向其他品系、年龄或饲养条件推广仍需生物学论证。观察研究即使样本很大,也仍需处理混杂、选择和测量过程;这些因果识别问题由因果推断继续展开。
设计前可以把问题写成一份简短的目标说明:主要待估量是什么,哪些比较属于验证性目标,哪些是探索性目标,什么大小的差异才值得关注,结论准备推广到哪些单位和条件。后续的对照、随机化、样本量和模型都应与这份说明一致。
因素、处理与实验单位¶
因素是研究中改变或区分条件的变量,水平是因素的具体取值。氮肥剂量的 0、50 和 100 kg/ha 是三个水平;温度与盐度同时变化时,每个温度—盐度组合构成一个处理组合。处理可以只有一个因素,也可以由多个因素共同定义。因素的效应是不同水平所对应的响应差异;一个因素的效应随另一因素水平改变时,便出现交互作用。
主效应和交互作用由模型参数化及比较尺度定义。处理组合具有充分覆盖和独立重复时,多因素设计能够在同一实验中估计多个主效应及其交互。完整的平方和与模型表达见方差分析与线性模型;固定效应和随机效应则应按待估目标、水平来源与推广范围区分,研究者能否控制某个因素并非分类标准,详见广义线性模型与混合效应模型。
实验单位是能够独立接受一个处理分派的最小单位。若饲料配方分配给整笼小鼠,同笼动物共同进食,则笼可能是实验单位;若每只动物独立给药,动物才是实验单位。组织、切片、视野、细胞和技术复孔通常位于实验单位之下。用于处理比较的重复数由处理独立实施的层级决定,数据表行数只表示记录数量。
生物学重复由独立生物单位或独立完成的生物过程提供,用来估计研究对象间的生物变异;技术重复是在同一样本上重复提取、扩增或读数,用来估计和降低测量过程的随机噪声。2 三只动物各测六个复孔,提供三个动物层的生物学重复和每只动物六次技术观测。技术复孔可先按预定规则汇总,也可在层级模型中保留。
“同一处理重复若干次”还需要说明独立性的层级。来自同一窝、培养批、平板、温室、样地或水箱的单位共享环境,可能构成嵌套或交叉层级。只有一个处理水箱和一个对照水箱时,处理与水箱完全混杂,即使每箱测量很多鱼也只形成两个水箱层的实验单位。多个独立水箱、跨批重复或适当的随机化层级可在设计阶段避免这类伪重复。
随机、重复与局部控制¶
随机化¶
随机化用已知的随机机制把实验单位分配到处理,并可进一步随机安排笼位、板位、处理顺序和测量顺序。它使处理分派独立于研究者判断,并把未控制因素的影响转化为可由随机化或概率模型描述的不确定性。随手挑选、“轮流分组”或按动物到达顺序交替处理都可能被提前预测,属于随意分派。英国国家实验动物替代、减少与优化中心(National Centre for the Replacement, Refinement and Reduction of Animals in Research,NC3Rs)的实验设计资料也明确区分随机序列与主观的随意分派。3
随机化必须发生在正确层级。若处理由培养板整板施加,就应随机化板,而不是只随机化板内孔的位置;裂区试验中,难以改变的因素先在主区层面随机,易改变的因素再在子区内随机。统计分析的误差项、自由度和置换范围都要跟随这套分派过程。
受样本量、窝别、性别或批次限制时,可以在区组内随机,或采用分层、成对和受限随机化维持关键变量的平衡。受限随机仍须保留不可预测性并保存生成规则和随机种子。只有最后的组名被隐藏,而执行者能够根据序列猜出下一次分派,选择偏倚仍可能进入实验。
重复¶
重复是在同一处理下对多个独立实验单位实施完整实验。它提供对单位间变异的估计,使处理效应能够与偶然差异分开,并扩大结论所覆盖的单位。增加同一实验单位内的读数主要改善该单位均值的精密度;增加独立实验单位才能直接提高处理比较的自由度和推广基础。
重复还包括跨时间、批次、操作者或地点重新实施整个实验。单批内部的许多动物可以精确估计该批内差异,跨批实施则检验效应能否维持。设计可以有意把批次纳入区组或随机效应,使这种异质性进入估计。
局部控制¶
局部控制把已知的重要异质性组织成较均一的比较集合,最常见形式是区组。田间可按坡位或土壤带分区,动物可按窝别、性别、年龄或初始体重配对或分层,细胞实验可按培养批和板设置区组。处理在每个区组内随机分配,区组差异在分析中单独表达,因而处理比较不再承担全部背景变异。
区组变量应在处理之前确定,并与结局有合理关系。区组太小会限制随机化,太多无关分层会使设计难以实施;处理后变量属于处理过程的一部分,需要依据其因果位置分析。美国国家标准与技术研究院(National Institute of Standards and Technology,NIST)将随机区组设计描述为在区组内比较主要因素,同时由分析吸收区组因素,并概括为控制可识别的重要干扰因素、对其余因素保持随机。4
随机化、重复和局部控制分别处理偏倚、独立信息量和可解释变异。区组提高比较精密度,随机化保护处理比较,独立实验单位提供相应层级的重复;测量流程还需控制持续偏向某组的系统误差。
对照、盲法与实验流程¶
对照使处理效应与实验本底分开。阴性对照显示无目标处理时的背景,载体对照隔离溶剂或递送过程,假手术对照隔离手术和麻醉,阳性对照检验体系能否检出已知反应,基线或自身对照则利用同一单位处理前后的信息。不同对照回答不同问题,一个实验可以同时需要多种对照。
共享对照能够节省资源,例如多个剂量共用一个载体组,但各处理估计会因同一个对照均值而相关。若各批都有自己的对照,应保留“处理与哪一个对照同时实施”的对应关系。只把全部对照合并成一个大组,可能掩盖批次漂移,并给出过小的标准误。
分派隐藏防止纳入或分组人员预知下一项处理,作用在处理实施之前;盲法使给药、照料、结局判定或数据分析人员在相应阶段不知道组别,作用于实验实施和评价过程。二者降低的偏倚不同。无法对明显手术或饲料外观实施全程盲法时,仍可将样本重新编码,使图像分割、病理评分和统计分析保持盲态,并记录何时、为何揭盲。ARRIVE 2.0 要求动物研究报告随机化、各阶段盲法、样本量和纳入排除标准,使读者能够判断结果可靠性。5
空间位置和时间顺序也是实验流程的一部分。温箱层位、笼架位置、微孔板边缘、测序泳道、试剂批次与仪器漂移都可能形成结构性差异。可采用随机或平衡的上样顺序、跨板桥接样本、每批对照和预先定义的质控样本,并在数据表中保存这些字段。若处理和测量顺序完全重合,分析往往无法把处理效应与时间漂移分开。
常用设计结构¶
完全随机与随机区组设计¶
完全随机设计把实验单位直接随机分到各处理,适合单位相对均一、实验条件稳定且随机化不受限制的情形。它结构简单,但明显的窝别、位置或日期差异会进入残差。随机完全区组设计则使每个区组包含全部处理,并在区组内随机;处理比较主要来自区组内部,因此常比忽略区组更精确。
当区组无法容纳所有处理时,可用不完全区组、行列设计或空间设计,但处理的连接性必须足以支持目标对比。区组是在设计阶段对实验单位和随机化范围作出的组织安排。
配对设计¶
配对是每个区组恰含两个相关单位或同一单位接受两种条件的特殊设计。动物实验常按同窝、同性别、年龄和体重相近组成一对,再在每对内随机决定两只动物分别接受哪种处理。这样保留了传统配对设计“方法简单、组内相似、比较精密”的优点,也明确了随机分派不能省略。
两种处理的主要信息是每对差值
其中 \(m\) 是独立配对数。配对 t 检验、配对随机化检验或含配对随机效应的模型都可用于推断;差值模型与含区组项的线性模型具有直接联系。若配对不完整或每个区组多于两个单位,可用能够表达区组与缺失结构的模型,保留不完整区组提供的有效信息。
析因、嵌套与裂区设计¶
析因设计同时安排两个或更多因素的水平组合。完整析因设计覆盖所有组合,能够估计主效应和交互;部分析因设计用较少试验筛查许多因素,却会使某些效应彼此混杂。NIST 的试验设计手册将完全随机、随机区组、完整析因、部分析因和响应面设计置于同一选择框架中。6
嵌套结构表示一个低层单位只属于某个高层单位,例如幼苗嵌套于花盆、花盆嵌套于温室。裂区设计则源于受限随机化:难改变的因素在较大主区分派,易改变的因素在主区内子区分派。主区和子区拥有不同的实验误差,需要在双因素方差分析(two-way analysis of variance,two-way ANOVA)中设置相应的误差层级。
重复测量、交叉设计和纵向设计让同一单位在多个时间或时期接受观察,有时还依次接受不同处理。个体内相关、时期效应、处理顺序和残留效应都进入设计与模型;它们将在生存分析与纵向数据中系统展开。
邻比、间比与经典田间比较¶
传统育种和田间试验在材料多、种子少、地力沿空间变化时,常让待测品系与标准品种相邻或周期性相间。这些设计保留了非常直接的形态和产量比较路径,也反映了局部控制思想在资源受限条件下的具体实现。
邻比设计¶
邻比设计按顺序排列各处理小区,并频繁设置相邻对照,使一个待测材料能够与左侧、右侧或两侧的标准品种比较。它布置直观,田间观察时容易识别局部差异;代价是对照小区占比较大,而且若处理顺序固定,处理与田间空间趋势可能混杂。
分析时可预先规定每个处理对应的邻近对照均值,计算差值或对数比;也可将行、列、区组和空间相关纳入模型。共享同一个对照的小区由此产生相关性,边缘处理与内部处理的比较精度也可能不同。报告相对于邻近对照的百分数时,还需呈现这些协方差和位置差异。
间比设计¶
间比设计通常在试验首尾设置对照,并每隔固定数量的待测处理再插入一个对照;传统材料常建议在若干待测小区后设置一次标准品种,并进行约 2—4 个重复。与邻比相比,它减少了对照占地、能够容纳更多材料,但某些处理距最近对照较远,局部比较的精密度可能下降。
间比数据可以按重复和位置建立区组、行列或空间模型,也可用相邻对照插值描述缓慢的田间趋势。哪种分析有效,取决于处理是否随机或按明确规则安排、对照怎样共享以及空间结构能否估计。邻比和间比能够在设计提供可辨认的处理重复和适当误差层级时进入方差分析;处理与位置完全重合时,二者的效应无法分别估计。
百分比法的用途与边界¶
经典百分比法把同批或邻近对照定为 100%,将处理写成
它便于现场展示相对增减。显著性推断还需考虑分母 \(Y_{Ci}\) 的抽样误差;多个处理共用对照时,各比值也会相关。若响应为正且乘法差异更合理,可以分析
再将估计和区间变回比值尺度。一般线性模型、混合模型或空间模型则可直接估计处理—对照差并保留设计结构。
同样的 10% 差异,在稳定性状和高变异性状、两个重复和二十个重复中具有完全不同的不确定性。显著性须来自随机化分布、抽样分布或明确概率模型;生物学重要性则来自事先规定的最小重要效应。百分数可作为描述量,同时应报告独立重复数、绝对尺度、效应估计和置信区间。
测量质量、误差与批次¶
测量精密度描述规定条件下重复测量结果之间的一致程度,测量准确度描述测得值与被测量真值的接近程度。准确度包含多个相关性质,计量学将真实性与精密度分别定义。7 高精密度的仪器可以稳定地偏离参考值,高准确度的测量则需要同时控制偏倚和随机波动。
实验误差可以从随机测量误差、系统测量误差和人为差错三个方面追查;在统计模型中还需进一步辨析:
- 随机测量误差使重复结果在相同条件下波动,可由复测和方差成分估计;
- 系统测量误差让结果持续偏向某一方向,需要校准、参考物质、空白与流程对照识别;
- 样本错位、单位录错、移液失败等人为差错属于可调查的数据质量事件,需要查明原因并按预定质控规则处理;
- 模型中的残差是观测值与拟合值之差,还可能包含生物异质性、遗漏结构和模型不适配,其含义比仪器测量误差更广。
有效数字应与仪器分辨率和测量不确定度相称。原始记录保留设备实际输出和单位,计算中保留足够位数,最终报告再按预定规则舍入;额外小数位只增加显示精度。更完整的计量学基础见生物数据整理与描述统计。实验设计还关注这些性质是否在处理组间公平:若一组全在旧试剂批测量、另一组全在新批测量,批次效应就与处理混杂。平衡或随机安排处理跨越批次、保留桥接样本和校准记录,通常能更直接地控制这种混杂。
效能与样本量¶
统计效能是在某个具体替代效应成立时拒绝零假设的概率 \(1-\beta\)。它随最小关注效应、变异、显著性水平、样本量、组间分配和分析方法共同改变,因此应针对具体效应和分析方案表述。同一设计可能有能力发现很大的效应,却无力排除较小但仍重要的效应。
最小关注效应应来自生物学、临床或管理意义。小型先导研究主要用于估计变异范围,直接采用其中最大的观测差异容易低估样本量。NC3Rs 的样本量资料也强调,功效计算中的效应量是主要结局上值得检出的最小生物学重要差异。8 变异参数可来自可靠的先导数据、同类研究或保守范围,并应检查这些输入改变时样本量如何变化。
在两组独立、方差近似相同、分配相等且使用大样本正态近似时,每组样本量的粗略关系为
其中 \(\Delta\) 是要检出的均值差,\(\sigma\) 是组内标准差。公式揭示了基本关系:标准差加倍时所需样本量约增至四倍,目标差异减半时也约增至四倍。实际计算应使用与最终分析一致的 t 分布、方差假设和分配比例;比例、计数、生存、聚类或重复测量结局需要各自的模型。NIST 的样本量手册同样要求先给出 \(\alpha\)、\(\beta\)、变异和目标位移。9
整群随机设计的有效信息主要由独立群组数决定,群内个体数提供的附加信息受到组内相关限制。若每群平均有 \(m\) 个观察、群内相关系数为 \(\rho\),简单近似的设计效应为
它说明同群增加个体的边际信息会随相关增强而下降。10 区组和配对若能解释单位间差异则可提高精度;不平衡分配、测量误差、多重主要终点和交互检验通常会增加所需信息。复杂模型更适合用模拟生成符合设计层级的数据,重复拟合计划模型并估计成功概率。
样本量论证还应加入不可分析样本、失访和技术失败的预计比例;实际排除仍按预定规则执行。动物伦理中的“减少”要求使用达到科学目标所需的适当数量,既避免样本过少造成无信息实验,也避免无理由地过量使用。若资源无法达到目标精度,应缩小目标、改善设计、开展先导研究或明确研究的探索性质,并如实报告预计功效。
研究结束后,把观测效应代回公式计算“事后效能”主要是在重新表达已经得到的 p 值。结果解释应回到效应估计、置信区间、设计限制和对最小重要效应的兼容范围;两类错误、功效和等效性更完整的推断语境见假设检验、效应量与多重比较。
缺失、排除与分析集¶
实验单位未进入分析可能来自死亡、污染、仪器故障、结局未测得、违反方案或质量阈值。它们对待估量和偏倚的影响不同。设计阶段应预先说明纳入排除标准、异常技术重复如何汇总、主要结局缺失时如何处理,以及哪些偏离只做标记而不删除。
排除规则应尽量依赖处理前信息或独立质控指标,并在看见组间结果之前确定。若“数值不符合预期”本身成为删点理由,研究者判断便与处理效应纠缠。盲态质控、自动化阈值和保存全部原始记录有助于区分真实失败与选择性清理。ARRIVE Essential 10 要求报告预先建立的纳入排除标准、每组确切分析数及任何排除理由。5
缺失既减少样本量,也可能改变分析所代表的对象。若病情严重的动物更易死亡,完整个案代表的是存活并被测量的子群;简单删除可能改变比较对象。报告应按处理组给出分配、实际接受处理、测量、排除和分析的单位数,并说明原因和时点。主要分析与待估量一致后,再用不同合理缺失机制、排除规则或分析集做敏感性分析;多重插补和模型法仍需以已经记录的缺失原因和辅助信息为基础。
预注册、分析计划与可重复计算¶
预注册是在结果未知时固定研究问题、主要结局、设计和分析决策。它把验证性检验与后来产生的探索性发现分开,却不禁止研究者学习数据:偏离预注册可以发生,只需说明何时、为何改变,并把相应结果标为探索性。实验方案应先描述生物过程和操作,统计分析计划再把待估量、模型、对比、多重性、缺失、排除和敏感性分析写成可执行规则。
一个能够重建分析的项目至少保存以下内容:
- 带版本号和日期的方案、分析计划、随机化列表及揭盲记录;
- 原始数据的只读副本、数据字典、单位、编码、缺失原因和质控日志;
- 从原始数据到分析数据、图表和结果的脚本,而不是只保留手工修改后的表格;
- 软件与依赖版本、运行参数、随机种子和必要的计算环境说明;
- 每个处理组合的独立实验单位数、层级内观察数、排除与缺失流程;
- 主要效应的估计值、置信区间、完整模型、诊断和预先计划的敏感性分析。
随机种子使伪随机步骤可重放,输入数据、软件版本和处理顺序则共同界定计算环境。代码能够在原始输入上重新生成分析数据和最终图表,才形成完整的计算链;设计合理性和数据质量还需分别检查。
术语在不同学科中并不完全统一。这里采用美国国家科学院 2019 年报告的区分:可复现性(reproducibility)指使用相同数据、计算步骤、方法和代码得到一致结果;可重复性(replicability)指新研究重新收集数据,对同一科学问题得到与不确定性相容的结果。11 前者依赖透明数据与计算记录,后者还检验效应能否跨样本、批次、地点或研究团队维持。真实异质性可能使两项设计严谨的研究得到不同效应,因此比较时需结合效应量、区间、条件与方法解释 p 值。
参考资料与延伸阅读¶
-
International Council for Harmonisation. ICH E9(R1): Addendum on Estimands and Sensitivity Analysis in Clinical Trials。指南把试验目标与待估量、主要估计方法和敏感性分析对齐;正文将这一一般思路扩展到生命科学实验。 ↩
-
NIH Office of Extramural Research. Rigor and Reproducibility Training Module 4: Biological and Technical Replicates。 ↩
-
NC3Rs Experimental Design Assistant. Allocation。资料说明随机分派的目的、分派层级及随意分派与真正随机化的区别。 ↩
-
NIST/SEMATECH. Randomized Block Designs。 ↩
-
Percie du Sert, N. et al. (2020). The ARRIVE Guidelines 2.0: Updated Guidelines for Reporting Animal Research. PLOS Biology, 18, e3000410;另见 ARRIVE 2.0 官方逐项说明。 ↩↩
-
NIST/SEMATECH. Choosing an Experimental Design。 ↩
-
Joint Committee for Guides in Metrology. International Vocabulary of Metrology, measurement accuracy 与 measurement precision。 ↩
-
NC3Rs Experimental Design Assistant. Group and Sample Size。 ↩
-
NIST/SEMATECH. Sample Sizes Required for Tests of a Mean。 ↩
-
Kerry, S. M. & Bland, J. M. (1998). The Intracluster Correlation Coefficient in Cluster Randomisation. BMJ, 316, 1455。等群大小且采用简单交换相关近似时,设计效应为 \(1+(m-1)\rho\);群大小不等或层级更复杂时需用相应方法。 ↩
-
National Academies of Sciences, Engineering, and Medicine (2019). Reproducibility and Replicability in Science. Washington, DC: The National Academies Press. https://doi.org/10.17226/25303。 ↩
页面讨论
使用 GitHub 登录后可参与整页讨论;评论独立保存在 GitHub Discussions 中。