Skip to content

实验设计、记录与数据质量

一个实验从提出问题开始,却要靠一系列可检查的决定把问题变成证据:比较哪些对象,处理施加在哪一层,观察什么,怎样避免分组和测量偏倚,原始读数如何与样品相连,偏离方案时怎样记录,最后又怎样从原始数据生成图表和结论。任何一环含混,后面的统计方法都只能精确地分析一个含混的实验。

实验在工作台、培养室、野外样地和数据目录中落实为样品编号、对照安排、随机顺序、实验记录、质量事件、数据版本和报告边界。统计设计的数学结构、效能计算和模型选择已在实验设计、效能与可重复统计系统展开;风险评估、动物与野外伦理以及研究诚信门槛仍以实验安全、伦理与风险管理为前提。

科学问题与可检验比较

实验问题应说明研究对象、条件、处理或暴露、主要观察量和时间范围。“温度影响鱼的呼吸”只给出一个方向;进一步写成“在规定驯化条件下,不同水温处理后的鳃盖运动频率及恢复情况如何变化”,才开始限定对象、操作和读出。操作定义还要说明怎样判定一次鳃盖运动、何时计数、单位是什么、观察者何时停止。组织解剖、物种清查或显微形态描记可以把可靠描述作为目标,因果假设只用于确有处理效应需要检验的研究。

验证性研究通常在结果未知时规定主要问题、主要结局和分析方向。探索性研究则允许从数据中发现新的模式、变量或假说。两者都具有科学价值,区别在于证据角色:数据启发的新假说应标为探索性,随后再用独立数据检验。预注册或带时间戳的方案能够把结果出现前的决定与事后探索区分开来;偏离方案也可以发生,只要保存原计划、写明原因,并在报告中说明改变发生在看见组别结果之前还是之后。1

处理、测量和结论之间还要有明确的推断链。染色变深首先表示当前制样和成像条件下的信号增强,目标分子的绝对含量还需要适当校准;某种动物在一个选择装置中停留更久,首先支持特定装置和时段内的行为差异。把操作读出提升为生理机制、分子身份或自然情境中的行为规律,通常还需要正交测量、干预、时间顺序或独立重复。

实验单位、观察单位与重复

实验单位是能够独立接受处理分配的最小单位,观察单位是实际被测量的对象,研究希望推广结论的对象还可称为生物学目标单位。三者有时相同,也可能位于不同层级。若温度施加给整只水箱,水箱是实验单位,箱内十条鱼是水箱内观察;若药物分别施加给每只动物,动物才是实验单位。一个组织块的多张切片、一张切片的多个视野、同一提取液的多个复孔都不会自动增加处理层面的样本量。2

生物学重复承载独立生物对象或独立完成的生物过程之间的变异,技术重复描述取样、移液、扩增、染色或读数过程的波动。三株独立培养物各测三个复孔,处理比较的生物学重复通常是三株培养物;九个孔可以帮助发现移液失败和估计孔内精密度,却不能写成九个独立培养物。来自同一窝、同一花盆、同一培养皿、同一野外样方或同一次匀浆的观察还可能共享环境和历史,记录时必须保留这种层级。

伪重复会把低层观察误当成高层独立重复,从而夸大信息量。一个处理水箱和一个对照水箱中反复测量许多鱼时,温度效应与两只水箱本身的差异彼此混杂;同一块叶片的二十个视野描述叶片内变化,而非二十株植物的株间差异。增加真正独立的实验单位、让处理跨越批次或地点,或使用配对、区组和层级模型,分别解决不同问题。记录表中应同时保存实验单位标识符(identifier,ID)、低层观察 ID 和它们的从属关系。

对照与质量控制样

对照的作用是把目标效应与背景过程拆开。不同对照隔离不同来源,因此实验开始前应逐项说明每个对照与实验组在哪些步骤相同、在哪一步开始不同,以及该对照失败时本批结果还能支持什么结论。

对照或质控样 主要隔离或检验的过程 常见解释边界
未处理、基线或自身对照 自然状态、时间变化或个体起点 同一个体前后比较仍可能受时间、顺序和残留效应影响
载体、假处理或假手术对照 溶剂、递送、操作、麻醉或损伤本身 只有与实验组经历相同非目标步骤时才可隔离这些效应
空白与阴性对照 培养基、试剂、环境污染、非特异显色或无模板背景 阴性不保证样品步骤成功,也不能替代阳性对照
阳性对照 体系在当前批次能否检出已知反应 阳性成功不证明未知样品中的信号具有同一分子来源
加标、参考物质与过程质控 回收率、基质效应、提取损失、校准状态和全流程稳定性 接受范围须来自方法验证或历史性能,不能看完样品后再放宽
桥接样本与混合质控 跨板、跨批、跨日期或跨仪器的漂移 桥接只能估计已被其覆盖的差异,处理与批次完全重合时仍不可辨认

教学实验常用的无菌空白平板、未接种培养管、分光光度空白、死种子对照、暗处理与沸水处理都具有明确价值。保留这些经典设置时,还要记录它们进入了哪一批、是否经过与样品相同的处理,以及预期读出。空白平板长菌、阳性对照无信号或标准物质超出接受范围属于质量事件,应先调查整批流程,而不是只把异常对照从图中删掉。

随机分配、区组与盲法

随机抽样与随机分配承担不同任务。随机抽样帮助样本代表目标总体,随机分配帮助处理组在已纳入实验单位之间保持可比。便利采到的十株植物可以随机分到处理组,但这不会使它们自动代表整个物种;从培养箱中“随手拿几皿”也可能受位置和生长状态影响。真正的随机过程应保存单位清单、生成方法和最终分配结果,交替分组、凭外观挑选或“看起来差不多”都容易被预见和操纵。

已知的重要差异可通过区组、分层或配对进入设计。动物按窝别或初始体重分层,田间按坡位和土壤带分区,微孔板按行列位置平衡,细胞与分子实验让处理跨越培养批、提取批和测定板。区组内仍需随机分配;区组用于提高同条件比较的精度,不能补救处理与批次完全重合。时间顺序同样需要安排:若所有对照永远先测、所有处理永远后测,处理效应便与仪器漂移和操作熟练度混在一起。

盲法可以分别作用于分配、实施、结局判定和分析阶段。给样品换成不透露组别的代码,能减少显微视野选择、病理评分、行为计数和人工阈值设置受到预期影响。处理具有明显颜色、气味或操作差异时,全程盲法可能不可行,仍可让结局判定者或数据分析者保持盲态,并记录谁在何时知道分组。英国国家动物研究替代、优化与减少中心(National Centre for the Replacement, Refinement and Reduction of Animals in Research,NC3Rs)的实验设计工具把分配、随机化、盲法、样本量和分析组织在同一流程中;动物研究报告规范 2.0(Animal Research: Reporting of In Vivo Experiments 2.0,ARRIVE 2.0)也要求交代各阶段的随机化、盲法、样本量和纳入排除标准。34

样本量、终点与停止规则

样本量取决于主要问题、独立实验单位、预期变异、值得关注的最小效应、目标精度和计划分析,各类实验由此可能需要不同的重复数。三个技术复孔可能足以监测读数稳定性,却很少能代替独立生物重复;一个探索性先导实验可以用于估计流程可行性和变异范围,但其中最大的偶然差异不宜直接作为正式效应量。效能、区间精度、聚类和重复测量的具体计算见效能与样本量

主要结局应在实验前确定,并给出测量时点、单位、汇总层级和成功判据。次要结局和探索性读出可以丰富机制,却不能在主要结局无效后悄悄换成最显著的一项。多时间点、多剂量、多标记和多亚组还会增加分析选择,计划中应说明哪些比较是主要的,哪些需要控制多重性,哪些只用于生成假说。

停止规则同时服务于科学、资源和伦理。动物达到人道终点、培养物污染、仪器失控、关键阳性对照失败或预设信息量达到目标,都可能触发暂停或停止;原因和受影响单位必须记录。边做边看结果,显著就停、不显著就继续加样,会改变错误率和效应估计。需要中期判断时应采用预先设计的序贯规则;安全停止和设备故障处置则不应为了保持样本量而推迟。

方案、样品编码与实施记录

可执行方案比试剂清单更完整。它至少规定实验单位与样品层级、处理和对照、操作顺序、关键时间与环境条件、随机化和盲法、仪器与试剂状态、原始输出位置、质控样与接受标准、偏离方案的处置,以及人员和安全责任。对成熟方法可以引用受控 SOP,再在当次记录中写明 SOP 版本和所有实际改变;“同上次”无法说明上次究竟是哪一版。

样品 ID 应在采集或产生时赋予,并在分装、提取、切片、扩增、成像和分析文件间保持可追溯关系。ID 不宜直接暴露处理组,以便盲态工作;外管、盖子、载玻片和电子清单要采用彼此核对的标识,避免只在可脱落的单一位置书写。分装产生父子样品,混样产生多对一关系,重新标记则保留旧 ID、变更时间和责任人,不能把谱系覆盖掉。

记录字段 至少需要回答的问题 典型例子
对象与来源 这是什么,来自谁或哪里,属于哪个实验单位? 物种/品系、个体、组织部位、培养批、样地、许可或材料编号
条件与材料 当时处于什么环境,使用了哪一批材料? 温度、光照、培养时间、试剂批号、配制日期、培养基与仪器 ID
实际操作 谁在何时做了什么,顺序和剂量如何? 加样次序、处理开始与结束、洗涤、离心、曝光、操作者
原始观察 仪器或观察者最初得到什么? 读数文件、照片、菌落计数、行为逐项记录、解剖草图和现场记录
质量状态 对照是否通过,发生了什么异常? 空白污染、校准失败、气泡、样品溢出、动物退出、偏离方案
数据谱系 这一数值或图表由哪些输入和步骤生成? 文件路径、数据表版本、处理脚本、软件版本、参数和输出 ID

实验记录应在操作发生时或尽快完成,区分计划、实际动作、观察事实和事后解释。纸质记录的更正保留原内容,以单线划改并注明日期和原因;电子记录使用版本历史、审计轨迹或追加式更正。仪器打印、照片、音视频和自动生成文件也属于研究记录,应通过 ID 或链接固定到当次实验,而不是只把筛选后的数值抄进报告。ORI 的数据管理资料强调从采集、存储到共享都要在收集前规划,并使记录能够支持回溯检查。5

原始数据与处理谱系

原始数据是最接近首次观察、尚未被选择性替换的记录。它可能是仪器专有文件、未裁切图像、测序信号、天平输出、野外记录表,也可能是按预先规则人工计数的首次录入。保存原始数据并不意味着拒绝校正、背景扣除、单位换算或图像分割;关键是原始输入保持不变,处理步骤可重放,最终结果能够沿谱系回到输入。

建议把数据分为只读原始层、经过验证的整理层和分析输出层。整理层统一变量名、单位、编码和缺失值,保留数据字典与每次改动;分析层由脚本或明确流程从整理数据生成统计量、图表和表格。手工操作确实无法避免时,也要保存操作前副本和变更日志。文件命名、目录结构、日期格式和版本规则应在项目开始前统一,并由备份、访问控制和完整性检查保护;单纯把文件复制到个人桌面不构成可靠归档。

实验数据还需要足够的元数据才能被理解。数值 0.37 若没有单位、样品、空白处理、仪器设置和时间点,几乎不能复用。可发现、可访问、可互操作和可复用原则(Findable, Accessible, Interoperable and Reusable principles,FAIR principles)要求数据和元数据具有持久标识、丰富元数据、标准词汇和清楚的使用条件;数据的访问方式可以依据隐私、物种保护、知识产权和生物安全要求设置为受控访问。6

质量事件、缺失与排除

数据质量检查先判断发生了什么,再决定数据怎样进入分析。录入错位可对照原始记录更正;仪器饱和说明超出量程;空白污染提示流程背景;样品标签不一致可能使身份无法确认;真实的极端生物反应则仍是研究对象的一部分。把这些情况都叫作“异常值”会掩盖它们不同的原因和证据后果。

纳入、排除和技术重复汇总规则应尽量在看见组间结果前确定。对照失败、低于预定细胞数、样品身份验证失败或明显移液事故可以成为客观质量标准,但要保存被排除单位、原始值、理由、时间和决策者。事后才发现的问题应如实标为事后决定,并同时展示含与不含该点的敏感性分析。一个点离直线远、相关系数未达固定阈值、图形“不好看”或结论不符合预期,都不是独立的删点理由。

质量规则需要让研究记录准确代表实际过程。标准曲线的原始点按预定标准判定,检查配制、量程、空白、残差和模型适用范围后决定重做或保留并解释,避免为接近直线而“微调”、预设“最多舍弃一个点”或把 r > 0.98 当作通用门槛。未完成的死种子对照如实记录为未完成;野外遇到无法鉴定或出现在意外层位的标本,记录、拍照、建立凭证或标为待定;鱼类温度实验中的加水等调整先满足动物福利和安全要求,再作为方案偏离记录。改变、遗漏数据使研究记录不能准确代表实际过程时,可能构成研究记录的篡改,而诚实错误和透明更正则属于另一类事件。7

缺失数据也需要原因,而不仅是空单元格。未采到、设备失败、样品耗尽、低于检出限、动物达到人道终点和“不适用”具有不同含义,应使用明确代码并保留时间点。缺失若与处理或结局有关,简单删除会改变比较对象;分析方法和敏感性评估由缺失、排除与分析集继续展开。

分析、图表与完整报告

分析计划把研究问题映射到变量、比较、模型和图表。确认变量类型、单位、实验单位、配对或区组结构后,先检查数据范围、缺失、分布和质控状态,再执行预定分析。探索性图形可以发现非线性、批次或录入错误,但由这些图形启发的新比较要单独标记。效应量、不确定区间、实际样本量和数据分布比单独报告“显著/不显著”提供更多信息,详见假设检验、效应量与多重比较

图表是数据处理链的输出。坐标轴范围、变换、平滑、归一化、背景扣除、图像裁切和颜色映射都可能改变读者感受,应在可比组间使用一致规则并写入方法。柱状图只给出均值和误差线时可能掩盖分布、样本量与层级;在可读范围内展示独立实验单位的数据点,并明确技术重复如何汇总。显微图像还要遵守图像数据、处理与证据边界所述的原始文件、比例尺和局部处理规则。

完整报告同时包括符合与不符合预期的结果、失败和退出流程、实际执行的方案、全部预定结局以及偏离。阴性结果并不等于“没有任何效应”,其区间可能仍兼容重要差异;质量控制失败也不能包装成生物学阴性。材料、数据和代码无法公开时,应说明伦理、隐私、许可或安全限制,并给出受控访问或可共享的元数据,而不是让限制变成缺少记录的理由。

可复现、可重复与共享

相关术语在学科间用法不同。这里采用美国国家科学院 2019 年报告的区分:可复现性指用相同输入数据、计算步骤、方法和代码得到一致的计算结果;可重复性指重新收集数据,对同一科学问题得到在不确定性范围内相容的结果。前者依赖完整的数据谱系和运行环境,后者还检验效应能否跨样本、批次、地点或团队维持。8

一次实验的可追溯记录是两者的共同起点。方案、随机化表、盲法和揭盲记录、原始数据、数据字典、质控事件、处理脚本、软件与依赖版本、随机种子和最终输出应形成闭合链。复现出同一数字证明计算链能够重放,设计偏倚还需由设计审查和其他证据判断;独立重复得到不同结果也可能揭示真实的环境、基因背景或方法差异。可靠的科学结论来自透明记录、合理设计、独立检验和对差异来源的继续研究,并结合不确定性判断结果是否相容。

参考资料与延伸阅读


  1. Munafò 等的可重复科学宣言说明,预先规定研究设计、主要结局和分析计划有助于区分验证性检验与结果驱动的探索;探索仍可进行,但应透明标记其事后性质。 

  2. Lazic、Clarke-Williams 与 Munafò 在 What exactly is ‘N’ in cell culture and animal experiments? 中区分生物学目标单位、实验单位和观察单位,并说明处理独立施加的实验单位数才决定相应层级的样本量。 

  3. NC3Rs Experimental Design Assistant把实验流程图、随机化、盲法、样本量和分析建议连接起来,可用于动物与其他生物实验的设计检查。 

  4. ARRIVE 2.0 的官方逐项说明解释论文把研究设计、样本量、纳入排除、随机化、盲法、结局和统计列入动物研究的核心报告项目;正文将这些一般原则延伸到其他实验类型,具体动物伦理仍遵守机构规则。 

  5. ORI Data Management Practices要求在数据产生前考虑所有权、采集、存储与共享,并强调数据完整性取决于从规划到发表的持续记录;具体保存期限和访问权限由机构、资助、伦理及法律要求决定。 

  6. Wilkinson 等提出的 FAIR 原则要求数据和元数据具持久标识、丰富描述、标准访问方式、共享词汇和明确复用条件;原则允许在需要时采用认证和授权,不把可访问机械等同于完全公开。 

  7. ORI 的研究不端定义把捏造、篡改和剽窃列为研究不端,其中篡改包括操纵材料、设备或过程,或改变、遗漏数据使研究记录失真;诚实错误和意见差异不在同一定义内,但仍应透明更正。 

  8. National Academies of Sciences, Engineering, and Medicine. Reproducibility and Replicability in Science. 2019. https://doi.org/10.17226/25303。正文采用该报告对计算可复现和新数据重复研究的术语区分,并承认其他领域可能采用相反译法或分类。 

页面讨论

使用 GitHub 登录后可参与整页讨论;评论独立保存在 GitHub Discussions 中。