生物数据整理与描述统计¶
生物数据是研究过程留下的记录。一个叶片长度、一个物种名称、一只动物在三个时间点的体温,或一次测序未检出信号,都同时携带对象、单位、时间、处理条件和测量方法。这些语义得到保存后,数字才可能成为统计分析的材料。描述统计先辨认数据由谁产生、各行之间是否独立、哪些值缺失,再用图形和数值概括分布,为后续推断建立可信的起点。
这一过程常常暴露出比选择检验方法更根本的问题。技术重复若被当成独立个体,会夸大样本量;缺失值若被编码为 0,会改变分布;均值柱形图也可能掩盖偏斜、离群点和相反的个体变化。生物统计因而从研究对象与数据表之间的对应关系开始,再进入公式和模型。
研究对象与数据表¶
总体、样本与推断对象¶
总体是研究结论希望指向的全部对象或全部可能观测。它可以是有限集合,例如某保护区在调查时段内的全部繁殖个体;也可以是概念总体,例如在规定培养条件下可能产生的所有细胞培养物。总体中的基本成员称为个体,但“个体”未必是一只完整生物:一块样地、一窝幼体、一株植物的一个叶片或一份独立培养物,都可能成为抽样单位。
样本是实际进入研究的总体成员集合,样本中的独立抽样单位数通常记为 \(n\)。总体大小、取样框和进入样本的机制共同决定样本能代表什么。便利取到的 1000 条记录未必比随机取得的 100 条记录更能代表目标总体;同一只动物的 100 次读数也不构成 100 只动物。统计推断把样本中的信息推广到总体时,依赖抽样或实验设计所提供的连接。
不同场景中的“单位”需要进一步拆开:
- 抽样单位是从总体中实际抽取的单位,例如样方、学校或受试者;
- 实验单位是能够独立接受某项处理的最小单位,例如整缸鱼而不是缸内每条鱼;
- 观察单位是产生一行或一组观测的对象,例如一片叶、一个细胞或一次随访;
- 分析单位是模型中被当作一个信息单位的对象。
四者可以相同,也可以构成层级。若肥料随机分配给温室中的整盘幼苗,盘是实验单位,幼苗是观察单位;分析时把每株幼苗都视为独立重复,会忽略同盘共享环境造成的相关性。记录更多行只增加盘内观测,这类伪重复需要在设计或层级模型中处理。技术重复与生物重复的区别见后文,随机化、区组和样本量则在实验设计、效能与可重复统计中展开。
不存在以 \(n=30\) 为界、适用于所有分析的“大样本”和“小样本”。近似是否可靠取决于总体分布、偏斜和尾部、事件概率、统计量、抽样设计及所需精度;复杂层级数据中的有效信息量还可能远小于表中行数。样本量应连同独立单位、效应尺度和分析方法说明。
参数、统计量与待估量¶
参数是描述总体或数据生成过程的量,例如总体均值 \(\mu\)、总体方差 \(\sigma^2\) 和总体中某基因型的比例 \(p\)。在给定总体与时段后,参数被视为固定但通常未知。统计量只由样本数据计算,例如样本均值 \(\bar{x}\)、样本方差 \(s^2\) 和样本比例 \(\hat p\)。重新抽取样本会得到不同统计量,这种抽样波动正是标准误和置信区间的来源。
研究问题还需明确待估量,即希望用数据回答的精确定量问题。比较药物处理与对照时,待估量可能是末次测量的均值差、相对基线的变化差、某时点存活概率之差,或整个随访期间的平均处理效应。它们使用相同样本也会得到不同答案。先定义总体、处理条件、结局和时间范围,才能判断某个统计量是否真的估计了目标参数。
变量与数据类型¶
变量是在观察单位之间可能取不同值的属性。记录下来的具体取值构成数据。变量类型既受测量方式影响,也受研究问题影响:年龄可以按年记录为连续量,也可以分成生活史阶段;疾病严重度可以是有序等级,也可以由连续评分表达。为了建模而分组有时有明确生物学阈值,但随意把连续变量二分会丢失顺序和组内差异。
| 数据类型 | 生物学例子 | 常用描述 | 需要保留的结构 |
|---|---|---|---|
| 名义分类 | 物种、血型、基因型、处理组 | 各类别频数与比例 | 类别编码没有数值远近;需记录参考水平和未知类别 |
| 有序分类 | 发育时期、病变等级、行为评分 | 各级频数、累计比例、中位等级 | 顺序有意义,但相邻等级间距未必相等 |
| 计数 | 每样方物种数、菌落数、突变数 | 频数、均值与方差、零值比例 | 非负整数,观察面积或测序深度等暴露量可能不同 |
| 连续测量 | 体长、浓度、温度、表达强度 | 分布图、位置与离散指标 | 单位、分辨率、检测范围和变换尺度 |
| 比例与率 | 萌发比例、死亡率、每人年发病率 | 分子与分母、观察时间、区间 | 相同小数可来自不同分母;比例与发生率含义不同 |
| 时间到事件 | 萌发时间、复发时间、寿命 | 事件时间与事件状态 | 未发生事件可能是删失,不是“没有寿命” |
| 重复测量与层级数据 | 同一个体多时点、细胞嵌套于培养皿 | 个体轨迹、组内与组间变异 | 个体标识、时间、批次和层级关系 |
定量变量可进一步分为离散与连续。计数只取整数,是典型离散变量;长度在概念上连续,即使仪器只显示到 0.1 mm。分类变量也可称为因素,其可能取值称为水平。处理因素、区组因素及其主效应和交互作用最终由实验设计与模型定义;固定或随机效应的分类还取决于待估目标、水平来源与推广范围。
原始记录与分析数据¶
观察单位与整洁结构¶
一张清楚的数据表应使变量、观测和观察单位彼此对应。整洁数据的基本约定是:每个变量占一列,每个观测占一行,每一类观察单位形成一张表。1 例如植物生长实验中,plant_id、处理组、测量日期和株高分别是变量,每一行表示某株植物在某日的一次观测;植物的固定属性可另存为个体表,通过稳定标识符连接。
“一行一个观测”描述的是表格结构,独立样本数则由数据产生过程决定。同一个体在多个时间点会占多行,母体与后代可能分处两张表,物种出现记录还可能嵌套于样方和地点。数据表应通过稳定标识符明确这些关系。
主数据之外还需要数据字典和元数据。至少记录变量名称、定义、单位、允许取值、缺失编码、测量方法、检测限、时间与时区、样本及批次标识。若 length 一列未说明是体长、翅长还是序列长度,也未说明 mm、cm 或 bp,数值本身无法被可靠复用。
编码、单位与数据层次¶
分类编码应兼顾机器可读与人的可解释性。可以用短代码存储处理组,但数据字典必须给出代码含义;“雄性=1、雌性=2”中的数字只是标签,其平均值没有生物学含义。顺序等级则应明确从低到高的次序。日期宜保存为标准日期时间,地理位置要说明坐标参考系,浓度和剂量要把数值与单位分开记录。
单位换算、对数变换、背景扣除和批次校正都会改变数据。稳妥的工作流保留不可覆盖的原始层、带有审计记录的整理层和直接进入分析的分析层。每一步写明输入、规则和输出,使后来者可以判断 0.25 是原始吸光度、扣除空白后的值,还是归一化比例。
缺失值、零值与检测限¶
缺失值表示本应存在的观测没有得到,零值表示对象在测量尺度上取零,二者需要采用不同编码。“未观察到该物种”“仪器信号低于检测限”“样本遗失”“受试者退出”和“该变量不适用”也对应不同状态。应保留缺失原因和发生阶段,必要时为不同原因使用不同状态码,而分析数据中仍以明确的缺失标记表示。
缺失造成的偏倚取决于缺失机制及分析目标。完全随机缺失(missing completely at random,MCAR)要求缺失与已观测和未观测数据都无关;随机缺失(missing at random,MAR)允许缺失与已观测信息相关;非随机缺失(missing not at random,MNAR)则在给定已观测信息后仍与未观测值相关。这些机制包含难以仅凭现有数据完全检验的假设,需要结合研究过程选择处理方法。2 描述阶段至少应报告各变量和各组的缺失数量、比例、组合模式与原因,保留用于解释缺失的辅助变量。
低于检测限的结果需要结合检测过程、删失模型、研究目的和敏感性分析处理。一律填 0、检测限或检测限的一半会制造尖峰并压缩变异;原始检测状态应始终保留。
异常值与质量核查¶
异常值是相对数据主体显得极端的观测,不等同于错误。它可能来自录入单位错误、样本污染或仪器故障,也可能代表真实的罕见表型、混合亚群或重尾分布。首先应回到原始记录核对样本身份、单位、量程、批次和实验日志,再结合时间轨迹、散点图、箱线图及领域边界判断。
删除规则应在看见结论之前尽量确定并留下记录。确认的录入错误可以更正,无法恢复的错误可标为缺失;来源可靠的极端值应保留,并考虑稳健描述、合适分布或包含与排除两种分析。箱线图须线之外的点只是按某条图形规则标出的候选,其来源仍需回到数据和实验过程判断。美国国家标准与技术研究院(National Institute of Standards and Technology,NIST)的异常值指南也强调,识别异常必须以数据整体结构和所假定的正常模式为背景。3
测量质量与不确定性¶
准确度、精密度与误差¶
在同一对象上重复测量时,结果可能彼此接近,也可能接近参考值,这两个性质需要区分。测量精密度描述在规定条件下重复测量结果之间的一致程度;测量准确度描述测得值与被测量真值之间的接近程度。准确度包含多个相关性质,国际计量学词汇将精密度另作定义。4
随机测量误差在重复测量间以不可预测方式变化,主要影响结果的离散程度;系统测量误差在重复条件下保持不变或按可预测方式变化,可能造成测量偏倚。增加重复测量可以更清楚地刻画随机变异,仪器校准和参考物质则用于识别系统偏差。样本标签互换、单位抄错等粗大错误属于过程失误,需要单独追查。
测量结果应与其不确定性和适用条件一起解释。测量不确定度概括根据现有信息归属于被测量值的离散程度,可包含重复测量估计的成分,也可包含校准、标准物质和仪器分辨率带来的成分。5 样本标准差描述当前观测的离散,完整的测量不确定度还包含其他来源;总体参数的标准误则描述估计量的抽样波动。
有效数字与舍入¶
有效数字反映记录所支持的分辨程度。原始数据应按仪器实际分辨率和实验规程保存,不凭视觉整齐补出虚假精度;计算过程中保留足够位数,只在最终报告时按测量不确定性和用途舍入。连续多步运算若每一步都舍入,会积累不可逆误差。
尾数恰好落在两个可表示数中间时,“四舍六入、五取偶”能够减少大量重复舍入中的单向偏差,但它是一种约定,并非所有仪器和软件都默认采用。研究记录应说明特殊舍入规则。对数尺度也要特别谨慎:例如 pH 的小数位与氢离子活度有效数字的对应关系不同于普通线性量。
生物重复与技术重复¶
生物重复来自彼此独立的生物样本,用来刻画研究总体内的生物变异;技术重复是对同一样本的重复处理或读数,用来刻画实验步骤和仪器噪声。美国国立卫生研究院(National Institutes of Health,NIH)的可重复性培训也采用这一划分。6 多个技术孔平均后可以提高一个生物样本测量的精密度;三只动物仍提供三个动物层的独立重复。
重复的独立性仍由实验过程决定。来自同一窝、同一培养批次或同一地点的生物样本可能共享环境或遗传背景;将它们称为“生物重复”并不会消除层级相关。描述数据时应同时报告独立实验单位数、每单位的观察数、技术重复数和汇总规则。
分布检查与统计摘要¶
频数表与分组¶
频数分布把观察值按类别或区间汇总。名义和有序变量可直接列出每个类别的频数 \(f_i\) 与相对频数 \(f_i/n\)。连续变量则常在极差范围内设置若干组,记录组限、组距、组中值和落入各组的观测数。区间端点必须使用一致的开闭规则,避免边界值被重复或遗漏。
分组会压缩信息。组数太少会掩盖偏斜、多峰和间隙,组数太多则使随机起伏突出;合适的组数因样本量和分布而异。直方图还受起点和组距影响,应在重要结论上查看不同合理分箱。各组宽度不等时,柱高必须表示频数密度,使柱面积对应频数或比例。NIST 对直方图的定义同样区分了频数、相对频数与面积归一化的密度。7
只掌握分组表时,可以用组中值近似每组数据并估算均值和方差;结果是对原始数据的近似,精度受组距和组内分布影响。若原始数据仍在,应直接用具体数值计算。频率多边形把各组中值处的频数或频率以线段连接,适合在相同分组规则下叠加比较若干分布;折线连接的是分组摘要,组内数据的连续变化需由原始数据判断。
图形与数据结构¶
图形的选择由变量类型、研究设计和想展示的关系共同决定,软件菜单只是实现工具。
| 目的 | 合适图形 | 读图重点与限制 |
|---|---|---|
| 比较分类频数或比例 | 条形图、点图、马赛克图 | 柱之间留空;比例应同时给出分母,类别过多时点图更易比较 |
| 查看一个连续变量的分布 | 原始点图、直方图、频率多边形、密度图、经验累积分布图 | 检查中心、离散、偏斜、多峰、边界和异常值;直方图与频率多边形依赖分箱 |
| 比较多个组的连续分布 | 分组原始点、箱线图、小提琴图或雨云图 | 展示样本量和个体值;小样本密度形状可能不稳定 |
| 查看两个定量变量的关系 | 散点图 | 检查形状、方向、异方差、簇和影响点;散点图不是一元频数图 |
| 展示配对或重复测量 | 连线点图、个体轨迹图 | 保留同一对象之间的连接,避免把相关观测画成独立组 |
| 展示随时间变化 | 带原始轨迹的时间序列图 | 时间顺序、间隔和缺测必须保留;组均值线会掩盖个体差异 |
饼图用扇区角度表示组成,适合类别很少且总和确为整体的场景;人眼比较角度和面积通常不如比较共同基线上的长度精确,因此需要细微比较时优先使用排序条形图或点图。
箱线图的箱体通常从第一四分位数 \(Q_1\) 延伸到第三四分位数 \(Q_3\),箱内线表示中位数。须线存在不同约定:有的延伸至最小值和最大值,更常见的 Tukey 形式延伸至不超过 \(Q_1-1.5IQR\) 与 \(Q_3+1.5IQR\) 的最远观测,其余点单独标出,其中 \(IQR=Q_3-Q_1\)。作图和读图时都应先确认软件采用的定义。8
均值加误差线的柱形图把大量不同分布压缩成近似相同的外观。对样本量不大的连续数据,显示原始点、分布形状和配对关系,能让读者判断偏斜、离群点和组内异质性;一项针对生理学论文的系统评估展示了相同均值与标准误可对应截然不同的数据分布。9
集中趋势与离散程度¶
算术均值、中位数与众数¶
样本算术均值为
它利用全部观测,保留原单位,并具有两个重要代数性质:各观测对均值的离差之和为零;在所有常数 \(a\) 中,均值使平方离差和 \(\sum_i(x_i-a)^2\) 最小。正因为平方会放大较大离差,均值也容易受极端值影响。
将观测由小到大排列,中间位置给出中位数。样本量为偶数时通常取中间两项的平均。中位数使绝对离差和 \(\sum_i|x_i-a|\) 最小,对少数极端值较稳健,适合明显偏斜的连续分布和有序数据;但它不描述尾部有多长,也不能替代完整分布图。
众数是频数最高的取值或类别,可用于名义分类数据。连续数据的众数常依赖测量精度、分箱或密度估计方法,多峰分布还可能有多个众数。均值、中位数和众数分别概括不同性质,选择时需结合分布形状与研究目标。
几何均数与比例变化¶
对全部为正的 \(n\) 个数,几何均数为
它适合由乘法变化产生的正值数据,例如若干时期增长倍数的中心或近似对数对称的浓度。几何均数要求所有数值为正;含零或负值时,需要依据其产生机制选择其他摘要或变换,随意加常数会改变结果的科学含义。若研究对象是百分比变化,还应区分倍数的几何中心与百分数的算术平均。
分位数、极差与四分位距¶
\(p\) 分位数把排序数据分成低于和高于该位置的相应比例。中位数是 0.5 分位数,第一和第三四分位数对应 0.25 与 0.75。样本分位数在有限数据中需要插值,不同教材和软件存在多种约定;样本很小或数值离散时,应说明所用算法,避免把末位差异误认为数据矛盾。
极差 \(R=x_{\max}-x_{\min}\) 只由两个端点决定,随样本量增加通常会增大,对单个极端值高度敏感。四分位距 \(IQR=Q_3-Q_1\) 概括中间 50% 的宽度,更稳健但有意忽略尾部。二者都应与样本量和分布图一起解读。
方差、标准差与稳健离散量¶
总体方差定义为平方离差的总体平均:
用样本估计总体方差时,常用
分母 \(n-1\) 源于均值已经由同一批数据估计,只有 \(n-1\) 个离差可自由变化;在独立同分布且方差有限的抽样模型下,这使 \(s^2\) 成为 \(\sigma^2\) 的无偏估计。若眼前数据就是完整有限总体,描述该总体本身可以使用分母 \(N\)。因此“总体方差”和“样本方差”的分母选择来自对象与估计目标,表格大小本身不提供判断标准。
标准差 \(s=\sqrt{s^2}\) 与原变量单位相同,描述观测围绕均值的典型离散尺度。完整频数分布还需要原始数据或分布模型呈现;均值的标准误则描述统计量在重复抽样中的波动。对重尾或强偏斜数据,可同时报告中位数绝对偏差(median absolute deviation,MAD)等稳健尺度以及分位数。
变异系数及其边界¶
变异系数通常写为
它用相对于均值的尺度比较变异,最适合具有有意义绝对零点的比率尺度,例如同一类正浓度或体重。摄氏温度换成华氏温度会改变 CV,说明区间尺度上这一比值没有稳定含义。均值接近零时 CV 会急剧增大,均值跨过零时符号也难以解释;这些情形需要采用其他离散尺度。不同测量对象若误差随均值变化方式不同,比较时也需结合误差模型。
摘要组合与分组描述¶
近似对称、单峰且没有强影响点的数据,常以均值和标准差概括;明显偏斜或含极端值的数据,更适合中位数和四分位距。分类变量报告各水平的频数与比例,并给出分母。数值摘要与图形、研究设计信息共同呈现数据结构。
汇总前还要检查有意义的分组。把雌雄、生命阶段、处理条件或批次混在一起,可能产生混合分布的“双峰”或掩盖方向相反的变化;在看过结果后反复切分亚组则会增加偶然模式。描述统计应按预先重要的生物学层次展示,同时明确哪些分组是探索中发现的。
探索性描述与确认性分析¶
探索性数据分析(exploratory data analysis,EDA)利用图形和稳健摘要检查分布、结构、异常点、缺失和可能的关系,其价值在于让数据暴露原先没有充分预料的模式。NIST 将它概括为一种以图形为主、用于发现结构和检验假设条件的分析取向。10 探索时尝试不同尺度、分组和变换十分必要,但这些尝试也构成了分析选择。
确认性分析回答事先明确的问题,需要在设计、主要结局、比较、模型和排除规则的约束下解释估计值与不确定性。若同一数据先用于发现某个阈值或亚组,再把它当作预设假设检验,证据会过于乐观;可以将其标为探索性发现,并用独立数据或恰当的内部验证继续检验。
描述统计连接两者:它既帮助发现数据质量和分布问题,也应如实呈现样本构成、独立单位数、缺失、单位和全部关键组别。完成这一层后,才进入概率与概率分布、抽样、参数估计与置信区间以及具体模型。数据整理记录了证据如何形成,是统计分析的组成部分。
参考资料与延伸阅读¶
- Whitlock MC, Schluter D. The Analysis of Biological Data. 3rd ed. Macmillan Learning; 2020.
- NIST/SEMATECH. e-Handbook of Statistical Methods: Exploratory Data Analysis.
- Wickham H. Tidy Data. Journal of Statistical Software. 2014;59(10):1–23.
- Joint Committee for Guides in Metrology. International Vocabulary of Metrology—Basic and General Concepts and Associated Terms (VIM), 3rd edition. JCGM 200:2012.
- National Research Council. The Prevention and Treatment of Missing Data in Clinical Trials. National Academies Press; 2010.
- Weissgerber TL, Milic NM, Winham SJ, Garovic VD. Beyond Bar and Line Graphs: Time for a New Data Presentation Paradigm. PLOS Biology. 2015;13(4):e1002128.
-
Wickham 在 Tidy Data中将整洁数据定义为每个变量一列、每个观测一行、每类观察单位一张表;这一结构用于保存数据语义和支持一致的整理工具,并不声称各行在统计上独立。 ↩
-
National Research Council 的缺失数据专著系统区分 MCAR、MAR 与 MNAR,并强调对不完整数据的推断依赖不能仅由已观察数据验证的缺失机制假设。 ↩
-
NIST/SEMATECH 异常值指南把异常值界定为相对样本中其他值距离异常的观测,同时要求先刻画整体数据模式,再识别偏离者。 ↩
-
VIM 对测量不确定度的定义包含基于已有信息归属于被测量值的离散参数,并允许随机效应与系统效应相关成分共同进入评定。 ↩
-
NIH 的生物重复与技术重复培训材料将生物重复定义为不同生物样本的平行测量,将技术重复定义为同一样本的重复测量,后者主要反映流程和设备的随机噪声。 ↩
-
NIST/SEMATECH 的直方图说明区分频数、相对频数和面积归一为 1 的密度形式,并把中心、离散、偏斜、异常点与多峰列为主要读图对象。 ↩
-
NIST/SEMATECH 的箱线图说明同时介绍延伸至极值的基本形式和以 \(1.5IQR\) 围栏标记候选异常值的变体,因此须线含义应随具体定义报告。 ↩
-
Weissgerber 等的系统评估检查 703 篇生理学研究论文,并用实例说明均值加误差线会隐藏连续数据的分布和配对结构,建议小样本研究呈现原始数据。 ↩
-
NIST/SEMATECH 对探索性数据分析的说明强调从数据中发现结构、异常与模型假设,并把原始数据图和简单统计量图结合使用。 ↩
页面讨论
使用 GitHub 登录后可参与整页讨论;评论独立保存在 GitHub Discussions 中。