分类资料与非参数检验¶
生命科学数据可以落在连续测量、计数、比例或次序等多种尺度上。萌发与否、基因型类别、感染状态和行为等级首先产生的是计数、比例或次序;偏斜的浓度、有限等级评分和少量配对观测又常使均值模型难以概括问题。分类资料方法直接描述各类别的概率与关联,秩方法和置换方法则在较少分布假定下利用次序或随机化结构。三类方法分别对应不同的数据结构和科学目标。
数据结构与分析目标¶
计数、比例与率¶
分类资料表中的基本量是计数。若在 \(n\) 个独立且具有相同成功概率的试验中观察到 \(x\) 次成功,样本比例为
比例的分母必须是有机会产生该结局的观察单位。20 个培养皿中有 8 个污染,与 20 个培养皿共培养 400 小时出现 8 次污染事件,是不同的数据生成过程:前者可写为二项比例,后者通常需要以暴露时间为分母的发生率。一个个体可能发生多次事件时,事件数还包含个体内重复,需要转向泊松(Poisson)、负二项或重复事件模型。
分类变量可以是无序的名义类别,也可以有自然次序。血型 A、B、AB、O 没有大小关系;疾病分期或五级损伤评分保留了次序,但相邻等级之间未必等距。把等级任意编码成 1、2、3 后求均值,会额外假定这些数值间隔具有度量意义。列联表可以忽略次序检验一般关联,秩检验或有序模型则能利用次序;选择取决于研究问题,软件输入格式只是实现条件。
抽样设计决定可比较对象¶
同一张 \(2\times2\) 表可以来自随机试验、队列研究、病例—对照研究或一次横断面抽样。随机试验和队列研究通常能直接估计两组结局风险;病例—对照研究按结局抽取个体,样本中的病例比例由设计固定,通常以优势比描述暴露—结局关联。横断面资料给出调查时点的患病比例或状态关联,发病风险和因果效应还需相应的时间与识别结构。
观察单位仍须独立。来自同一窝、同一培养皿、同一受试者多个部位或重复时间点的分类结果具有相关性,把它们当成独立个体会低估不确定性。简单列联表适用于独立观察;配对二分类资料使用 McNemar 检验,多个重复或层级分类结局则需要边际模型或混合效应模型。
一个总体比例¶
设 \(X\sim\operatorname{Bin}(n,p)\),要检验
在 \(H_0\) 下,成功数的概率质量由二项分布精确给出。精确二项检验把观测到的 \(x\) 与 \(X\sim\operatorname{Bin}(n,p_0)\) 的尾部概率比较,可直接用于有限样本。R 的正式统计文档也把它定义为伯努利试验(Bernoulli trial)成功概率的简单零假设检验,并同时返回 Clopper–Pearson 区间。1
当二项分布的离散形状可由正态分布良好近似时,经典得分统计量为
分母使用零假设规定的 \(p_0\),因为检验统计量的参照分布是在 \(H_0\) 下构造的。正态近似质量由 \(np_0\)、\(n(1-p_0)\)、尾部方向和所需精度共同决定,固定的样本量阈值无法概括这些条件。比例检验的精确参照来自二项分布,小样本时可直接计算二项尾概率。
连续性校正试图弥合离散二项计数与连续正态曲线之间的距离。对双侧检验,可把分子写为
但校正后的近似往往更保守。是否校正应与所采用的近似及软件实现一并报告,并结合离散程度判断。近似明显不可靠时,直接计算精确二项概率或采用经校准的方法更清楚。
检验之外还应报告 \(\hat p\) 及置信区间。精确 Clopper–Pearson 区间保证覆盖率至少达到名义水平,但可能偏宽;Wilson 得分区间通常有较好的有限样本覆盖。两者的详细构造见抽样、参数估计与置信区间。离散检验的 p 值也只能取有限组数值,因而“精确”表示在指定模型下控制错误率,不表示区间最短或结论没有模型假定。
两个独立总体比例¶
二乘二表与效应尺度¶
两个独立组的二分类结局可写成
| 组别 | 发生 | 未发生 | 总数 |
|---|---|---|---|
| 处理组 | \(a\) | \(b\) | \(n_1=a+b\) |
| 对照组 | \(c\) | \(d\) | \(n_0=c+d\) |
两组风险估计分别为 \(\hat p_1=a/n_1\) 和 \(\hat p_0=c/n_0\)。检验是否有关联只给出方向有限的证据,效应大小至少可以从三个互补尺度描述:2
风险差(risk difference,RD)给出每个观察单位增加或减少多少绝对风险,最便于估计额外病例数;风险比(risk ratio,RR)给出相对倍数;优势比(odds ratio,OR)比较发生与不发生的优势。在结局罕见时 OR 与 RR 接近,结局常见时 OR 会比 RR 离 1 更远,二者应按各自尺度解释。零格还会使朴素 OR 为 0 或无穷,此时应采用与抽样设计相符的精确、惩罚或模型方法,并说明连续性修正等具体处理。
两比例的得分检验¶
要检验 \(H_0:p_1=p_0\),零假设把两组视为共享一个成功概率。合并估计为
相应统计量为
两独立比例差的未合并标准误可用于置信区间:
检验 \(p_1=p_0\) 时的得分统计量则使用零假设下的合并概率。二者分别用于区间估计与零假设检验。比例差、风险比和优势比都应给出置信区间;在小样本、极端比例或零格时,Wald 区间尤其不稳健。
两比例得分检验与未校正的 \(2\times2\) Pearson χ² 检验等价,满足 \(\chi^2=z^2\)。这种联系说明“两个比例比较”和“列联表独立性”是同一问题的不同表达。若单元格稀疏,可用 Fisher 精确检验或与抽样方案相符的精确/Monte Carlo 方法;若两次结果来自同一对象,则两组并不独立,应改用配对分类资料的方法。
拟合优度检验¶
Pearson 统计量与自由度¶
拟合优度检验比较一组观察计数 \(O_1,\ldots,O_k\) 与理论概率 \(\pi_1,\ldots,\pi_k\)。在 \(H_0\) 下,期望计数为 \(E_i=n\pi_i\),Pearson 统计量为
若全部 \(\pi_i\) 事先给定,自由度为 \(k-1\),因为总计数固定形成一个约束;若又用数据估计了 \(s\) 个独立参数,通常再减去 \(s\),得到 \(k-1-s\)。把每类分别写成 \(H_0:O-E=0\) 容易忽略这些计数受总数约束,正式零假设应是整个类别概率向量等于理论向量。
χ² 参照分布是大样本近似。NIST 指出,分组方式会影响检验统计量和功效,连续分布先分箱还会丢失箱内信息。3 对原本就是离散类别的数据,分类由科学问题决定;对连续数据的分布拟合,若可用不依赖任意分箱的专门检验或图形诊断,通常不应为了套用 χ² 而随意切箱。
孟德尔分离比例¶
拟合优度检验在经典遗传学中的自然用途,是比较子代表型计数与分离模型给出的概率。孟德尔在豌豆杂交资料中记录到 705 株具有紫红花与灰褐种皮、224 株具有白花与白种皮,共 929 株;单基因显隐性分离模型给出 \(3:1\) 的表型比例。4 因而
在自由度 1 的 χ² 分布下,\(p\approx0.532\),数据没有提供反对 \(3:1\) 模型的充分证据。这一结果不证明所有后代都必然按精确的 \(3:1\) 出现,也不验证模型的全部生物学前提;它只说明本次计数与该概率模型相容。若外显率、致死、选择、连锁、评分错误或家系相关改变了生成过程,就需要重写期望概率或采用层级模型。
两类别和多类别的“遗传学简式”都可由 Pearson 通式代数化简得到。通式能够显示每类对统计量的贡献,也便于扩展到 \(9:3:3:1\) 等多类别比例。报告时应列出观察数、期望数、理论比例与自由度,并给出最终的 \(\chi^2\) 值。
稀疏期望数与模拟检验¶
期望数大于 5 是便于手算的保守经验。常见的近似诊断是没有期望数低于 1,且至少 80% 的期望数达到 5;R 的 Fisher 混合算法也把这组 Cochran 条件作为是否切换近似的默认参数。5 近似质量还受类别数、概率不均衡和尾部要求影响,需要综合判断而非把 5 当作绝对边界。
期望数过小时,可以在不破坏科学含义的前提下事先合并类别,或由多项分布直接计算精确/蒙特卡洛(Monte Carlo)p 值。类别合并规则应在查看结果前依据科学含义确定。Monte Carlo 检验须报告模拟次数和随机误差;模拟次数为 \(B\) 时,可分辨的最小 p 值约为 \(1/(B+1)\)。R 的 Pearson \(\chi^2\) 文档同时支持拟合优度和列联表的 Monte Carlo 计算,并明确返回观察数、期望数和残差。6
列联表中的独立性与关联¶
独立性检验¶
在 \(r\times c\) 列联表中,\(O_{ij}\) 是同时落入第 \(i\) 行和第 \(j\) 列的计数。零假设为两个分类变量独立,即联合概率可以分解为行、列边际概率的乘积。由边际总数得到的期望计数为
Pearson 统计量与自由度为
美国国家标准与技术研究院(National Institute of Standards and Technology,NIST)的列联表说明给出同一边际乘积公式。7 若行总数由实验设计固定,检验也可表述为各组类别分布是否同质;计算相同,但抽样含义和可推广总体不同。显著结果表示观察到的联合分布难以由独立模型解释,因果作用还需要研究设计和识别条件支持。
似然比统计量
在大样本下也近似服从相同自由度的 \(\chi^2\) 分布,并自然连接对数线性模型(log-linear model)与广义线性模型。零观察项按极限记为 0。Pearson \(X^2\) 与 \(G^2\) 在稀疏表中都可能偏离渐近分布,因此仍需检查期望数和抽样设计。
二乘二简式与连续性校正¶
对前述 \(2\times2\) 表,未校正 Pearson 统计量可化为
Yates 连续性校正的经典简式为:
它针对一自由度的 \(2\times2\) 近似,目的是减少连续 \(\chi^2\) 分布对离散表的偏差。校正常使检验更保守,现代分析应说明是否采用,并与 Fisher 精确检验、未校正得分检验及区间估计一起按设计和稀疏程度判断。
Fisher 精确检验¶
Fisher 精确检验在给定行、列边际总数的条件下,依据超几何分布枚举与观察表同样或更极端的表。对 \(2\times2\) 表,条件独立等价于优势比为 1;R 的正式实现也以固定边际和优势比为核心,并提醒双侧“更极端”表的定义可能因实现而异。5
精确检验的解释取决于条件参照集是否符合研究设计、双侧定义、离散保守性和计算规模。大而稀疏的 \(r\times c\) 表可采用网络算法或固定边际的 Monte Carlo 近似。报告应写明使用精确、渐近还是模拟方法,而不能统称为“卡方检验”。
关联强度与单元格诊断¶
整体 χ² 显著后,需要说明关联来自哪里以及有多大。\(2\times2\) 表优先报告 RD、RR 或 OR 及区间;一般 \(r\times c\) 名义表可报告 Cramér \(V\):
\(V\) 介于 0 和 1 之间,但其“大小”仍依赖表的维数和领域语境。Pearson 残差 \((O_{ij}-E_{ij})/\sqrt{E_{ij}}\) 或考虑边际约束的标准化残差可定位贡献较大的单元格;逐格检验还涉及多重比较,最大残差需要在相应检验家族中解释。
边际关联也可能被第三变量混杂或反转。按性别、批次、地点等分层后,条件关联可能与合并表不同,这正是辛普森悖论(Simpson's paradox)所揭示的结构。是否应合并分层取决于研究设计和目标效应;多层列联表和调整后关联将由广义线性模型与混合效应模型继续展开。
配对分类资料¶
同一对象处理前后各记录一次二分类结局,或两个对象按关键特征一一匹配时,可写成
| 第一次/方法 A | 第二次/方法 B:阳性 | 第二次/方法 B:阴性 |
|---|---|---|
| 阳性 | \(a\) | \(b\) |
| 阴性 | \(c\) | \(d\) |
一致对 \(a,d\) 不提供两边际概率差异的方向信息,McNemar 检验只比较不一致对 \(b,c\)。在 \(H_0\) 下,给定不一致对总数 \(b+c\),其中落在任一方向的条件概率为 \(1/2\)。大样本统计量为
连续性校正版为
不一致对较少时,可直接对 \(b\mid(b+c)\sim\operatorname{Bin}(b+c,1/2)\) 做精确二项检验。McNemar 零假设是两种方向转换概率相同,等价于配对二分类边际概率相等;普通独立性检验则对应另一种零假设。R 文档也把 McNemar 检验定义为二维表的行列对称性检验。8
效应量可报告两次边际比例差及配对区间,或报告不一致对优势比 \(b/c\) 并说明方向。若每个对象接受三个以上处理或在三个以上时间点重复记录二分类结果,Cochran \(Q\) 是 McNemar 思路的总体扩展;存在协变量、缺失或不等随访时,广义估计方程和混合 logistic 模型更能保留数据结构。
秩与符号方法¶
非参数方法的假定¶
非参数方法通常不指定正态分布的均值和方差模型,但仍依赖独立性、配对结构、连续性或可交换性等条件。它们也有明确的检验对象:符号检验利用方向,Wilcoxon 方法利用秩,Mann–Whitney 检验随机抽取两组观察值时谁更大的倾向。各种非正态数据仍需依据科学问题和形状、尺度、离群结构选择方法,而不能统一视为“中位数检验”。
分析前应先画出原始点、配对连线、箱线图或经验分布,明确关心的是均值、中位数、一般位置移动、随机优势还是完整分布差异。秩变换保留次序并舍去原始间距,因此对极端值较不敏感;原尺度均值差则需用保留数值间距的方法估计。
符号检验¶
单样本或配对符号检验对每个非零差值 \(D_i\) 只记录正负。若连续差值分布的中位数为 0,则正差与负差概率各为 \(1/2\);在 \(n^\ast\) 个非零差值中,正号数
因此可以用精确二项分布计算 p 值。零差如何处理必须说明,通常从有效符号数中移除。符号检验允许差值分布不对称,对离群值很稳健,但忽略差值大小,功效通常低于能合理利用大小信息的方法。它检验中位方向或正负概率;均值变化需要采用相应均值方法估计。
Wilcoxon 符号秩检验¶
符号秩检验先去除零差,对 \(\lvert D_i\rvert\) 从小到大排序,再求正差的秩和 \(W^+\)。它同时利用方向与相对大小,适用于单样本中心或配对差值。其经典位置解释要求差值来自连续、关于某中心对称的分布;R 文档明确把零假设写成差值分布关于给定位置对称。9
若差值明显偏斜,符号秩检验反映的分布差异需要按其秩结构解释。并列秩、零差和正态近似会改变精确分布,需要使用相应的并列修正或条件置换算法。可同时报告 Hodges–Lehmann 位置移动估计及区间,并展示配对差值分布,使检验对象与效应大小保持一致。
Mann–Whitney 秩和检验¶
两个独立样本合并排序,第一组秩和为 \(R_1\) 时,
\(U_1/(n_1n_0)\) 与随机从第一组取一个值、从第二组取一个值时前者更大的概率相关,并列时通常各计 \(1/2\)。因此它自然描述随机优势。方法学文献强调,Mann–Whitney 检验也会对分布形状和离散程度差异敏感;在两总体除位置移动外形状相同等附加条件下,才可把结果进一步解释为中位数或共同位置参数的差异。10
两组观察仍须独立。成对数据使用符号或符号秩检验;整群或重复观测还需在排名之外表达相关性。严重并列的有限等级资料需要并列修正,且应考虑有序分类模型是否更贴近研究目标。
Kruskal–Wallis 与 Friedman 检验¶
Kruskal–Wallis 检验把 Mann–Whitney 思路扩展到 \(k\) 个独立组。总样本量为 \(N\),第 \(j\) 组样本量和秩和分别为 \(n_j,R_j\) 时,
并对并列秩修正;大样本下参照自由度 \(k-1\) 的 χ² 分布。总体检验显著只说明至少一组的秩分布不同,后续成对比较应使用与秩统计量相容的方法并控制多重性。若各组分布形状相似,可以作位置差异解释;否则可能反映尺度或形状差异。
Friedman 检验处理 \(b\) 个完整区组或对象在 \(k\) 个处理下各有一个观测的设计。它在每个区组内部排名,再比较各处理秩和:
大样本下 \(Q\) 近似服从自由度 \(k-1\) 的 \(\chi^2\) 分布。区组可以是受试者、地块或匹配集合;排名必须在区组内进行,以保留重复测量结构。R 文档把 Friedman 检验限定为无重复的完整区组资料,缺失会使整区组被移除。11 不完整随访、重复次数不同或需要时间趋势时,混合模型通常能利用更多有效信息。
置换检验¶
置换检验从研究设计允许的标签重排中构造零分布。以两组随机分派实验为例,先选择能表达目标效应的统计量 \(T\),计算观察值 \(T_{\mathrm{obs}}\);再在保持组样本量不变的所有处理标签重排下重新计算 \(T\)。若 \(H_0\) 下标签可交换,观察统计量在这组重排中的位置就给出精确随机化 p 值。
“可交换”是关键假定。独立两组只能在符合随机分派或同分布零假设的单位间换标签;配对设计应在每对内交换标签或翻转差值符号;区组设计只能在区组内重排;时间序列、空间数据和家系资料需要保持依赖结构的受限置换。方法研究把交换性明确列为置换检验精确性的核心条件。12
当全部排列数过大时,可随机抽取 \(B\) 次置换。若其中有 \(b\) 次统计量至少与观察值同样极端,一个有效的 Monte Carlo 估计是
加 1 把观察排列计入参照集,使有限模拟得到的 p 值保持为正。增加 \(B\) 降低 Monte Carlo 误差;交换单位、统计量选择和多重检验则需要分别按照研究设计处理。高通量研究还需在每次置换中保持完整分析流程,并按假设检验、效应量与多重比较控制检验家族。
置换方法可以围绕均值差、中位数差、相关系数或模型统计量构造,因此非参数方法同样可以对应明确的效应参数。统计量应在看结果之前按科学问题选定;同时报告观察效应和区间,才能把随机化证据转回生物学尺度。
方法选择与结果报告¶
方法选择先由问题和设计决定,再考虑近似质量。一个二分类比例对应二项模型;两个独立比例对应得分/列联表方法;同一对象的两次二分类结果对应 McNemar;多类别计数与理论比例比较使用拟合优度;两个分类变量的独立观察使用列联表关联;有序或连续结果若目标是位置或随机优势,可选择符号与秩方法;随机分派结构允许与设计一致的置换检验。
正态性检验结果受样本量影响:大样本容易检出轻微形状偏离,小样本又可能遗漏严重偏离。参数模型或秩方法的选择还需结合研究目标、原始图形、独立性、尾部和方差结构,并在必要时做稳健性或敏感性分析。
分类资料至少报告各格观察数与分母、比例及区间、效应尺度和方向、检验统计量与自由度、精确/渐近/Monte Carlo 方法、连续性校正、条件边际以及多重性处理。秩方法还应报告原始尺度描述、配对或分组结构、并列与零差处理、位置或随机优势效应及区间。这些信息与 p 值一起呈现绝对风险、分布形状、近似条件和生物学意义。
参考资料与延伸阅读¶
-
R Core Team. Exact Binomial Test。 ↩
-
Penn State Eberly College of Science, STAT 504. Two-Way Tables: Independence and Association。 ↩
-
NIST/SEMATECH. Chi-Square Goodness-of-Fit Test。 ↩
-
Mendel, G. (1866). Experiments in Plant Hybridization,英文译本中记录 929 株种皮/花色分离资料。 ↩
-
R Core Team. Fisher's Exact Test for Count Data。 ↩↩
-
R Core Team. Pearson's Chi-squared Test for Count Data。 ↩
-
NIST/SEMATECH. Comparing Results Classified by Several Categories。 ↩
-
R Core Team. McNemar's Chi-squared Test for Count Data。 ↩
-
R Core Team. Wilcoxon Rank Sum and Signed Rank Tests。 ↩
-
Hart, A. (2001). Mann–Whitney test is not just a test of medians: differences in spread can be important. BMJ, 323, 391–393。 ↩
-
R Core Team. Friedman Rank Sum Test。 ↩
-
Winkler, A. M. et al. (2014). Permutation inference for the general linear model. NeuroImage, 92, 381–397。 ↩
页面讨论
使用 GitHub 登录后可参与整页讨论;评论独立保存在 GitHub Discussions 中。