广义线性模型与混合效应模型¶
生物数据常以存活与否、发病与否、繁殖体数、单位时间内的事件数等形式出现,也常来自同一个体的连续测量、同一窝的多个后代或同一地点的多个样方。前一类数据的响应分布通常偏离正态,后一类数据则具有由共同来源造成的相关性。普通线性模型若仍把它们当作方差恒定且彼此独立的正态响应,系数、标准误和预测范围都可能失去原有含义。
广义线性模型(generalized linear model,GLM)把“均值怎样随预测变量变化”与“响应围绕均值怎样波动”分开描述;混合效应模型把个体、样地、批次等层级所产生的共同变异写进模型;广义估计方程(generalized estimating equation,GEE)则直接估计相关数据的总体平均关系。它们都延续了线性模型的设计矩阵、主效应与交互作用语言,并分别对应不同的待估量、效应尺度和不确定性来源。
响应分布、线性预测量与链接函数¶
广义线性模型的三个组成部分¶
普通线性模型写成
所以条件均值 \(\mu_i=E(Y_i\mid\mathbf x_i)\) 直接等于线性预测量 \(\eta_i=\mathbf x_i^{\mathsf T}\boldsymbol\beta\)。这种恒等关系适合取值无界、方差近似恒定的连续响应;概率和计数具有受限的取值范围,需要相应的均值映射和方差结构。
GLM 保留线性预测量,但通过链接函数把它与条件均值连接起来:
模型由三个部分共同定义:响应的条件分布,决定观测可取的范围及均值—方差关系;线性预测量,容纳连续变量、因素、交互和对比编码;链接函数 \(g\),把响应均值的允许范围映射到整条实数轴。R 的正式 family 文档把常用分布、链接函数和方差函数按这一结构组织,glm 文档则说明参数通常以迭代加权最小二乘求得。1
指数族分布可统一写成
其中 \(\theta_i\) 是自然参数,\(\phi\) 是离散参数。它导出
因而不同分布允许方差随均值以不同方式变化。这个均值—方差关系是模型假设的组成部分。
| 响应对象 | 常用条件分布 | 常用链接 | 均值—方差结构 | 系数指数化后的常见解释 |
|---|---|---|---|---|
| 近似对称的连续量 | 正态(Gaussian) | 恒等 \(\mu=\eta\) | \(\operatorname{Var}(Y)=\sigma^2\) | 系数通常直接解释为均值差或斜率 |
| 0/1 结局或成功数/试验数 | 二项(binomial) | logit \(\log[p/(1-p)]=\eta\) | \(mp(1-p)\) | 优势比(odds ratio,OR) |
| 计数或给定暴露量的事件数 | 泊松(Poisson) | log \(\log\mu=\eta\) | \(\mu\) | 计数比或发生率比 |
| 正值、右偏的连续量 | 伽马(Gamma) | log 或 inverse | 常与 \(\mu^2\) 成比例 | log 链接下为均值比 |
同一分布可配不同链接,同一链接也可用于不同分布。典范链接在计算和充分统计量上常有便利,具体选择还应同时满足取值范围、效应解释和均值曲线形状;分布则要与抽样单位、响应编码及条件方差相符。
似然、离差与效应尺度¶
GLM 通常以最大似然估计 \(\boldsymbol\beta\)。离差(deviance)把拟合模型与对每个观测都拟合到极致的饱和模型比较;两个嵌套模型的离差差在适当正则条件下可形成似然比检验。Wald 检验用估计值与标准误之比,得分检验只需在零假设下拟合。三者在大样本中常接近,在稀疏数据、边界参数或高度非线性的链接尺度上却可能明显不同。
GLM 使用与响应分布相配的拟合指标,而非沿用普通线性回归的残差平方和和 \(R^2\)。离差、Pearson 残差、对数似然、赤池信息准则(Akaike information criterion,AIC)、校准和预测损失分别反映不同方面;“伪 \(R^2\)”有多个定义,报告时必须注明公式。准二项和准泊松模型估计额外离散参数,但未指定完整概率似然,因此普通 AIC 只适用于具有可比似然的模型。1
系数首先属于链接尺度。若模型含交互项,\(\beta_1\) 表示另一个变量取参照值时链接尺度上的条件效应;逆链接后的概率差、均值差或发生率差通常随协变量取值而变。解释结果时应同时给出科学上有意义取值处的预测均值及区间,使系数方向与原响应尺度上的效应大小相互对应。
二项逻辑斯蒂回归¶
概率、优势与回归系数¶
二项逻辑斯蒂回归(binomial logistic regression)适用于独立伯努利(Bernoulli)结局 \(Y_i\in\{0,1\}\),也适用于第 \(i\) 个单位中 \(m_i\) 次试验的成功数 \(Y_i\sim\operatorname{Binomial}(m_i,p_i)\)。其均值模型为
逆链接为
它使任何实数线性预测量都映射到 \((0,1)\)。连续预测变量增加一个单位时,其他变量不变条件下的优势乘以 \(e^{\beta_j}\);二分类因素的 \(e^{\beta_j}\) 是两组条件优势比。优势 \(p/(1-p)\) 与概率 \(p\) 处于不同尺度,优势比与风险比在结局常见时可能有很大的数值差异。Penn State 的二项数据课程以成功数/试验数、logit 链接和优势比建立了同一解释路径。2
截距 \(\beta_0\) 是所有连续变量为 0、因素处于参照水平时的对数优势。若 0 不在合理范围,可把连续变量中心化到对照值、基线或样本中点。对非线性连续效应,可预先使用多项式或样条;把任意连续变量切成“高/低”会丢失组内次序、制造阈值并降低精度。
交互、条件效应与预测概率¶
含一个连续变量 \(x\)、一个分组变量 \(z\) 及其交互的模型可写为
当 \(z=0\) 时,\(x\) 的 log-odds 斜率为 \(\beta_1\);当 \(z=1\) 时为 \(\beta_1+\beta_3\)。\(\beta_3\) 因而检验两组在 logit 尺度上的斜率差。逆链接是非线性的,即使 \(\beta_3=0\),两组的概率差也可能随 \(x\) 增大或缩小;反过来,一个 logit 交互也不对应处处相同的概率差交互。主效应和交互作用都必须连同编码、参照值和效应尺度阅读。
结果展示宜给出若干有生物意义的预测概率、绝对概率差和优势比,并注明它们是条件于哪些协变量的。预测概率能把效应放回熟悉的 0—1 尺度,优势比则保留模型的乘法结构。观察性资料中的“调整后优势比”表示条件关联,其干预效应解释取决于研究设计与因果识别条件。
稀疏数据、分离与模型检查¶
若某个预测变量或若干变量的组合能完全区分 0 与 1,似然会随着部分系数趋向无穷而持续增大,这称为完全分离;近乎完全分离会产生极大的估计和标准误。交叉表中的空单元、稀有结局以及样本很小但参数很多时尤其常见。迭代停止后出现的巨大有限系数仍反映分离问题,可考虑合并有科学依据的稀疏类别、减少预先缺乏依据的参数,或使用偏差校正的惩罚似然与有明确先验的贝叶斯(Bayesian)模型,同时报告敏感性分析。
二项模型应检查观测与预测概率的对应、校准曲线或分组校准、异常和高影响单位,以及成功数/试验数是否被正确编码。受试者工作特征曲线下面积(area under the receiver operating characteristic curve,ROC AUC)描述排序能力,校准描述预测概率与观察比例的一致程度,新个体性能则需要独立验证。若数据由家系、医院或重复时间点构成,独立二项模型的标准误通常过小,应转向层级模型或边际相关方法。
计数、发生率与零过程¶
泊松回归与暴露量¶
泊松回归(Poisson regression)以 \(Y_i\sim\operatorname{Poisson}(\mu_i)\) 描述非负整数计数,并常用 log 链接:
于是 \(e^{\beta_j}\) 是预测变量增加一个单位时条件期望计数的倍数。Poisson 分布要求条件方差等于条件均值:
这个等式针对给定预测变量后的条件分布。过度离散的判断应先把已知的组别、暴露量和均值趋势纳入模型,再检查剩余离散;原始计数的样本方差大于样本均值只提供初步线索。
不同单位的观察时间、取样面积或风险个体数不同时,研究问题通常是发生率而非总数。令暴露量 \(t_i>0\),可写为
其中 \(\log t_i\) 是 offset,系数固定为 1。等价地,\(\log(\mu_i/t_i)=\mathbf x_i^{\mathsf T}\boldsymbol\beta\),所以指数化系数解释为发生率比。把暴露量当作一个普通协变量会让模型自由估计其系数,已不再表示单位暴露量上的率。Penn State 的 Poisson 回归说明也以暴露量 offset 区分计数和率。3
过度离散与负二项分布¶
观测间未建模的异质性、同群相关、遗漏的非线性或过多零值,都可能使条件方差超过 Poisson 或 binomial 模型规定的方差。过度离散若被忽略,常使标准误偏小、区间过窄。Penn State 的课程资料强调,它是相对于已拟合均值—方差关系的额外变异,而非一个只看原始均值和方差就能诊断的标签。4
准 Poisson 保留均值模型 \(\log\mu_i=\eta_i\),把方差写为 \(\phi\mu_i\),通过估计 \(\phi\) 调整标准误;它没有指定完整的计数分布。负二项模型则引入个体间潜在发生率异质性,一种常用参数化为
两者都能容纳过度离散,却隐含不同的方差增长方式和推断基础。若额外变异来自样地、个体或批次的可识别层级,随机效应模型常比只增加一个离散参数更接近数据生成过程;若来自时间自相关,还需直接描述相关结构。
低于名义方差的欠离散也可能出现,例如资源竞争限制了单位内事件数。它同样需要检查响应定义、依赖关系和均值模型,并选择能表达相应方差结构的方法。
零膨胀与门槛模型¶
某些调查包含两个过程:一部分单位因栖息地完全不适合而处于结构性零状态,其余单位进入可产生计数的过程。零膨胀模型把结构性零的概率与普通计数分布混合;即使进入计数过程,泊松或负二项分布仍可产生抽样零。门槛模型(hurdle model)则先建模“是否跨过零”这一门槛,再用零截断计数分布描述所有正计数。
两类模型的参数回答不同问题。以物种记录为例,零膨胀部分可描述地点是否处于不可占据状态,计数部分描述可占据地点的期望记录数;hurdle 模型则把至少记录一次与记录后的丰度分开。glmmTMB 的方法论文给出了这两类过程与 GLMM 的统一实现,并明确零膨胀是在计数分布之外增加一项零概率质量。5
大量零值可能来自低均值泊松过程、负二项异质性、检测失败、未建模层级或额外的结构性零过程。模型选择应先说明零的生成机制,再比较预测分布、残差和外部验证,据此判断是否需要零膨胀部分。
逻辑斯蒂生长曲线与逻辑斯蒂回归¶
连续生长轨迹及其参数¶
经典逻辑斯蒂(Logistic)生长曲线描述连续响应随时间或大小变量逐渐接近上限的轨迹:
其中 \(K\) 是渐近上限或承载尺度,\(b\) 决定接近上限的速率,\(\alpha\) 与初始位置有关;当 \(x=0\) 时,\(\widehat y(0)=K/(1+\alpha)\)。曲线拐点位于 \(\widehat y=K/2\),此时增长率最大。它可由微分方程
导出,因而有明确的密度制约或有限上限解释;具体研究还需用机制知识和数据判断 S 形轨迹是否来自承载量限制。
这条曲线具有一条经典直线化路径。由曲线方程可得
再取对数:
若 \(K\) 已知,\(\widehat y'\) 对 \(x\) 成直线,截距为 \(\ln\alpha\),斜率为 \(-b\)。这一推导是理解参数结构的重要路径。实际观测中用 \(y\) 代替 \(\widehat y\) 进行变换,会使接近 0 或 \(K\) 的误差被显著放大,并改变原尺度上的误差分布;现代分析通常直接在原响应尺度拟合非线性均值函数,同时明确残差方差和重复测量结构。
从三个点估计 \(K\) 的经典公式为:
它来自三个等间隔 \(x\) 点精确落在同一 Logistic 曲线上的代数关系,可作为经典手算和初值构造方法。若观测含噪声、间隔不等,或分母 \(y_2^2-y_1y_3\) 接近零,估计会非常不稳定;此时应使用全部观测联合估计 \(K,\alpha,b\),并以区间、残差和预测轨迹评估不确定性。
两类逻辑斯蒂模型的区别¶
| 比较维度 | Logistic 生长曲线 | 二项 logistic 回归 |
|---|---|---|
| 典型响应 | 生物量、种群量、体长等连续量 | 0/1 结局或成功数/试验数 |
| 均值形式 | \(K/(1+\alpha e^{-bx})\) | \(p=1/[1+e^{-\eta}]\) |
| 线性化对象 | \(\log[(K-y)/y]\) 与时间 \(x\) | 概率的 log-odds 与预测变量 |
| 主要参数 | 上限 \(K\)、速率 \(b\)、位置 \(\alpha\) | 条件 log-odds 系数 \(\boldsymbol\beta\) |
| 随机部分 | 需另行指定连续残差或过程误差 | binomial 方差由试验数和 \(p\) 规定 |
两者的逆函数都呈 S 形,代数形式也相近,但响应、抽样分布和参数含义完全不同。逻辑斯蒂生长曲线拟合带上限的连续轨迹,二项逻辑斯蒂回归则拟合二项概率,只有前者含生态承载量 \(K\)。
固定效应、随机效应与层级¶
因素、水平、主效应与交互作用¶
因素是模型中用于区分处理、环境或分组条件的变量,水平是因素的具体取值;处理通常指一个或多个实验因素水平的组合;重复则是同一处理下独立实验单位的再次实现。培养皿内测量十个细胞可以提高对该皿均值的测量精度,独立重复数则由接受独立处理分派或独立抽样的培养皿数量决定。
在含因素 \(A\) 与 \(B\) 的模型中,主效应概括一个因素在规定的另一因素水平或加权平均下的比较;交互作用表示一个因素的效应随另一因素水平改变。它们都是相对于模型参数化和比较尺度定义的。交互存在时,单独的主效应通常表示参照水平或某种平均效应。在 logit 或 log 链接下,交互首先属于对数优势或对数均值尺度,逆链接后的绝对差异会随基线改变。
固定与随机的区分¶
固定效应以一组待估参数 \(\boldsymbol\beta\) 表示,推断直接针对列入模型的处理差、斜率或对比。例如研究三种预先指定药物相对于对照的均值差,药物通常作为固定效应;研究温度每升高一度的平均响应,连续温度斜率也是固定效应。固定效应由待估的具体比较定义,年龄、海拔或自然发生的疾病状态即使缺少人为操控性,仍可作为固定预测变量。
随机效应把一组水平的偏离 \(\mathbf b\) 看作来自一个分布,通常写为
推断重点是总体平均效应、水平间方差与协方差,以及对已观察水平的收缩估计。例如从许多可能样地中抽到的样地、每个受试者自己的基线偏离或不同实验批次的偏差,常适合随机效应。“随机”在这里指用共同分布表达层级间变异并向更广的单位总体推广。
同一个变量在不同问题中可扮演不同角色。若三座特定保护区本身就是全部比较对象,可把保护区作为固定效应并报告每座差异;若它们代表目标区域中抽到的一组地点,研究重点是地点间变异和跨地点平均效应,则随机效应更合适。预先选定水平常提示固定效应,随机抽取水平常支持随机效应,但最终选择仍由待估量、抽样设计和推广范围决定。
混合模型同时包含固定效应与随机效应。例如在多个随机抽取样地内设置两个固定处理,模型用固定效应估计处理平均差,用样地随机截距估计样地间变异;若处理效应也随样地变化,还可加入随机斜率。简单随机抽样和分层抽样描述的是抽样设计,与模型中的固定/随机效应属于不同层面。
线性混合效应模型¶
随机截距、方差成分与组内相关¶
线性混合效应模型(linear mixed-effects model,LMM)写为
并通常假定 \(\mathbf b\) 与 \(\boldsymbol\varepsilon\) 独立。\(\mathbf X\boldsymbol\beta\) 是所有单位共享的均值结构,\(\mathbf Z\mathbf b\) 让不同个体、样地或批次拥有系统偏离,\(\mathbf R\) 描述给定随机效应后的剩余方差与相关。
最简单的随机截距模型为
其中第 \(j\) 个群组共享 \(b_{0j}\sim N(0,\sigma_b^2)\)。同组两个观测都含同一个 \(b_{0j}\),所以自然相关。在只有随机截距和独立同方差残差时,组内相关系数为
ICC 表示总条件方差中由群组间差异贡献的比例,也等于同组两个观测的相关。即使 ICC 不大,每组观测很多时,忽略聚类仍可能大幅夸大有效样本量。
方差成分必须结合尺度和设计解释。样地方差大可能反映真实环境异质性,也可能吸收未测量的土壤梯度、批次差异或测量漂移;残差方差则包含同一层级中尚未解释的个体差异和测量误差。把所有未解释变异笼统称作“实验误差”,会掩盖各层级可被设计控制或科学解释的来源。
随机斜率、收缩与预测¶
若处理或时间效应因群组而异,可加入随机斜率:
其中 \((b_{0j},b_{1j})\) 可具有方差和协方差。\(\beta_1\) 是群组总体的平均斜率,\(b_{1j}\) 是第 \(j\) 组相对于平均斜率的偏离。随机截距—斜率协方差描述基线较高的群组是否倾向于变化更快;把时间中心化到共同且有意义的基线,往往能让截距及其协方差更易解释。
随机效应的条件估计常称最佳线性无偏预测(best linear unbiased prediction,BLUP);在更一般模型中也常称条件模式。数据少或噪声大的群组会更强地向总体平均收缩,数据丰富的群组则更多由本组观测决定。收缩减少了对小群组极端均值的过度追随;这些条件预测共享总体参数和方差估计,其排序和区间应连同模型不确定性解释。
随机斜率还保护与群组内重复的处理变量相对应的推断。如果不同个体都经历多个时间点,仅放随机截距会假定所有个体有完全相同的时间斜率;真实斜率异质性被遗漏后,平均时间效应的标准误可能失真。随机结构应由实验单位、重复层级与允许变化的科学过程决定,逐项检验只作为结构判断的辅助证据。
嵌套、交叉与伪重复¶
幼体嵌套于母体、样方嵌套于样地、样地嵌套于区域,构成嵌套层级;每个观察员都评定多个样本且每个样本由多个观察员评定,则观察员与样本是交叉效应。符号中的“嵌套”应对应单位真实归属,编号在不同组内重复只是数据编码问题。交叉设计若只建其中一个随机来源,另一个来源的共享变异仍会进入残差。
伪重复发生在处理复制的层级与统计分析声称的独立重复层级不一致。例如只给一个水箱施药、另一个水箱作对照,再测每箱许多鱼,处理实际上只有每组一个水箱;鱼的数量只提供箱内信息,处理间水箱变异缺少估计依据。把水箱设为随机效应能表达同箱相关,但模型无法创造缺失的处理重复,也无法解除处理与单一群组的完全混杂。
重复测量还可能具有随时间间隔衰减的残差相关、异方差或随机过程。随机截距只产生同组任意两次测量相关程度相同的复合对称结构;时间序列较密或间隔不规则时,可能需要随机斜率、AR 型残差、平滑个体轨迹或其他纵向模型。模型结构应与取样时间和生物过程匹配。
ML、REML 与可识别性¶
LMM 可用最大似然(ML)或限制最大似然(REML)估计。ML 联合估计固定效应与方差参数;REML 在消除固定效应估计所占自由度后估计方差成分,有限样本中通常较少向下偏。比较固定效应结构不同的嵌套模型时,应在相同观测上用 ML 拟合,因为不同固定效应空间的 REML 准似然不在同一基准上;选定固定结构后可用 REML 报告方差成分和系数。lme4 方法论文系统给出了混合模型的设计矩阵、ML/REML 与剖面离差计算。6
随机效应水平过少、每组信息不足或随机结构相对数据过于复杂时,方差和相关估计可能很不稳定。边界估计如随机斜率方差接近 0,或相关系数接近 \(\pm1\),常表现为奇异拟合。它可能意味着数据不足以区分拟定方差成分,也可能确实支持简化结构;需要结合设计、区间、剖面似然和敏感性分析判断。收敛警告、梯度异常和 Hessian 非正定需要在结果解释前查明来源并报告处理方式。
广义线性混合效应模型¶
条件均值与随机效应积分¶
广义线性混合效应模型(generalized linear mixed model,GLMM)把非正态响应和随机效应结合起来:
二项随机截距 GLMM 可描述同一动物多次患病记录,Poisson 或负二项 GLMM 可描述多个样方嵌套于样地的物种计数。给定随机效应后,响应按相应指数族分布;对随机效应分布积分后,得到观测数据的边际似然。Bolker 等面向生态与进化数据的综述强调,GLMM 的价值正是在同一模型中处理非正态响应与随机效应,而拟合和推断也因此比普通 GLM 更复杂。7
在 log 链接模型中,条件均值的乘法效应和边际均值的关系相对规整;在 logit 链接下,固定效应 \(\beta_j\) 是给定同一随机效应水平后的群组特异 log-odds 效应。把随机效应积分掉以后,总体平均概率关系通常具有另一组参数,因此“调整了随机效应的优势比”和“总体中平均的优势比”对应不同待估量。
随机效应的方差也属于科学结果。二项模型的潜在尺度组内相关系数(intraclass correlation coefficient,ICC)常借助逻辑斯蒂残差方差 \(\pi^2/3\) 表达,但它依赖潜变量表示;观测概率尺度上的相关还随基线概率改变。泊松 GLMM 中随机截距同时改变均值和方差,需要使用与计数模型相配的 ICC 定义。报告时应说明 ICC 或方差比例位于哪一尺度,以及是否包含观测层额外离散。
计算、边界与预测¶
GLMM 的边际似然含随机效应积分,通常依靠拉普拉斯(Laplace)近似、自适应高斯(Gaussian)求积或蒙特卡洛(Monte Carlo)方法。近似精度受每群观测数、随机效应维数和响应稀疏程度影响。二项数据中每群事件极少、随机斜率很多或方差很大时,优化更容易出现分离、边界与收敛问题;改变优化器有助于辨别数值故障,设计可识别性仍由数据结构决定。
GLMM 可产生两类预测。条件预测使用某个已观察群组的随机效应,适合预测同一动物的下一次记录;边际或总体级预测对随机效应分布平均,适合预测来自目标总体的新群组。新样地缺少历史数据时,应使用总体级预测而非旧样地的 BLUP。模型验证也应按应用目标划分数据:预测新个体应以个体为折叠单位,预测新地点应整地点留出。
边际相关与广义估计方程¶
总体平均模型与工作相关¶
GEE 针对重复或聚类响应指定边际均值
再以独立、交换型、一阶自回归[first-order autoregressive,AR(1)]或非结构化等工作相关矩阵近似同组观测的相关。估计方程把各组的均值导数、方差和工作相关结合起来;在均值模型正确且独立群组数足够时,即使工作相关只是近似,经验三明治(sandwich)协方差仍可给出渐近稳健的标准误。Liang 与 Zeger 的原始论文由此建立了离散和连续纵向响应的边际回归框架。8
三明治协方差的稳健性依赖独立群组数趋于充分,群组很少时会有明显小样本偏差;错把同一群组拆成多个独立簇也会破坏标准误。工作相关选得更接近真实结构通常能提高效率,但其参数主要服务于估计,生成机制解释需要完整概率模型或额外证据支持。
GEE 只指定边际均值、方差和工作相关,未指定完整联合似然,因此模型比较使用准似然或其他适用准则,而普通似然比检验、AIC 和基于完整似然的随机效应预测用于相应的完整似然模型。Penn State 的纵向数据课程也把 GEE 概括为边际均值加工作相关,并说明其模型比较有别于普通似然比路径。9
GLMM 与 GEE 的待估量¶
| 研究目标 | GLMM | GEE |
|---|---|---|
| 回归效应 | 给定群组随机效应后的条件效应 | 对群组分布平均的边际效应 |
| 群组异质性 | 估计方差成分并可预测已观察群组偏离 | 用工作相关和稳健协方差处理相关 |
| 完整概率模型 | 指定条件分布与随机效应分布,可形成边际似然 | 通常只指定边际均值、方差与工作相关 |
| 典型用途 | 层级机制、个体轨迹、群组预测、方差分解 | 人群平均政策或处理效应、相关数据的稳健均值推断 |
| 主要数据要求 | 每层信息足以估计所设随机结构 | 独立群组数足以支持 sandwich 渐近性 |
若问题是“同一只动物的基础风险相同条件下,处理怎样改变其发病优势”,二项 GLMM 的条件效应较自然;若问题是“在目标动物总体中,处理平均改变多少发病概率或优势”,GEE 的边际效应更直接。模型选择应由这类待估量差异决定,p 值大小只反映给定模型下的证据强度。
模型诊断、选择与完整报告¶
从数据生成过程开始选择¶
模型选择的第一步是写清响应单位和抽样层级。0/1 记录与组内成功数虽然都可用二项模型,试验数和独立单位却不同;总计数与单位时间发生率需要正确的暴露量;同一个体的重复记录、同一样地的样方和交叉批次需要保留群组标识。先看均值、方差、零值和群组大小随关键预测变量的分布,再决定分布族、链接、随机结构或工作相关。
固定效应结构应对应预先提出的生物学比较。主效应、交互、非线性项和协变量由问题与设计共同决定;层级原则通常要求纳入交互所涉及的低阶项,采用其他参数化时需说明其含义。随机结构应反映重复和可变效应的层级,offset 必须来自已知暴露量。零膨胀、负二项和观测层随机效应分别表达额外零过程、均值—方差关系和层级变异,应按生成机制选择。
AIC 可在同一响应数据、同一似然定义和可比估计方法下比较候选似然模型;准似然模型、不同删失规则或不同观测集合需要各自适用的比较方法。似然比检验遇到方差成分为 0 的边界时,其常规 \(\chi^2\) 参照也可能失效。模型选择应先考虑机制、可识别性、预测验证和估计不确定性;多个近似合理模型可通过敏感性分析呈现结论稳定性。
分层诊断¶
GLM 可检查响应残差、Pearson 残差与离差残差随拟合值和预测变量的结构,检查杠杆、影响、离散、校准及观测与预测分布。二项数据需留意分离和群组试验数,计数数据需比较方差与零值的条件分布。复杂离散模型中,基于拟合模型模拟复制数据,再把观测统计量与模拟分布比较,往往比把离散残差强行解释成正态残差更清楚。
混合模型还要检查群组层级。随机效应的正态性假设涉及群组偏离的分布,原始响应的分布则由模型其余部分规定;群组数很少时,正态性图本身也缺乏辨别力。应检查随机效应方差的边界、随机截距—斜率相关、每组残差结构、群组大小是否信息性,以及条件预测是否被少数群组主导。纵向数据还要检查时间相关和随时间变化的方差。
预测验证必须尊重层级。在随机拆分单行记录时,同一个体可能同时进入训练集和测试集,此时衡量的是“已见个体的新记录”性能;目标若是新个体或新地点,应整组留出。所有标准化、变量筛选和超参数选择都应在训练折内部完成,以隔离测试信息。条件预测和边际预测应分别验证,因为它们服务于不同使用场景。
报告清单¶
一份可复核的 GLM、LMM、GLMM 或 GEE 报告至少应让读者恢复以下信息:
- 响应的原始编码、每行代表的单位、二项试验数或计数暴露量,以及缺失和排除规则;
- 分布族、链接函数、固定效应公式、对比编码、交互和连续变量的中心化或变换;
- 群组变量、嵌套或交叉关系、各层级单位数与组大小范围、随机截距/斜率或 GEE 工作相关;
- ML、REML、Laplace、求积或 GEE 等估计方法,软件与关键版本,以及收敛、奇异拟合和边界检查;
- 固定效应估计、置信区间与明确尺度,方差成分和相关参数,以及有意义协变量取值处的条件/边际预测;
- 过度离散、零过程、校准、残差、影响点和层级验证结果,及对分布、随机结构或相关结构改变的敏感性。
系数表只是这些信息的一部分。把响应生成过程、层级设计、效应尺度和预测对象同时写清,才能判断一个显著优势比、发生率比或方差成分究竟代表哪一层面的生物学差异。
参考资料与延伸阅读¶
-
R Core Team.
family: Family Objects for Models;glm: Fitting Generalized Linear Models。 ↩↩ -
Penn State Department of Statistics. STAT 504, Lesson 6: Binary Logistic Regression。 ↩
-
Penn State Department of Statistics. STAT 504, Lesson 9: Poisson Regression。 ↩
-
Penn State Department of Statistics. STAT 504, Lesson 7: Further Topics on Logistic Regression。 ↩
-
Brooks, M. E. et al. (2017). glmmTMB Balances Speed and Flexibility Among Packages for Zero-inflated Generalized Linear Mixed Modeling. The R Journal, 9(2), 378–400. DOI: 10.32614/RJ-2017-066。 ↩
-
Bates, D., Mächler, M., Bolker, B. & Walker, S. (2015). Fitting Linear Mixed-Effects Models Using lme4. Journal of Statistical Software, 67(1), 1–48. DOI: 10.18637/jss.v067.i01。 ↩
-
Bolker, B. M. et al. (2009). Generalized linear mixed models: a practical guide for ecology and evolution. Trends in Ecology & Evolution, 24(3), 127–135. DOI: 10.1016/j.tree.2008.10.008。 ↩
-
Liang, K.-Y. & Zeger, S. L. (1986). Longitudinal data analysis using generalized linear models. Biometrika, 73(1), 13–22。 ↩
-
Penn State Department of Statistics. STAT 504, Lesson 12: Generalized Estimating Equations。 ↩
页面讨论
使用 GitHub 登录后可参与整页讨论;评论独立保存在 GitHub Discussions 中。