相关、回归与模型诊断¶
相关与回归都从成对或成组的观测出发,但回答不同的问题。相关系数用一个无量纲数概括两个变量共同变化的方向和线性或单调程度;回归则指定一个响应变量,建立它在给定预测变量时的条件均值模型,并据此估计效应、解释差异或作出预测。两者都可以用于观察性资料,因果结论还需要研究设计和识别条件支持。
拟合直线之外,研究者还要确认观测单位是否独立、变量范围是否覆盖目标问题、均值结构和方差结构是否合适,以及少数观测是否主导了结果。模型诊断贯穿拟合与解释,是理解斜率、区间和预测误差的必要步骤。
变量关系与统计问题¶
成对观测与散点结构¶
相关和简单回归所用的基本数据单位是同一个对象上的一对数值 \((x_i,y_i)\)。若叶片氮含量与光合速率来自同一片叶,它们构成一对;若把一批叶片的氮含量任意配到另一批叶片的光合速率,边际分布仍在,成对关系却已被破坏。重复测量、同巢个体和同一培养皿内的细胞还共享上层单位,需要在成对数值之外表达相应层级结构。
散点图应先于相关系数和回归表。图中至少要辨认取值范围、方向、曲率、分组、离群点、重复值和方差随均值的变化。同一个总体相关可能由各组内部一致的趋势形成,也可能完全由组间差异驱动;把物种、批次或发育阶段用颜色或分面显示,常会改变对关系来源的理解。生物数据整理与描述统计已经建立了先看原始分布的原则,这里把它延伸到二维和多维结构。
横纵轴的选择也应对应问题。描述两个对称变量的线性关联时,交换 \(X\) 与 \(Y\) 不改变皮尔逊相关(Pearson correlation);预测或条件效应分析则必须明确响应 \(Y\) 和预测变量 \(X\),交换二者会得到另一个回归问题。这里的“预测变量”表示模型角色,可以是随机抽到的自然变量;可操控性和测量误差需要另行说明。
关联、预测与因果¶
相关描述联合变化,回归描述条件分布或条件均值,因果推断还需要处理分派、时间顺序、混杂、选择和测量过程等设计依据。随机试验中,处理系数可在设计支持下具有因果解释;观察性回归中的系数通常表示给定模型和调整变量后的条件关联。
“控制其他变量不变”在多元回归中是一个模型对比:比较其他预测变量取值相同的两个观测所对应的拟合均值。在模型形式、数据支持范围与因果识别条件都成立时,这一对比才可进一步解释为干预效应。共同原因可以产生很强的相关,选择样本也可以制造或反转相关;反馈、测量误差或效应异质又可能使真实因果效应缺少简单的边际线性相关。
回归也可以服务于预测。预测模型关心新样本误差、校准和适用人群,可以采用稳定可测、但不作因果解释的变量。解释、预测和因果是三个相关但不等价的目标,变量选择、验证方式和结果措辞都应先由目标决定。
Pearson 相关及其推断¶
协方差的标准化¶
总体 Pearson 相关系数为
样本相关系数为
\(r\) 介于 \(-1\) 与 \(1\) 之间。符号给出线性共同变化的方向,绝对值衡量观测点接近某条非水平直线的程度;平移或正比例改变任一变量的单位不会改变其绝对值。\(r=1\) 或 \(-1\) 表示样本点精确落在斜率分别为正或负的直线上。
\(r=0\) 表示样本线性协变为零,两个变量仍可能存在其他形式的关系。对称的 U 形关系可以具有 \(r=0\),若只观察完整曲线的一小段又可能得到很大的正或负相关。独立变量在二阶矩存在时具有零总体相关;由零相关推断独立则需要更强的分布条件。Pearson 相关还会受取值范围、混合亚群和离群点显著影响,因此不同研究中的相关系数只有在测量精度、人群和变量范围可比时才适合直接比较。Penn State 的回归教材也以零相关但完全弯曲的例子说明这一边界。1
检验与区间¶
对独立、来自二元正态总体的完整观测,检验 \(H_0:\rho=0\) 可使用
也可以先定义 \(s_r=\sqrt{(1-r^2)/(n-2)}\),再写 \(t=r/s_r\),代入后得到同一统计量。这里的 \(s_r\) 是零相关检验的代数表示;任意 \(\rho\) 下的区间通常通过 Fisher 变换构造。
Pearson 相关的常用区间先作 Fisher 变换
在 \(z\) 尺度构造区间后再以 \(\tanh\) 变回相关尺度。R 的正式文档也以 Fisher 变换提供 Pearson 相关的渐近区间,并明确零相关的精确 t 参照依赖独立正态样本。2 非正态、离群、聚类或变量经结果驱动筛选时,可使用与抽样层级一致的自助法(bootstrap)、置换或稳健相关方法;重抽样和重排单位需要保留配对、个体或空间结构。
显著性同时受效应大小和样本量影响。很小的相关在大样本中可能有很小的 p 值,而大相关在取值范围狭窄的小样本中可能区间很宽。结果应报告 \(r\)、区间、完整配对数、散点结构和预设检验方向,使“相关显著”具有可解释的效应尺度。
秩相关与条件相关¶
Spearman 与 Kendall¶
斯皮尔曼秩相关(Spearman rank correlation)系数 \(\rho_s\) 是秩次上的 Pearson 相关,概括两个变量之间的单调关系。严格递增但明显弯曲的关系可有 \(\rho_s\) 接近 \(1\),即使 Pearson \(r\) 较小;严格递减关系则接近 \(-1\)。它减少了极端数值距离的影响,极端秩、混合亚群和依赖观测仍会影响结果。
无并列秩时,肯德尔秩相关(Kendall rank correlation)系数 \(\tau\) 可写为
其中 \(C\) 与 \(D\) 分别是所有观测对中的一致对和不一致对。它可解释为随机抽取一对观测时,一致次序概率与不一致次序概率之差;存在并列值时需使用相应的并列校正版本。R 的相关检验文档把 Pearson、Kendall 与 Spearman 明确列为三个不同的关联量,并按样本量与并列情况选择精确或渐近参照。2
秩相关把估计目标从线性关联改为单调关联,并依赖与抽样结构相匹配的独立性条件。科学问题若关心原单位上的斜率、均值变化或预测误差,仍需要回归模型。时间趋势、空间梯度和共同组别也能产生很大的秩相关,因此因果解释仍取决于研究设计。
偏相关与条件关联¶
偏相关(partial correlation)考察在一组变量 \(Z\) 的线性部分被移除后,\(X\) 与 \(Y\) 剩余部分的线性相关。计算上可分别把 \(X\) 和 \(Y\) 对 \(Z\) 回归,再求两组残差的相关。只有一个控制变量时,
“其余变量保持不变”在这里具体指线性调整后的关联。若 \(Z\) 与结果的关系非线性、存在交互或测量误差,简单偏相关可能调整不足;若 \(Z\) 是共同原因、碰撞变量或处理后的中介,调整还会改变因果问题。NIST 对部分回归图的说明也表明,两组调整残差的相关对应部分相关,并区分了它与部分残差图的用途。6
简单线性回归¶
条件均值模型¶
简单线性回归写为
其中
是经典等方差模型的条件。于是 \(E(Y_i\mid x_i)=\beta_0+\beta_1x_i\):\(\beta_0\) 是 \(x=0\) 时的条件均值,\(\beta_1\) 是 \(x\) 每增加一个单位时条件均值的变化。若 \(x=0\) 远离数据范围,截距只是定位直线所需的参数,未必具有生物学解释;把 \(x\) 中心化到有意义的参照值可得到更可读的截距。
误差 \(\varepsilon_i\) 是总体模型中不可观测的随机偏离,残差
是拟合后可计算的样本偏差。残差受到参数估计约束,方差也随杠杆值变化,与直接观测到的一组独立总体误差具有不同性质。正态误差模型写作 \(Y\mid x\sim N(\beta_0+\beta_1x,\sigma^2)\),等价地说误差均值为零。
预测变量可以在重复抽样中随机变化。经典条件回归把已观察到的 \(x_i\) 当作条件,要求主要落在误差结构和均值模型上;若 \(X\) 本身有不可忽略的测量误差,普通最小二乘斜率可能发生衰减等偏差,需要校准模型、重复测量或误差变量方法来描述两个方向的不确定性。
最小二乘估计¶
拟合直线
选择 \(b_0,b_1\) 使残差平方和
达到最小。令
则
因此带截距的最小二乘直线通过 \((\bar x,\bar y)\),残差和为零,残差与截距列和 \(x\) 列正交。这些性质来自最小化和正规方程;数据对正态模型的符合程度需要另由误差分布证据判断。NIST 将线性最小二乘定义为最小化数据与模型之间的平方偏差,并强调“线性”是对未知参数而言;含 \(x^2\) 或 \(\log x\) 的曲线仍可在线性参数模型中拟合。3
平方损失会放大大残差,因而最小二乘对离群观测敏感。标准误、检验和预测区间的有效性还取决于零条件均值、独立性和方差结构。
平方和、斜率检验与 \(R^2\)¶
带截距的简单回归具有
经典记号也把 \(SSR\) 称为回归平方和 \(U\)、把 \(SSE\) 称为离回归平方和 \(Q\)。二者分别表示模型分配的拟合变异与剩余变异,是代数分解而非因果分解。残差标准差为
斜率标准误为
检验 \(H_0:\beta_1=0\) 时,
回归 ANOVA 表的单自由度统计量
满足 \(F=t^2\)。使用同一批完整观测、带截距的简单回归时,斜率检验、Pearson 零相关检验和这个 F 检验给出完全相同的双侧结论。
决定系数为
在带截距的简单回归中 \(R^2=r^2\)。它表示当前样本的 \(Y\) 校正总平方和中,线性拟合相对于仅用 \(\bar y\) 的模型减少了多少比例的平方误差。因果贡献需要研究设计支持,新数据表现则需要样本外验证。增加预测项通常会维持或提高训练集 \(R^2\),所以多元模型还应同时考虑调整 \(R^2\)、区间、预测误差和外部有效性。
均值区间与个体预测¶
在 \(x_0\) 处的拟合均值为 \(\hat y_0=b_0+b_1x_0\)。经典模型下,其置信区间为
对同一 \(x_0\) 处一个新的独立观测,预测区间为
第二式多出的 \(1\) 表示新个体自身围绕条件均值的变异,因此预测区间比均值置信区间宽。二者都在 \(\bar x\) 附近最窄,离数据中心越远越宽。Penn State 的估计与预测章节和 R 的 predict.lm 文档都明确区分给定预测值处的平均响应与单个未来响应。4 5
这些公式描述模型内不确定性;错误函数形式、未建模批次、未来总体漂移或测量流程改变需要另行评估。外推到样本 \(x\) 范围之外时,软件给出的区间依赖样本范围内尚未检验的函数形状;NIST 也把外推性质和离群敏感性列为线性最小二乘的主要边界。3
多元线性回归与条件效应¶
设计矩阵与系数解释¶
有 \(p-1\) 个预测列时,模型写为
其中第二式要求设计矩阵满列秩。它与方差分析的一般线性模型完全相同:连续预测变量、分类因素、区组和协变量只是设计矩阵中的不同列。
系数 \(\beta_j\) 表示其他模型列保持相同时,\(x_j\) 增加一个单位对应的条件均值变化。这个解释取决于模型中包括哪些变量、它们怎样编码,以及是否存在非线性或交互。遗漏与 \(x_j\) 和 \(Y\) 都有关的变量会改变系数;加入中介、碰撞变量或高度相关的替代指标也可能改变问题本身。因此“调整后系数”表示给定模型列下的条件关联;其因果含义取决于变量选择和识别假设。
部分回归图把 \(Y\) 对其余预测变量的残差与 \(x_j\) 对其余预测变量的残差相对作图;其斜率等于完整模型中的 \(b_j\)。它能显示某个预测变量在调整其他线性项后的增量关系,也能暴露少数点对该系数的影响。NIST 的诊断指南给出了这一构造及其与部分相关的联系。6
交互、曲率与层级结构¶
若一个预测变量的效应随另一个变量改变,应加入交互项。例如
则 \(x\) 的斜率为 \(\beta_1+\beta_3z\)。有交互时,单个主效应系数只是在另一变量等于参照值时的条件效应;中心化连续变量或设置有意义的分类参照,可以改善解释而不改变拟合。
曲率可用多项式、分段线性、样条或经过生物学论证的变换表示。二次模型
虽然对 \(x\) 是曲线,对参数仍然线性。保留 \(x^2\) 时通常也保留 \(x\),以维持层级结构;多项式系数本身依赖中心和量纲,导数、转折点与区间往往比逐项 p 值更有生物学意义。
共线性与正则化¶
共线性表示一个预测列接近其他列的线性组合。在经典条件成立时,普通最小二乘仍保持无偏,但系数方差会被放大,使符号和显著性对样本或模型细节敏感。第 \(j\) 个预测变量的方差膨胀因子(variance inflation factor,VIF)为
其中 \(R_j^2\) 来自把 \(x_j\) 对其余预测变量回归。多个列共同产生的高阶共线性可能与较小的两两相关同时出现;NIST 和 Penn State 的诊断资料都强调这种设计矩阵层面的不稳定。6 7
VIF 的判断阈值需要结合样本量、分析目标和设计。若变量代表预先规定的混杂因素或组成项,删掉它可能改变待估量;若目标是预测,相关变量的联合预测可能稳定,即使单个系数不稳定。可通过重新参数化、中心化结构性多项式、改进设计、增加有信息的观测或按科学意义合并指标处理。
预测变量很多或高度相关时,岭回归与 lasso 在平方损失上加入惩罚:
岭回归(ridge regression)连续收缩相关系数,套索回归(least absolute shrinkage and selection operator,lasso)还可能把部分系数压到零;弹性网络(elastic net)混合两类惩罚。它们以引入偏差换取方差下降,适合预测和高维稳定化,但惩罚强度、变量标准化与数据划分必须一并说明。Friedman、Hastie 与 Tibshirani 的算法论文系统描述了 \(L_1\)、\(L_2\) 及其混合惩罚。8 在同一数据上选择变量或 \(\lambda\) 后再套用普通最小二乘 t 区间,会忽略选择不确定性。
曲线直线化与非线性回归¶
经典直线化路径¶
经典生物统计常通过引入 \(x'\)、\(y'\) 或 \(a'\) 把曲线化成 \(y'=a'+bx'\),再沿用直线回归手算。十类常见关系及其代数变换如下;空白表示该量无需另作变换。
| 原曲线 | \(y'\) | \(x'\) | \(a'\) | 直线化结果 |
|---|---|---|---|---|
| \(\hat y=(a+bx)/x\) | \(yx\) | \(\hat y'=a+bx\) | ||
| \(\hat y=1/(a+bx)\) | \(1/y\) | \(\hat y'=a+bx\) | ||
| \(\hat y=x/(a+bx)\) | \(x/y\) | \(\hat y'=a+bx\) | ||
| \(\hat y=ax+bx^2\) | \(y/x\) | \(\hat y'=a+bx\) | ||
| \(\hat y=a+b\ln x\) | \(\ln x\) | \(\hat y=a+bx'\) | ||
| \(\hat y=a+b\lg x\) | \(\lg x\) | \(\hat y=a+bx'\) | ||
| \(\hat y=ax^b\) | \(\ln y\) | \(\ln x\) | \(\ln a\) | \(\hat y'=a'+bx'\) |
| \(\hat y=ae^{bx}\) | \(\ln y\) | \(\ln a\) | \(\hat y'=a'+bx\) | |
| \(\hat y=axe^{bx}\) | \(\ln(y/x)\) | \(\ln a\) | \(\hat y'=a'+bx\) | |
| \(\hat y=1/(ax^b)\) | \(\ln(1/y)\) | \(\ln x\) | \(\ln a\) | \(\hat y'=a'+bx'\) |
使用这些变换时,需要从散点形状和代数形式判断定义域。例如对数幂函数要求相应变量为正,含 \(y/x\) 或 \(\ln(y/x)\) 的变换还要求 \(x\neq0\) 并满足符号条件。零值或负值的处理应依据其生物学含义和观测过程,而非为满足变换形式而删去。
直线化改变了最小化的残差。对 \(\ln y\) 做等权最小二乘,相当于在对数尺度设定加性同方差误差,通常更接近原尺度上的乘性误差;原尺度的平方误差 \(\sum(y-\hat y)^2\) 是另一估计目标。变换后的 \(R^2\) 衡量变换尺度上的平方误差,与原尺度模型的 \(R^2\) 处于不同尺度。把 \(\widehat{\ln Y}\) 直接指数变回去通常估计条件中位数,估计原尺度条件均值还需考虑残差分布和回变换偏差。
原尺度非线性最小二乘与平滑¶
当机制给出参数非线性模型时,可直接拟合
并在与科学问题一致的尺度上最小化残差平方和。NIST 将非线性最小二乘定义为函数对未知参数不线性的模型,同时指出其估计思想仍与最小二乘相同。9 直接拟合可以保留饱和值、增长率或半饱和常数等原尺度参数,也能显式指定异方差;代价是需要起始值、数值优化、可辨识性检查和可能的多极值诊断。
若目标是探索未知曲线形状,局部回归或样条可比枚举许多变换更灵活。平滑程度应由独立验证、预设准则或足够数据决定;过度灵活会把随机波动当作结构。探索性平滑可帮助提出机制模型;在同一数据上反复挑选曲线后,区间推断还需计入模型选择带来的不确定性。
残差、杠杆与影响诊断¶
条件与对应图形¶
经典线性模型的关键条件各自对应不同证据:
| 条件 | 主要来源 | 常用检查 | 违反后的方向 |
|---|---|---|---|
| 条件均值形式合适 | 变量关系与模型项 | 原始散点、残差—拟合值、部分残差图 | 加入有依据的曲率、交互或遗漏变量 |
| 误差方差结构合适 | 测量和生成过程 | 残差—拟合值、尺度—位置图、分组残差 | 变换、加权最小二乘、异方差稳健协方差或显式方差模型 |
| 误差独立或相关已建模 | 抽样、时间、空间与层级设计 | 按采集顺序、个体、地点和批次绘制残差 | 广义最小二乘、聚类稳健方法、时间模型或混合模型 |
| 小样本参照分布合适 | 条件误差分布 | Q–Q 图、尾部和异常观测溯源 | bootstrap、稳健模型或与分布相符的响应模型 |
残差图能发现模型未表达的模式;随机化或独立抽样则需要由研究设计和实施记录支持。正态性主要关系到小样本 t、F 和预测区间的精确参照,针对的是条件误差分布,而非 \(X\) 或所有 \(Y\) 的边际分布。大样本下系数推断可以有一定稳健性,但强异方差、聚类、小有效样本和高杠杆会破坏简单近似。
若方差随预测水平变化,而相对方差函数有测量学依据,加权最小二乘(weighted least squares,WLS)以近似逆方差作权重;NIST 将其描述为针对非恒定误差方差的最小二乘扩展。10 方差函数未知时,异方差稳健标准误可以修正系数协方差;均值函数、异常预测和相关误差仍需分别建模。
异常响应、高杠杆与影响¶
异常响应、杠杆和影响是三个不同概念。异常响应在 \(Y\) 方向偏离模型,表现为大残差;高杠杆观测在预测变量空间远离其余数据;影响则表示删除或轻微改变该观测会明显改变系数、拟合值或结论。高杠杆点可以贴近拟合面而残差很小,也可以因为位置极端而决定斜率。
帽子矩阵为
对角元 \(h_{ii}\) 是杠杆值,若模型有 \(p\) 个参数(含截距),其平均值为 \(p/n\)。残差方差为 \(\sigma^2(1-h_{ii})\),因此比较异常程度时常使用内部或外部学生化残差,而不只看原始残差。
Cook 距离同时结合残差与杠杆:
它概括删去第 \(i\) 个观测后整组拟合值或系数发生的变化。NIST 与 Penn State 的诊断资料都区分异常值、高杠杆和影响,并用帽子矩阵、学生化残差、DFFITS 与 Cook 距离连接这些概念。6 11
经验阈值用于筛查潜在影响点,是否剔除应回到原始记录核对单位、录入、样本身份和实验事件,再比较含/不含该点、稳健拟合和有科学依据的替代模型。真实而罕见的生物状态可能正是研究对象;删除它会缩小适用总体。若结论依赖单个合法观测,应报告这种敏感性并收窄结论。
相关误差、测量误差与模型错配¶
时间序列、空间样点、同一个体重复测量和同一批次样本会使误差相关。普通最小二乘仍可给出系数,但独立误差公式会错误估计标准误、有效自由度和预测区间;应按生成层级使用相关结构、聚类稳健协方差、广义估计方程(generalized estimating equation,GEE)或混合效应模型,并在相同层级做验证划分。
响应为计数、比例、发生/未发生或生存时间时,正态线性模型可能给出超出响应支持范围的预测,并错误描述均值—方差联系。此时应根据响应分布转入广义线性、生存或其他专门模型。稳健标准误只改变推断方差,均值函数和响应支持范围仍由模型结构决定。
预测验证与完整报告¶
从样本内拟合到样本外性能¶
样本内 \(R^2\)、残差标准差和显著性描述的是用于拟合的同一批数据。评价预测时,验证观测应独立于模型拟合、变量筛选、变换选择、标准化和超参数选择;测试信息泄漏会使误差过度乐观。scikit-learn 的交叉验证指南同样强调训练和测试同源评估的过拟合问题,并要求预处理仅在训练折学习。12
\(k\) 折交叉验证在每轮用 \(k-1\) 折训练、留下一折评估,再汇总各折指标。折的单位必须跟独立信息单位一致:同一个体的多次测量应整体留出,空间样地、家系或批次需要分组划分,时间预测则要保持时间顺序。随机拆散相关行会让近乎重复的信息同时进入训练与验证。
模型选择与最终评估应分离。若交叉验证用于选择变量、曲线复杂度或惩罚强度,还需要独立测试集或嵌套交叉验证估计最终泛化误差。报告指标要匹配目标:均方根误差(root mean squared error,RMSE)强调大误差,平均绝对误差(mean absolute error,MAE)给出绝对误差的稳健尺度,预测区间还要检查覆盖率和宽度。训练集拟合和系数推断回答样本内问题,样本外验证则回答泛化表现。
结果报告¶
相关分析至少说明观测单位、完整配对数、缺失处理、变量范围、散点结构、所用 Pearson/Spearman/Kendall 指标、估计值、区间和检验方向。多个变量组成相关矩阵时,应说明比较家族、调整策略和系数选择规则,以呈现完整的分析范围。
回归分析至少报告研究目标、响应与预测变量的单位、模型公式、变换和交互、系数估计及区间、残差标准差、\(R^2\) 与调整 \(R^2\)、均值或预测区间的对象、诊断和敏感性分析。用于预测时还要给出验证划分、预处理位置、评价指标、目标总体与适用范围;用于因果解释时要另行说明设计、时间顺序、混杂控制和识别假设。
可靠的回归结论最终落在原始尺度和研究对象上:斜率代表多大的生物变化,区间是否排除有意义的效应,预测误差是否足以支持用途,异常点是否属于目标总体。公式把关系压缩为系数,诊断与设计则决定这些系数能够代表多远。
参考资料与延伸阅读¶
-
Penn State Eberly College of Science, STAT 501. Simple Linear Regression:相关、\(R^2\) 与非线性关系的解释边界。 ↩
-
R Core Team.
cor.test: Test for Association/Correlation Between Paired Samples:Pearson、Kendall、Spearman 检验及 Fisher 变换区间。 ↩↩ -
NIST/SEMATECH. Linear Least Squares Regression。 ↩↩
-
Penn State Eberly College of Science, STAT 501. SLR Estimation & Prediction:平均响应置信区间与新观测预测区间。 ↩
-
R Core Team.
predict.lm: Predict Method for Linear Model Fits。 ↩ -
NIST/SEMATECH. Regression Diagnostics:部分回归、残差、帽子矩阵、杠杆、影响与共线性。 ↩↩↩↩
-
Penn State Eberly College of Science, STAT 501. Multicollinearity & Other Regression Pitfalls。 ↩
-
Friedman, J., Hastie, T. & Tibshirani, R. (2010). Regularization Paths for Generalized Linear Models via Coordinate Descent. Journal of Statistical Software, 33(1), 1–22。 ↩
-
NIST/SEMATECH. Nonlinear Least Squares Regression。 ↩
-
NIST/SEMATECH. Weighted Least Squares Regression。 ↩
-
Penn State Eberly College of Science, STAT 501. Influential Points。 ↩
-
scikit-learn developers. Cross-validation: evaluating estimator performance:训练/验证分离、预处理泄漏与分组或时间结构划分。 ↩
页面讨论
使用 GitHub 登录后可参与整页讨论;评论独立保存在 GitHub Discussions 中。