概率与概率分布¶
生物研究面对的随机性有多种来源:亲本产生哪一种配子、一个样方中出现多少个体、同一表型在不同个体上取何数值,以及某个事件要等待多久,都可能随重复观察而改变。概率论为这些不确定结果建立数学模型,概率分布则把可能取值及其相对可能性组织起来。它们既是二项检验、回归模型和生存分析的基础,也是理解抽样波动与统计推断的共同语言。
每一种概率分布都包含取值范围、重复机制、独立性、发生率或误差结构等模型条件。计数数据是否适合泊松分布(Poisson distribution)、钟形数据是否适合正态分布,都需要结合这些条件判断。下面从事件关系开始,逐步建立随机变量、期望与方差,再以二项、泊松和正态分布说明怎样从生物过程选择模型。
概率空间与事件¶
随机试验、样本空间与事件¶
在规定条件下可以重复、而单次结果不能事先确定的过程称为随机试验。一次杂合子 Aa 产生配子时,结果可能是 A 或 a;从一个群落样方记录物种组成时,结果则复杂得多。试验所有可能基本结果组成样本空间,通常记为 \(\Omega\)。样本空间中的一个结果记为 \(\omega\),由若干结果构成的集合称为事件。
事件 \(A\) 发生,表示实际结果落入集合 \(A\)。不可能事件是空集 \(\varnothing\),必然事件是整个样本空间 \(\Omega\)。样本空间必须连同试验单位和观察规则定义:抛两枚可区分硬币时,\((正,反)\) 与 \((反,正)\) 是不同结果;若只记录正面总数,则随机变量把这两个结果映射成同一个数值 1。
给有限样本空间中的每个基本结果赋予相同概率时,事件概率可以用“有利结果数除以全部结果数”计算。等可能性需来自对称性、随机化或模型假设;实际生物问题更多依赖频率资料、机制模型或参数估计来赋予概率。
事件关系¶
集合运算准确表达“或”“且”与“非”:
- 并集 \(A\cup B\) 表示至少一个事件发生;
- 交集 \(A\cap B\) 表示两个事件同时发生;
- 补集 \(A^c\) 表示事件 \(A\) 不发生;
- 差集 \(A\setminus B\) 表示 \(A\) 发生而 \(B\) 不发生。
若 \(A\cap B=\varnothing\),两事件互斥,同一次试验中不能同时发生。若 \(A\cup B=\Omega\) 且二者互斥,则互为对立事件。若一组事件 \(A_1,\ldots,A_m\) 两两互斥且并集为 \(\Omega\),它们构成样本空间的一个划分,旧称“完全事件系”。年龄组、互不重叠的基因型类别或互斥的疾病状态,在定义完整时都可以形成划分。
概率公理与加法法则¶
概率 \(P\) 对事件赋予 0 到 1 之间的数,并满足三个基本条件:
以及对两两互斥的可数事件序列 \(A_1,A_2,\ldots\),
由此可得 \(P(A^c)=1-P(A)\)。对任意两个事件,加法法则为
交集部分同时计入了 \(P(A)\) 与 \(P(B)\),所以必须减去一次。只有在 \(A\) 与 \(B\) 互斥时,才有 \(P(A\cup B)=P(A)+P(B)\)。把简式用于可以同时发生的事件,会重复计算共同部分。
条件概率、独立性与贝叶斯公式¶
条件概率与乘法法则¶
得知事件 \(B\) 已发生后,可能结果被限制到 \(B\) 内。若 \(P(B)>0\),事件 \(A\) 在这一新样本空间中的条件概率为
等式重新排列后得到乘法法则:
条件次序具有实际含义。诊断试验的敏感度 \(P(+\mid D)\) 是患病条件下呈阳性的概率,阳性预测值 \(P(D\mid +)\) 则是已呈阳性者患病的概率;二者通常不同。Penn State 的概率课程也以诊断资料说明,条件概率的第一步是把样本空间限制到条件事件。1
多个事件的链式乘法同样保留逐层条件:
独立与互斥¶
若一个事件是否发生不改变另一个事件的概率,则称二者独立。数学上,
当相关概率非零时,这也等价于 \(P(A\mid B)=P(A)\) 和 \(P(B\mid A)=P(B)\)。因此 \(P(A\cap B)=P(A)P(B)\) 是独立事件的乘法简式;一般事件则使用带条件概率的乘法法则。
互斥与独立表达不同关系。两个概率均大于零的互斥事件一旦其中一个发生,另一个便不可能发生,因而不独立。例如一只二倍体个体在单个位点上“基因型为 AA”与“基因型为 Aa”互斥;来自不同、独立减数分裂事件的等位基因传递才可能在模型中独立。
三个以上事件还要区分两两独立与相互独立。两两独立只约束每一对事件,相互独立还要求事件的任意组合满足相应的概率乘积;二项模型等重复试验通常需要整组试验相互独立。
全概率与贝叶斯公式¶
若 \(A_1,\ldots,A_m\) 构成样本空间的划分,且 \(P(A_i)>0\),那么任意事件 \(B\) 可拆成互斥的 \(B\cap A_i\)。全概率公式为
它把各来源的条件概率按来源概率加权,再对各来源求和。
在 \(P(B)>0\) 时,观察到 \(B\) 后属于第 \(k\) 个来源的概率由贝叶斯公式给出:
\(P(A_k)\) 常称先验概率,\(P(A_k\mid B)\) 常称后验概率。这里的“先验”和“后验”首先描述信息更新前后的事件概率;把参数本身设为随机量、构造先验分布和后验分布属于更完整的贝叶斯推断与计算统计。
一个假想筛查例子可以显示基准率的作用。若目标群体患病率为 1%,试验敏感度为 95%、特异度为 90%,则
阳性者真正患病的概率由患病率、敏感度和假阳性率共同决定。这里的数值仅用于演示公式,未对应具体检测项目。
随机变量与概率分布¶
从结果到数值¶
随机变量是把样本空间中的结果映射为数值的函数。抛十次硬币的完整正反序列是试验结果,“正面次数”则是取 \(0,1,\ldots,10\) 的随机变量。随机变量用大写字母 \(X\) 表示,观察到的具体值用小写 \(x\) 表示。
离散随机变量的可能取值有限或可数,其概率质量函数为
连续随机变量用概率密度函数 \(f_X(x)\) 描述:
且
密度曲线下的面积表示概率。对连续变量,单点概率 \(P(X=x)=0\);密度高度描述单位取值尺度上的概率集中程度,窄区间上的密度甚至可以大于 1。美国国家标准与技术研究院(National Institute of Standards and Technology,NIST)的概率分布定义明确区分了离散质量与连续密度。2
两类随机变量都可以用累积分布函数统一表示:
离散分布的 \(F_X\) 呈阶梯状,连续分布在存在密度时满足 \(F_X(x)=\int_{-\infty}^{x}f_X(t)\,dt\)。分位数是累积概率达到指定水平时的取值;离散分布可能跨过目标概率,因此软件通常把分位数定义为使 \(F_X(x)\ge p\) 的最小 \(x\)。
期望与方差¶
期望给出随机变量在概率模型下的加权中心。离散和连续情形分别为
前提是相应和或积分存在。期望不必是随机变量可能实际取得的值,也不必是最常见值。例如公平六面骰的期望为 3.5,却不会掷出 3.5。
方差衡量结果围绕期望的平方离散:
标准差为 \(\sqrt{\operatorname{Var}(X)}\),与 \(X\) 具有相同单位。期望具有线性性质,即使变量不独立也有 \(E(aX+bY)=aE(X)+bE(Y)\);方差相加则要考虑协方差,只有 \(X\) 与 \(Y\) 独立或至少不相关时,才可将 \(\operatorname{Var}(X+Y)\) 简化为两方差之和。
联合、边缘与条件分布¶
同时研究两个随机变量时,联合分布描述 \((X,Y)\) 的共同取值。离散情形的联合质量函数为 \(p_{X,Y}(x,y)=P(X=x,Y=y)\)。对另一个变量求和得到边缘分布:
在 \(p_Y(y)>0\) 时,条件分布为
连续情形把求和换为积分、把质量函数换为密度。若联合分布可以分解为边缘分布乘积,\(p_{X,Y}(x,y)=p_X(x)p_Y(y)\) 或 \(f_{X,Y}(x,y)=f_X(x)f_Y(y)\),随机变量独立。个体内多次测量、亲缘个体和同一批次样本往往具有联合结构,需要在边缘分布之外描述变量间的依赖。
大数定律与长期稳定性¶
设 \(X_1,\ldots,X_n\) 为独立同分布且具有有限期望 \(\mu\) 的随机变量,样本均值为
弱大数定律说明,对任意 \(\varepsilon>0\),
对 Bernoulli 指示变量,\(\bar X_n\) 就是事件发生的相对频率,所以长期频率会趋近事件概率。MIT 的概率课程把这一结论表述为样本均值依概率收敛,并以 Chebyshev 不等式建立其基本形式。3
大数定律描述平均或比例随重复次数增加而稳定。短序列仍可远离理论比例;在相互独立且成功概率不变的试验中,此前连续失败也不改变下一次成功的概率。大数定律关注样本平均的收敛,样本均值的分布形状怎样随 \(n\) 改变则属于中心极限定理,将在抽样、参数估计与置信区间中继续讨论。
二项分布¶
伯努利试验与概率质量函数¶
一次只有成功与失败两种互斥结果的伯努利试验(Bernoulli trial)可用伯努利随机变量表示,成功记为 1,失败记为 0,成功概率为 \(p\),失败概率为 \(q=1-p\)。若进行固定的 \(n\) 次相互独立试验,且每次成功概率都为同一个 \(p\),成功总数
服从二项分布,记为 \(X\sim\operatorname{Bin}(n,p)\)。其概率质量函数为
其中 \(\binom{n}{x}\) 计算 \(n\) 次试验中恰有 \(x\) 次成功的排列数。累计概率为
例如在一个理想的、无选择且后代相互独立的孟德尔分离模型中,Aa × Aa 后代呈隐性表型的概率为 \(p=1/4\);固定观察 \(n\) 个独立后代时,隐性个体数可用二项分布建模。若同一果实内种子共享母体或微环境,独立性则需要重新评估。
中心、离散与形状¶
二项随机变量的期望和方差为
标准差为 \(\sqrt{npq}\)。样本成功比例 \(\hat p=X/n\) 的期望与标准差则为
样本比例的标准差由 \(p\)、\(q\) 与试验数共同决定,并随独立试验数增加而缩小,这正是大数定律在伯努利试验中的体现。
当 \(p=0.5\) 时二项分布对称;\(p\) 接近 0 或 1 时分布偏斜。随着 \(np\) 与 \(n(1-p)\) 同时增大,标准化后的二项分布可由正态分布近似;近似质量还取决于所求尾部和精度,需要综合判断而非只按 \(n\) 设定阈值。离散计数用连续正态近似时常采用连续性校正;现代软件可以直接计算二项尾概率时,精确计算通常更稳妥。NIST 的二项分布页面列出了相同的质量函数、均值和标准差。4
固定 \(n\)、恒定 \(p\) 和独立性都是模型条件。从有限总体中不放回抽样时,试验并不独立,成功数通常服从超几何分布;不同个体的成功概率异质、窝内聚集或批次效应也会使二项变异不足以描述数据。
泊松分布¶
事件计数与发生率¶
泊松分布用于描述给定时间、面积、体积或其他暴露范围内的事件数。若事件在不相交小区间中的发生近似独立,平均发生率在研究范围内稳定,极短区间内出现多个事件的概率可以忽略,那么总计数可以由参数 \(\lambda>0\) 的泊松分布描述:
\(\lambda\) 是规定暴露量内的期望事件数,并满足
NIST 与 R 的正式分布文档均给出这一质量函数及均值—方差关系。56 若观察面积或随访时间不同,应先记录暴露量;在回归模型中通常通过率和偏置项(offset)处理,使计数比较具有共同的暴露尺度。
泊松分布还具有可加性:相互独立的 \(X_j\sim\operatorname{Pois}(\lambda_j)\) 之和服从参数 \(\sum_j\lambda_j\) 的泊松分布。这使它适合把独立时间段或空间单元的计数汇总起来。
与二项分布的关系及模型偏离¶
当二项分布满足 \(n\to\infty\)、\(p\to0\) 且 \(np\to\lambda\) 时,其分布趋近 \(\operatorname{Pois}(\lambda)\)。因此泊松分布可以近似大量独立、单次概率很小的伯努利事件;泊松过程及其计数模型还具有独立增量和发生率结构,可以直接作为生成模型使用。
\(\lambda\) 较小时分布明显右偏,随 \(\lambda\) 增大逐渐接近对称;大 \(\lambda\) 时可以用正态近似,但仍应检查尾部精度。更重要的是,真实生物计数常因个体异质性、空间聚集、传染过程或遗漏层级而出现方差大于均值的过度离散,也可能因竞争产生方差小于均值。此时负二项、广义 Poisson、零膨胀或层级模型可能更符合生成机制;具体模型将在广义线性模型与混合效应模型中展开。
正态分布¶
密度、位置与尺度¶
正态分布是由均值 \(\mu\) 和方差 \(\sigma^2\) 决定的连续分布,记为 \(X\sim N(\mu,\sigma^2)\)。当 \(\sigma>0\) 时,其密度为
曲线关于 \(x=\mu\) 对称,均值、中位数和众数重合;密度在 \(\mu\) 处最高,拐点位于 \(\mu-\sigma\) 与 \(\mu+\sigma\)。\(\mu\) 平移分布中心,\(\sigma\) 决定展开程度:\(\sigma\) 越大,曲线越宽而峰越低,总面积始终为 1。NIST 的正态分布说明给出了同一密度与位置—尺度解释。7
正态分布的支持范围是整个实数轴,因此它适合由许多小的加性扰动形成、且远离自然边界的连续变异。浓度、寿命和面积等只能取正值且常右偏的变量,其边缘分布形状由生成机制决定;样本量增大主要改善相关统计量的抽样近似。是否需要变换或其他分布应由生成机制与诊断共同判断。
标准化与概率面积¶
把正态变量标准化,
即可得到标准正态分布 \(Z\sim N(0,1)\),其密度为
标准化把原值表示为距离均值多少个标准差,并使所有正态概率都可转化为标准正态累积分布 \(\Phi\):
正态分布约有 68.27%、95.45% 和 99.73% 的概率分别落在 \(\mu\pm\sigma\)、\(\mu\pm2\sigma\) 和 \(\mu\pm3\sigma\) 内。这些比例以正态模型为条件;其他分布的异常观测需要结合各自的形状与生成过程识别。
正态近似的边界¶
二项分布在 \(np\) 与 \(n(1-p)\) 都足够大时、泊松分布在 \(\lambda\) 足够大时,可以在适当范围内用正态分布近似。这里“足够大”随尾部概率、误差容忍和离散性而变;\(p\) 接近 0.5 会使二项分布更对称,近似精度还取决于其他条件。
中心极限定理说明,在相应独立性和矩条件下,许多观测的和或均值经标准化后趋近正态。它讨论统计量的抽样分布,原始总体仍可具有其他形状;异常依赖、重尾或聚类结构还会改变适用条件。正态分布作为数据模型、误差模型和抽样近似是三种不同用法,应在分析中明确区分。
生命科学中的其他常用分布¶
二项、Poisson 和正态分布覆盖三条经典主线,但变量支持范围与生成机制更为多样。下表给出后续模型中常见的接口;具体参数化在不同教材和软件间可能不同,使用时应明确写出质量函数或密度函数。
| 分布 | 支持范围与生成线索 | 生物学用途与边界 |
|---|---|---|
| Bernoulli、分类与多项 | 单次二分类;单次多分类;固定次数的多分类计数 | 生死、等位基因传递、多种表型类别;类别需互斥且穷尽 |
| 超几何 | 有限总体中不放回抽样的成功数 | 从有限标本库抽样;与固定 \(p\) 的独立二项试验不同 |
| 几何与负二项 | 等待首次/第 \(r\) 次成功的试验数;或异质 Poisson 计数 | 等待成功、过度离散计数;“试验数”是否包含成功次及负二项参数化须说明 |
| 均匀 | 有界区间内密度恒定 | 随机化、无偏位置或时间起点模型;均匀性需要相应生成假设 |
| 指数、Gamma 与 Weibull | 非负等待时间或正值;风险率形状由模型决定 | 事件间隔、寿命与生长量;删失和时间变化将在生存分析页处理 |
| Beta | \(0<x<1\),形状由两个参数调节 | 概率参数、连续比例和贝叶斯先验;有精确 0 或 1 时需额外建模 |
| 对数正态 | 对数值服从正态,原尺度为正且常右偏 | 乘法增长、浓度和体量;对数均值的指数对应原尺度几何中心 |
R 的正式分布索引将密度/质量、累积概率、分位数和随机数生成作为四类基本计算,并列出上述多数分布。6 分布名称相同也要核对参数是率还是尺度、随机变量计数的是失败数还是总试验数,以及软件对端点的定义。
从机制到概率模型¶
选择分布首先看变量能取什么值:二分类、非负整数、区间比例、正连续量和全实数连续量的支持范围不同。随后检查数据怎样产生:试验次数是否固定,抽样是否放回,事件率是否稳定,各单位是否独立,暴露量是否一致,是否存在层级、聚集、删失或结构性零值。均值—方差关系、偏斜和尾部图形用于检验这些假设,并与机制判断相互印证。
概率分布还区分参数与观测。二项模型中的 \(p\)、Poisson 模型中的 \(\lambda\) 和正态模型中的 \(\mu,\sigma\) 是控制分布的参数;实际看到的 \(x\) 是随机变量的一次实现。参数未知时,要通过样本估计并表达不确定性,这将进入抽样、参数估计与置信区间。
手工推导帮助理解事件怎样组合,实际计算则应使用经过检验的数值函数。极小概率的阶乘、幂和尾部相减可能下溢或损失精度;直接使用对数概率或上尾函数通常比先算接近 1 的累积概率再相减稳定。模拟可以检查推导和建立直觉;蒙特卡洛(Monte Carlo)频率自身带有随机误差,模型条件仍需另行核验。
参考资料与延伸阅读¶
- Whitlock MC, Schluter D. The Analysis of Biological Data. 3rd ed. Macmillan Learning; 2020.
- Penn State Department of Statistics. STAT 414: Introduction to Probability Theory.
- NIST/SEMATECH. e-Handbook of Statistical Methods: Probability Distributions.
- MIT OpenCourseWare. Lecture 19: Weak Law of Large Numbers.
- R Core Team. Distributions in the
statsPackage. R Documentation.
-
Penn State STAT 414 的条件概率课程从限制样本空间推导 \(P(A\mid B)\) 与乘法法则;其贝叶斯公式课程进一步用样本空间划分推导全概率和后验概率公式。 ↩
-
NIST/SEMATECH 的概率分布定义分别给出离散质量函数求和为 1、连续密度积分为 1,并说明连续变量的单点概率为 0、密度高度可以大于 1。 ↩
-
MIT OpenCourseWare 的弱大数定律课程围绕样本均值、Chebyshev 不等式和依概率收敛建立大数定律。 ↩
-
NIST/SEMATECH 的二项分布条目给出固定 \(n\)、恒定 \(p\) 下的质量函数,以及均值 \(np\) 和标准差 \(\sqrt{np(1-p)}\)。 ↩
-
NIST/SEMATECH 的Poisson 分布条目给出固定时间区间事件计数的质量函数、均值 \(\lambda\) 和标准差 \(\sqrt{\lambda}\)。 ↩
-
R Core Team 的分布索引统一列出标准分布的质量/密度、累积分布、分位数和随机生成函数;Poisson 文档明确给出 \(E(X)=\operatorname{Var}(X)=\lambda\)。 ↩↩
-
NIST/SEMATECH 的正态分布条目给出由位置参数 \(\mu\) 和尺度参数 \(\sigma\) 决定的密度,并以 \(\mu=0,\sigma=1\) 定义标准正态分布。 ↩
页面讨论
使用 GitHub 登录后可参与整页讨论;评论独立保存在 GitHub Discussions 中。