第1章 第2讲 · 概率工具箱
第1讲提出了从序列重建演化过程的问题;这一集先规定描述不确定性的对象与 notation。
Haogao Gu · dg.guhaogao.com · [email protected]
sample space(样本空间) \(\Omega\):一个随机试验所有可能 outcomes(结果) 的集合。先考虑 discrete(离散)情形。
掷一次六面骰子:\(\Omega=\{1,2,3,4,5,6\}\)。
取值范围 对每个结果 \(\omega\),\(0\le P(\{\omega\})\le1\)
归一化 \(\sum_{\omega\in\Omega}P(\{\omega\})=1\)
这两条约束定义合法的离散概率函数。
\[P(\{1\})=\frac16. \qquad \text{(1.1)}\]
六个结果等可能,且总和为 1:\(6\times\frac16=1\)。
\(\Omega=\{(1,1),(1,2),\ldots,(6,6)\}\),共有 \(6\times6=36\) 个等可能结果。
四个高亮结果构成事件 \(A=\{(1,4),\;(2,3),\;(3,2),\;(4,1)\}\)
\[P(A)=\sum_{\omega\in A}P(\{\omega\})=\frac4{36}.\qquad\text{(1.2)}\]
对结果 \((i,j)\),定义
\[X((i,j))=i+j.\]
上一页的事件 \(A\) 正是 \(X=5\),所以 \(P(X=5)=P(A)\);一般地,
\[P(X=x)=P\!\left(\{\omega\in\Omega:X(\omega)=x\}\right).\qquad\text{(1.3)}\]
\(\Omega\) 哪些结果可能发生?
\(P\) 每个事件的概率是多少?
\(X\) 从结果读取哪个数值?
这三个对象共同形式化一个随机试验。
一个人的身高 \(Y\) 可以落在连续区间。恰好等于 \(1.830000\ldots\) m 的概率为 0,但区间概率可以大于 0:
\[P(1.83<Y<1.84)=\int_{1.83}^{1.84}f_Y(x)\,\mathrm dx.\qquad\text{(1.4)}\]
离散 结果可数
概率通过 求和 聚合
连续 结果连续
概率通过密度的 积分 聚合
归一化换成 \(f_X\ge0\) 且 \(\int f_X(x)\,\mathrm dx=1\)
上一集定义了 \(\Omega\)、\(P\) 与 \(X\);这一集引入 mean(均值)、variance(方差)、standard deviation(标准差)与 covariance(协方差)。
Haogao Gu · dg.guhaogao.com · [email protected]
离散随机变量 \[E(X)=\sum_{x\in X(\Omega)}xP(X=x).\qquad\text{(1.5)}\]
连续随机变量 \[E(X)=\int_{X(\Omega)}x f_X(x)\,\mathrm dx.\qquad\text{(1.6)}\]
\(E(X)\) 也称 expectation(期望)。求和与积分都按概率权重汇总所有可能取值。
公平六面骰子的六个取值具有相同概率:
\[E(X)=\dfrac{1+2+3+4+5+6}{6}=3.5.\]
因此 probability mass(概率质量)的重心位于 3.5:
公平骰子的六个平方偏差之和为 \(17.5\),因此 \(\operatorname{Var}(X)=17.5/6=35/12\approx2.92\)。
令 \(\mu=E(X)\)。利用期望的线性性:
\[\begin{aligned} \operatorname{Var}(X) &=E[(X-\mu)^2] \\ &=E(X^2-2\mu X+\mu^2) \\ &=E(X^2)-2\mu E(X)+\mu^2 \\ &=E(X^2)-[E(X)]^2. \end{aligned}\]
\[\sigma(X)=\sqrt{\operatorname{Var}(X)}.\qquad\text{(1.9)}\]
\(\sigma(X)\) 与 \(X\) 具有相同单位。公平骰子:\(\sigma=\sqrt{35/12}\approx1.71\) 点。
\[\operatorname{Cov}(X,Y)=E[(X-E(X))(Y-E(Y))].\qquad\text{(1.10)}\]
正值 两个偏差通常同向
负值 两个偏差通常反向
等于零 没有线性共同变化
协方差带单位,大小不能跨变量比较。当 \(\sigma(X)>0\) 且 \(\sigma(Y)>0\) 时,可定义 correlation coefficient(相关系数)\(\rho=\operatorname{Cov}(X,Y)/(\sigma(X)\sigma(Y))\)。
令 \(\mu_X=E(X)\)、\(\mu_Y=E(Y)\):
\[\begin{aligned} \operatorname{Cov}(X,Y) &=E[(X-\mu_X)(Y-\mu_Y)] \\ &=E(XY)-\mu_XE(Y)-\mu_YE(X)+\mu_X\mu_Y \\ &=E(XY)-E(X)E(Y). \end{aligned}\]
令 \(Y=X\),则
\[\operatorname{Cov}(X,X)=E(X^2)-[E(X)]^2=\operatorname{Var}(X).\]
记 \(D_1\) 为第一颗骰子的点数,\(S=D_1+D_2\) 为两颗之和。
上一集用均值、方差与协方差概括分布;这一集研究给定额外信息后概率如何更新。
Haogao Gu · dg.guhaogao.com · [email protected]
对 \(A,B\subset\Omega\) 且 \(P(B)>0\):
\[P(A\mid B)=\frac{P(A\cap B)}{P(B)}.\qquad\text{(1.11)}\]
限制到事件 \(B\) 后,总概率质量为 \(P(B)\);除以 \(P(B)\) 将其重新归一化为 1。
\(P(A\cap B)\) 称为 joint probability(联合概率)。式 (1.11) 两边乘以 \(P(B)\),得到书中的 product rule for probabilities:
\[P(A\cap B)=P(A\mid B)P(B).\qquad\text{(1.12)}\]
independent(独立):若 \(P(A\mid B)=P(A)\)——等价地 \(P(A\cap B)=P(A)P(B)\)——则称 \(A\) 与 \(B\) 独立。此时联合概率等于两个边缘概率的乘积。
\(A=\{\mathrm{sum}\ge10\}\) 有 6 个结果(虚线框);\(B=\{(1,1),\ldots,(6,6)\}\) 是 6 个对子(蓝框)。给定 \(B\) 后,有效样本空间只包含这 6 格。
棕红色实心的两格是 \(A\cap B\):只有 \((5,5)\) 与 \((6,6)\) 同时属于两个事件。
在条件样本空间中直接计数,分母是已知事件 \(B\) 包含的 6 个结果:
\[P(A\mid B)=\frac{2}{6}=\frac13.\qquad\text{(1.13)}\]
在原始的 36 格中,\(P(B)=6/36\)、\(P(A\cap B)=2/36\);代入式 (1.11):
\[\frac{P(A\cap B)}{P(B)}\;=\;\frac{2/36}{6/36}\;=\;\frac13.\qquad\text{(1.14)}\]
\(P(A\mid B)\) 以 \(B\) 为条件时,事件 \(A\) 的概率
\(P(B\mid A)\) 以 \(A\) 为条件时,事件 \(B\) 的概率
两者分子都是 \(P(A\cap B)\),但归一化分母不同;product rule 给出二者的精确关系。
对同一个联合概率应用两次 product rule:
\[P(A\cap B)=P(A\mid B)\,P(B)=P(B\mid A)\,P(A).\]
两边除以 \(P(B)>0\),得 Bayes’ rule:
\[P(A\mid B)=\frac{P(B\mid A)\,P(A)}{P(B)}.\]
因子 \(P(A)/P(B)\) 表明两个条件方向通常不对称。对子例子中 \(A\) 与 \(B\) 各有 6 个结果,因此 \(P(A)=P(B)=\tfrac16\),两个条件概率恰好相等。
上一集给出了独立性与 product rule;这一集研究 \(m\) 次独立 Bernoulli trials 中成功 \(k\) 次的概率。
Haogao Gu · dg.guhaogao.com · [email protected]
\[\binom{a}{b}=\frac{a!}{b!(a-b)!}.\qquad\text{(B2.1)}\]
\[a!=a(a-1)(a-2)\cdots2\cdot1,\quad 0!=1.\qquad\text{(B2.2)}\]
对整数 \(a\ge b\ge0\),\(\binom{a}{b}\) 是从 \(a\) 个元素中选择 \(b\) 个元素的无序子集数(书 Box 2,printed p. 25)。对 \(b>a\) 规定:
\[\binom{a}{b}=0\qquad\text{for }b>a.\qquad\text{(B2.3)}\]
当 \(b>a\) 时没有符合条件的子集,计数为 0;这一约定使相关求和可以使用统一的上下限。
先有序地取 从 \(a\) 个里有序取 \(b\) 个:
\(a(a-1)\cdots(a-b+1)=\dfrac{a!}{(a-b)!}\) 种
再去掉顺序 同一个子集的 \(b\) 个元素
有 \(b!\) 种排列,都被上面数过
两者相除即得 (B2.1):
\[\binom{a}{b}=\frac{a!/(a-b)!}{b!}=\frac{a!}{b!\,(a-b)!}\]
\(X\) 是 \(m\) 次 independent Bernoulli trials 中的成功次数,每次成功概率为 \(p\)(书 Box 3,printed p. 25)。
\[P(X=k)=\binom{m}{k}p^k(1-p)^{m-k}.\qquad\text{(B3.1)}\]
令 \(I_r=1\) 表示第 \(r\) 次试验成功,否则 \(I_r=0\)。成功总数为
\[\begin{aligned} X&=I_1+\cdots+I_m,\\ E(X)&=\sum_{r=1}^{m}E(I_r) =\sum_{r=1}^{m}p=mp. \end{aligned}\]
公平骰子掷 100 次时,\(m=100\)、\(p=1/6\),因此 \(E(X)=100/6\approx16.67\)。
前四集在给定模型后计算事件概率;这一集根据一次观测评估其与指定模型是否相容。
Haogao Gu · dg.guhaogao.com · [email protected]
Probability theory(概率论) 给定分布 → 计算事件概率
Stochastic processes(随机过程) 规定随时间重复的随机试验 → 描述实现路径的分布
Statistics(统计学) 给定观测 → 估计参数或评估模型
概率论将在 §6.3.3 用于计算系统发育树上的序列概率;随机过程将在第5章的 Markov chain 与第8章的 Brownian motion 中展开。本集聚焦统计推断。
null hypothesis(零假设) \(H_0\):一个关于 \(X\) 的概率分布的具体陈述;只有明确给出分布,才能计算下面的概率。
若“更极端”定义为更大:
\[p\text{-value}=P(X\ge x\mid H_0).\]
令 \(X\) 为掷出 6 的次数,试验次数为 \(n=100\)(书 Box 1 使用 \(n\),Box 3 使用 \(m\),二者均表示试验次数)。在 \(H_0:p=1/6\) 下:
\[X\sim\operatorname{Binomial}(100,1/6).\]
观测到的实现值为 \(x=25\)。
需要计算的是:在 \(H_0\) 下,出现 25 次或更多次 6 的概率。
\[P(X\ge25\mid H_0) =\sum_{k=25}^{100}\binom{100}{k} \left(\frac16\right)^k \left(\frac56\right)^{100-k} \approx0.022.\]
若预先设定 \(\alpha=0.05\),且 p-value \(<\alpha\),则在 \(\alpha\) 水平下拒绝 \(H_0\)。
看数据前 先定下 \(H_0\)、极端性、\(\alpha\)
看数据后 计算尾概率,再应用预先规定的判定规则
在检验满足标称水平时,\(H_0\) 为真时错误拒绝(false positive)的概率不超过 \(\alpha\)。书给出的常用取值是 \(0.05\) 或 \(0.01\);较小的 \(\alpha\) 对应较低的 false-positive tolerance。
单侧 只关心 \(X\ge x\) 或只关心 \(X\le x\)
双侧 两侧尾部都定义为极端:\(P(X\ge x\mid H_0)<\alpha/2\) 或 \(P(X\le x\mid H_0)<\alpha/2\) 时拒绝;书把 \(\alpha/2\) 称作 rejection threshold
检验方向与极端性的定义必须在查看数据前确定。第7章将再次使用 rejection threshold。
p-value 不是 \(P(H_0\mid data)\)
“not significant” 不显著不能证明 \(H_0\) 成立:它可能来自 power 不足,也可能与 \(H_0\) 相容
小的 p-value 不自动意味着较大的 biological effect:\(n\) 越大,同样的相对偏离可产生更小的 p-value
Adapted and translated into Chinese from: Stadler T, Magnus C, Vaughan T, Barido-Sottani J, Bošková V, Huisman JS, Pečerska J. Decoding Genomes: From Sequences to Phylodynamics (1st ed., 2024). https://decodinggenomes.org · DOI: 10.3929/ethz-b-000664449.
Original licensed under CC BY-SA 4.0; this derivative work is likewise released under CC BY-SA 4.0. Changes: translated to Chinese, reorganised into video lessons and slides; all teaching diagrams in this deck are original, built from scratch as inline DOM and SVG, not reproduced from the book.
Source range: Chapter 1 §1.3, printed pp. 19-25
Decoding Genomes 中文课程 · CC BY-SA 4.0