← 课程目录

概率:把不确定性变成可以计算的对象

第1章 第2讲 · 概率工具箱

Haogao Gu

第1集 · Ω、P 与 X:随机模型的三个基本对象

第1讲提出了从序列重建演化过程的问题;这一集先规定描述不确定性的对象与 notation。

Haogao Gu · dg.guhaogao.com · [email protected]

本讲的五个阶段使用同一套 notation

先规定模型对象,再定义分布的概括量与条件概率;二项分布给出重复试验的概率模型,p-value 用该模型评估观测。

Random experiment(随机试验)先列出所有可能结果

sample space(样本空间) \(\Omega\):一个随机试验所有可能 outcomes(结果) 的集合。先考虑 discrete(离散)情形。

掷一次六面骰子:\(\Omega=\{1,2,3,4,5,6\}\)

书里把 \(\Omega\) 称作 state space;本课统一用更通用的 sample space,因为 state space 在第5章要留给 CTMC 的状态集 \(\{T,C,A,G\}\)

Probability function(概率函数)\(P\) 满足两个约束

取值范围 对每个结果 \(\omega\)\(0\le P(\{\omega\})\le1\)

归一化 \(\sum_{\omega\in\Omega}P(\{\omega\})=1\)

这两条约束定义合法的离散概率函数。

非负性与归一化规定 \(P\) 的基本结构;事件概率、条件概率与 Bayes’ rule 都建立在这套概率框架上。

公平骰子的六个结果具有相同概率

\[P(\{1\})=\frac16. \qquad \text{(1.1)}\]

六个结果等可能,且总和为 1:\(6\times\frac16=1\)

掷两次时,每个结果是一个有序对

\(\Omega=\{(1,1),(1,2),\ldots,(6,6)\}\),共有 \(6\times6=36\) 个等可能结果。

“点数之和为 5”定义一个 event(事件)

四个高亮结果构成事件 \(A=\{(1,4),\;(2,3),\;(3,2),\;(4,1)\}\)

\[P(A)=\sum_{\omega\in A}P(\{\omega\})=\frac4{36}.\qquad\text{(1.2)}\]

Random variable(随机变量)\(X\)\(\Omega\) 上的函数

对结果 \((i,j)\),定义

\[X((i,j))=i+j.\]

上一页的事件 \(A\) 正是 \(X=5\),所以 \(P(X=5)=P(A)\);一般地,

\[P(X=x)=P\!\left(\{\omega\in\Omega:X(\omega)=x\}\right).\qquad\text{(1.3)}\]

realisation(实现值)
\(X\) 取到的具体数值 \(x\);第5集观测到的 \(x=25\) 是一个实现值。
\(P(x)\)\(P(X)\)
不产生歧义时,书把 \(P(X=x)\) 简写成 \(P(x)\),把整个分布写成 \(P(X)\);后面章节的 \(P(D\mid\theta)\) 使用同一约定。
\(X:\Omega\to\mathbb R\) 是一个确定的函数;随机性由 \(P\) 描述,\(X\) 负责从每个结果读取数值。

\(\Omega\)\(P\)\(X\) 共同定义一个 stochastic model(随机模型)

\(\Omega\) 哪些结果可能发生?

\(P\) 每个事件的概率是多少?

\(X\) 从结果读取哪个数值?

这三个对象共同形式化一个随机试验。

连续结果以 density(密度)描述区间概率

一个人的身高 \(Y\) 可以落在连续区间。恰好等于 \(1.830000\ldots\) m 的概率为 0,但区间概率可以大于 0:

\[P(1.83<Y<1.84)=\int_{1.83}^{1.84}f_Y(x)\,\mathrm dx.\qquad\text{(1.4)}\]

离散概率通过求和聚合,连续概率通过积分聚合

离散 结果可数
概率通过 求和 聚合

连续 结果连续
概率通过密度的 积分 聚合
归一化换成 \(f_X\ge0\)\(\int f_X(x)\,\mathrm dx=1\)

密度 \(f_Y(x)\) 可以大于 1;必须位于 \([0,1]\) 的是区间概率,而不是密度的高度。
\(\Omega\) 规定可能结果,\(P\) 规定概率,\(X\) 规定读取的数值;下一集用均值、方差与协方差概括由此得到的分布。

第2集 · 均值、方差与协方差:分布的位置、尺度与共同变化

上一集定义了 \(\Omega\)\(P\)\(X\);这一集引入 mean(均值)、variance(方差)、standard deviation(标准差)与 covariance(协方差)。

Haogao Gu · dg.guhaogao.com · [email protected]

均值是所有可能取值按概率加权的平均值

离散随机变量 \[E(X)=\sum_{x\in X(\Omega)}xP(X=x).\qquad\text{(1.5)}\]

连续随机变量 \[E(X)=\int_{X(\Omega)}x f_X(x)\,\mathrm dx.\qquad\text{(1.6)}\]

\(E(X)\) 也称 expectation(期望)。求和与积分都按概率权重汇总所有可能取值。

公平骰子的均值为 3.5

公平六面骰子的六个取值具有相同概率:

\[E(X)=\dfrac{1+2+3+4+5+6}{6}=3.5.\]

因此 probability mass(概率质量)的重心位于 3.5:

−2.5 −1.5 −0.5 +0.5 +1.5 +2.5 1 2 3 4 5 6 1/6 1/6 1/6 1/6 1/6 1/6 E(X) = 3.5 掷出的点数 x
均值是概率质量的重心;它描述分布的中心,但不必是一个可能的实现值。

方差是相对均值的平方偏差的期望

离散随机变量
\[\operatorname{Var}(X)=E[(X-E(X))^2] =\sum_{x\in X(\Omega)}(x-E(X))^2P(X=x).\quad\text{(1.7)}\]
连续随机变量
\[\operatorname{Var}(X)=\int_{X(\Omega)}(x-E(X))^2f_X(x)\,\mathrm dx.\quad\text{(1.8)}\]

公平骰子的六个平方偏差之和为 \(17.5\),因此 \(\operatorname{Var}(X)=17.5/6=35/12\approx2.92\)

展开平方得到方差的计算等价式

\(\mu=E(X)\)。利用期望的线性性:

\[\begin{aligned} \operatorname{Var}(X) &=E[(X-\mu)^2] \\ &=E(X^2-2\mu X+\mu^2) \\ &=E(X^2)-2\mu E(X)+\mu^2 \\ &=E(X^2)-[E(X)]^2. \end{aligned}\]

\(\operatorname{Var}(X)=E(X^2)-[E(X)]^2\) 与定义完全等价,计算时可选更直接的一种。

标准差把方差恢复到 \(X\) 的原始单位

\[\sigma(X)=\sqrt{\operatorname{Var}(X)}.\qquad\text{(1.9)}\]

\(\sigma(X)\)\(X\) 具有相同单位。公平骰子:\(\sigma=\sqrt{35/12}\approx1.71\) 点。

方差的单位是点数的平方,标准差的单位是点数;报告分散程度时通常使用标准差。

协方差描述两个变量的偏差是否共同变化

\[\operatorname{Cov}(X,Y)=E[(X-E(X))(Y-E(Y))].\qquad\text{(1.10)}\]

正值 两个偏差通常同向

负值 两个偏差通常反向

等于零 没有线性共同变化

协方差带单位,大小不能跨变量比较。当 \(\sigma(X)>0\)\(\sigma(Y)>0\) 时,可定义 correlation coefficient(相关系数)\(\rho=\operatorname{Cov}(X,Y)/(\sigma(X)\sigma(Y))\)

式 (1.10) 比较两个变量各自相对均值的偏差;令 \(Y=X\) 即得到方差。

展开乘积得到协方差的计算等价式

\(\mu_X=E(X)\)\(\mu_Y=E(Y)\)

\[\begin{aligned} \operatorname{Cov}(X,Y) &=E[(X-\mu_X)(Y-\mu_Y)] \\ &=E(XY)-\mu_XE(Y)-\mu_YE(X)+\mu_X\mu_Y \\ &=E(XY)-E(X)E(Y). \end{aligned}\]

\(Y=X\),则

\[\operatorname{Cov}(X,X)=E(X^2)-[E(X)]^2=\operatorname{Var}(X).\]

\(\operatorname{Cov}(X,Y)=E(XY)-E(X)E(Y)\);协方差是方差的双变量推广。

两个骰子例子验证协方差的等价式

\(D_1\) 为第一颗骰子的点数,\(S=D_1+D_2\) 为两颗之和。

两颗骰子之间
两次投掷独立,因此 \(E(D_1D_2)=E(D_1)E(D_2)\),所以 \(\operatorname{Cov}(D_1,D_2)=0\)
和与其中一颗
\[\begin{aligned} \operatorname{Cov}(S,D_1) &=\operatorname{Cov}(D_1,D_1)+\operatorname{Cov}(D_2,D_1)\\ &=[E(D_1^2)-E(D_1)^2]\\ &\quad+[E(D_2D_1)-E(D_2)E(D_1)]\\ &=\operatorname{Var}(D_1)=35/12. \end{aligned}\]
独立可以推出协方差为 0,反向推论不成立。第8章将两个物种性状的协方差写成其 MRCA 时间的函数。

第3集 · 条件概率:在给定事件内重新归一化

上一集用均值、方差与协方差概括分布;这一集研究给定额外信息后概率如何更新。

Haogao Gu · dg.guhaogao.com · [email protected]

Conditional probability(条件概率)在事件 \(B\) 内重新归一化

\(A,B\subset\Omega\)\(P(B)>0\)

\[P(A\mid B)=\frac{P(A\cap B)}{P(B)}.\qquad\text{(1.11)}\]

限制到事件 \(B\) 后,总概率质量为 \(P(B)\);除以 \(P(B)\) 将其重新归一化为 1。

式 (1.11) 等价于 product rule 与独立性判据

\(P(A\cap B)\) 称为 joint probability(联合概率)。式 (1.11) 两边乘以 \(P(B)\),得到书中的 product rule for probabilities

\[P(A\cap B)=P(A\mid B)P(B).\qquad\text{(1.12)}\]

independent(独立):若 \(P(A\mid B)=P(A)\)——等价地 \(P(A\cap B)=P(A)P(B)\)——则称 \(A\)\(B\) 独立。此时联合概率等于两个边缘概率的乘积。

Product rule 是条件概率定义的乘法形式;独立性使其化为 \(P(A\cap B)=P(A)P(B)\)。第4集的 Bernoulli trials 与第6章的位点独立连乘都使用这一关系。

已知掷出对子时,点数之和至少为 10 只包含两个结果

\(A=\{\mathrm{sum}\ge10\}\) 有 6 个结果(虚线框);\(B=\{(1,1),\ldots,(6,6)\}\) 是 6 个对子(蓝框)。给定 \(B\) 后,有效样本空间只包含这 6 格。

棕红色实心的两格是 \(A\cap B\):只有 \((5,5)\)\((6,6)\) 同时属于两个事件。

条件样本空间与原样本空间给出相同结果

在条件样本空间中直接计数,分母是已知事件 \(B\) 包含的 6 个结果:

\[P(A\mid B)=\frac{2}{6}=\frac13.\qquad\text{(1.13)}\]

在原始的 36 格中,\(P(B)=6/36\)\(P(A\cap B)=2/36\);代入式 (1.11):

\[\frac{P(A\cap B)}{P(B)}\;=\;\frac{2/36}{6/36}\;=\;\frac13.\qquad\text{(1.14)}\]

限制到事件 \(B\) 后直接计数,与在原样本空间中计算 \(P(A\cap B)/P(B)\) 完全等价。

\(P(A\mid B)\)\(P(B\mid A)\) 通常不是一回事

\(P(A\mid B)\)\(B\) 为条件时,事件 \(A\) 的概率

\(P(B\mid A)\)\(A\) 为条件时,事件 \(B\) 的概率

两者分子都是 \(P(A\cap B)\),但归一化分母不同;product rule 给出二者的精确关系。

Bayes’ rule 由联合概率的两种分解得到

对同一个联合概率应用两次 product rule:

\[P(A\cap B)=P(A\mid B)\,P(B)=P(B\mid A)\,P(A).\]

两边除以 \(P(B)>0\),得 Bayes’ rule

\[P(A\mid B)=\frac{P(B\mid A)\,P(A)}{P(B)}.\]

因子 \(P(A)/P(B)\) 表明两个条件方向通常不对称。对子例子中 \(A\)\(B\) 各有 6 个结果,因此 \(P(A)=P(B)=\tfrac16\),两个条件概率恰好相等。

联合概率的两种分解直接给出 Bayes’ rule,并在第10章用于 posterior;第6章的 Felsenstein pruning 使用 product rule、条件独立与状态求和。

第4集 · 二项分布:排列数与单一排列的概率

上一集给出了独立性与 product rule;这一集研究 \(m\) 次独立 Bernoulli trials 中成功 \(k\) 次的概率。

Haogao Gu · dg.guhaogao.com · [email protected]

Binomial coefficient(二项式系数)计算成功位置的选择数

\[\binom{a}{b}=\frac{a!}{b!(a-b)!}.\qquad\text{(B2.1)}\]

\[a!=a(a-1)(a-2)\cdots2\cdot1,\quad 0!=1.\qquad\text{(B2.2)}\]

对整数 \(a\ge b\ge0\)\(\binom{a}{b}\) 是从 \(a\) 个元素中选择 \(b\) 个元素的无序子集数(书 Box 2,printed p. 25)。对 \(b>a\) 规定:

\[\binom{a}{b}=0\qquad\text{for }b>a.\qquad\text{(B2.3)}\]

\(b>a\) 时没有符合条件的子集,计数为 0;这一约定使相关求和可以使用统一的上下限。

二项式系数由有序抽取数除以重复排列数得到

先有序地取\(a\) 个里有序取 \(b\) 个:
\(a(a-1)\cdots(a-b+1)=\dfrac{a!}{(a-b)!}\)

再去掉顺序 同一个子集的 \(b\) 个元素
\(b!\) 种排列,都被上面数过

两者相除即得 (B2.1):

\[\binom{a}{b}=\frac{a!/(a-b)!}{b!}=\frac{a!}{b!\,(a-b)!}\]

有序抽取数为 \(a!/(a-b)!\);每个无序子集被其 \(b!\) 种排列重复计算,因此二者相除得到 \(\binom{a}{b}\)

Binomial distribution(二项分布):数序列,再乘单条序列概率

\(X\)\(m\) 次 independent Bernoulli trials 中的成功次数,每次成功概率为 \(p\)(书 Box 3,printed p. 25)。

\[P(X=k)=\binom{m}{k}p^k(1-p)^{m-k}.\qquad\text{(B3.1)}\]

m = 4,k = 2:从 A–D 中选择两个成功位置 A B C D A B C D AB 6 6 ≠6 ≠6 p²(1−p)² AC 6 ≠6 6 ≠6 p²(1−p)² AD 6 ≠6 ≠6 6 p²(1−p)² BC ≠6 6 6 ≠6 p²(1−p)² BD ≠6 6 ≠6 6 p²(1−p)² CD ≠6 ≠6 6 6 p²(1−p)² 6 条互斥结果序列:概率相加 6 × p²(1−p)² = 6 × (1/6)²(5/6)² = 25/216 ≈ 0.116

Indicator variables(指示变量)给出二项分布的期望 \(E(X)=mp\)

\(I_r=1\) 表示第 \(r\) 次试验成功,否则 \(I_r=0\)。成功总数为

\[\begin{aligned} X&=I_1+\cdots+I_m,\\ E(X)&=\sum_{r=1}^{m}E(I_r) =\sum_{r=1}^{m}p=mp. \end{aligned}\]

公平骰子掷 100 次时,\(m=100\)\(p=1/6\),因此 \(E(X)=100/6\approx16.67\)

第5章将一次试验对应到一个比对位点,将成功定义为两条序列在该位点上不同;实际 substitution(替换)次数仍是潜变量。下一集用二项分布计算零假设下的尾概率。

第5集 · p-value:零假设下的尾概率

前四集在给定模型后计算事件概率;这一集根据一次观测评估其与指定模型是否相容。

Haogao Gu · dg.guhaogao.com · [email protected]

概率论、随机过程与统计学具有不同的输入和输出

Probability theory(概率论) 给定分布 → 计算事件概率

Stochastic processes(随机过程) 规定随时间重复的随机试验 → 描述实现路径的分布

Statistics(统计学) 给定观测 → 估计参数或评估模型

概率论将在 §6.3.3 用于计算系统发育树上的序列概率;随机过程将在第5章的 Markov chain 与第8章的 Brownian motion 中展开。本集聚焦统计推断。

本书使用三类统计任务

parameter estimation(参数估计)
从系统发育树估计 speciation / extinction rates——第9章。
hypothesis testing(假设检验)
评估观测数据与指定随机模型是否相容——第4章 GWAS 与第7章 LRT。
uncertainty quantification(不确定性量化)
描述参数与 tree estimate 的不确定程度——第7章的 CI 与 bootstrap。

p-value 是零假设下的尾概率

null hypothesis(零假设) \(H_0\):一个关于 \(X\) 的概率分布的具体陈述;只有明确给出分布,才能计算下面的概率。

若“更极端”定义为更大:

\[p\text{-value}=P(X\ge x\mid H_0).\]

p-value 不是 \(P(H_0\mid X=x)\),也不是“结果由偶然造成的概率”。

零假设下的重复试验:公平骰子掷 100 次

\(X\) 为掷出 6 的次数,试验次数为 \(n=100\)(书 Box 1 使用 \(n\),Box 3 使用 \(m\),二者均表示试验次数)。在 \(H_0:p=1/6\) 下:

\[X\sim\operatorname{Binomial}(100,1/6).\]

观测到的实现值为 \(x=25\)

需要计算的是:在 \(H_0\) 下,出现 25 次或更多次 6 的概率。

二项分布的上尾由 \(k\ge25\) 的离散概率质量组成

每根柱表示一个整数结果的概率;上尾概率是 \(k=25,26,\ldots,100\) 对应的 76 项之和。

上尾概率约为 0.022

\[P(X\ge25\mid H_0) =\sum_{k=25}^{100}\binom{100}{k} \left(\frac16\right)^k \left(\frac56\right)^{100-k} \approx0.022.\]

单个结果
\(P(X=25)=0.0098\),约占整个上尾概率的 45%。
整个上尾
\(P(X\ge25\mid H_0)=0.021703\),四舍五入 \(0.022\);期望是 \(16.67\),25 高出约 \(2.24\sigma\)
\(0.022\) 是 76 个离散概率质量的和;\(P(X=25)\) 只是其中一项。

Significance level(显著性水平)\(\alpha\) 是预先规定的判定阈值

若预先设定 \(\alpha=0.05\),且 p-value \(<\alpha\),则在 \(\alpha\) 水平下拒绝 \(H_0\)

看数据前 先定下 \(H_0\)、极端性、\(\alpha\)

看数据后 计算尾概率,再应用预先规定的判定规则

在检验满足标称水平时,\(H_0\) 为真时错误拒绝(false positive)的概率不超过 \(\alpha\)。书给出的常用取值是 \(0.05\)\(0.01\);较小的 \(\alpha\) 对应较低的 false-positive tolerance。

One-sided(单侧)与 two-sided(双侧)检验采用不同的极端性定义

单侧 只关心 \(X\ge x\) 或只关心 \(X\le x\)

双侧 两侧尾部都定义为极端:\(P(X\ge x\mid H_0)<\alpha/2\)\(P(X\le x\mid H_0)<\alpha/2\) 时拒绝;书把 \(\alpha/2\) 称作 rejection threshold

检验方向与极端性的定义必须在查看数据前确定。第7章将再次使用 rejection threshold。

p-value 不回答三个它常被误用来回答的问题

p-value 不是 \(P(H_0\mid data)\)

“not significant” 不显著不能证明 \(H_0\) 成立:它可能来自 power 不足,也可能与 \(H_0\) 相容

小的 p-value 不自动意味着较大的 biological effect:\(n\) 越大,同样的相对偏离可产生更小的 p-value

p-value 只回答一件事:在 \(H_0\) 之下,这么极端或更极端有多常见。这三条区分会在第4章 GWAS 与第7章 LRT 反复出现。

第2讲收束:从随机模型到 p-value

  1. 随机模型由 \(\Omega\)\(P\)\(X\) 定义;\(X:\Omega\to\mathbb R\) 从每个结果读取数值。
  2. 均值、方差与协方差分别描述分布的中心、尺度与两个变量的共同变化。
  3. 条件概率在事件 \(B\) 内重新归一化;product rule 的两种分解给出 Bayes’ rule。
  4. \(m\) 次独立 Bernoulli 试验的成功次数服从二项分布 \(\binom{m}{k}p^k(1-p)^{m-k}\)
  5. p-value 是 \(H_0\) 下由观测值确定的尾概率;\(\alpha\) 是预先规定的判定阈值。
本讲从随机模型的三个基本对象出发,建立了由模型计算概率、再由观测评估模型的完整链条。下一讲讨论这些方法作用的数据对象:测序仪产出的 reads。

授权与来源 · Attribution

Adapted and translated into Chinese from: Stadler T, Magnus C, Vaughan T, Barido-Sottani J, Bošková V, Huisman JS, Pečerska J. Decoding Genomes: From Sequences to Phylodynamics (1st ed., 2024). https://decodinggenomes.org · DOI: 10.3929/ethz-b-000664449.

Original licensed under CC BY-SA 4.0; this derivative work is likewise released under CC BY-SA 4.0. Changes: translated to Chinese, reorganised into video lessons and slides; all teaching diagrams in this deck are original, built from scratch as inline DOM and SVG, not reproduced from the book.

Source range: Chapter 1 §1.3, printed pp. 19-25