0%
16 min read 学习笔记 学习路线

概率论与数理统计 (Part 1): 概率论基础

概率论基础学习笔记:概率空间、条件概率、随机变量与分布、期望方差、多维随机变量、大数定律、中心极限定理与特征函数。

这是 概率论与数理统计 系列的第一期。

本学期我在杨丽丽教授的课程上学习了概率论与数理统计,以下是我整理的学习笔记。内容涵盖了概率论的基本概念、概率分布、统计推断等方面。通过系统地整理和总结相关知识点,旨在帮助读者更好地理解和掌握概率论与数理统计的核心内容。

如果有练习需要,可以前往“数苑”平台进行更多练习。

1 概率论基础

1.1 概率空间

1.1.1 样本空间与事件

样本空间是所有可能结果的集合,记为 Ω\Omega。事件是样本空间的子集,表示某些特定结果的集合。

例子:掷一枚公平的硬币,样本空间为 Ω={H,T}\Omega = \{H, T\},事件 AA 表示掷出正面,则 A={H}A = \{H\}。这样只有一个样本点的事件被称为基本事件,例如 AA 就是一个基本事件。事件 BB 表示掷出反面,则 B={T}B = \{T\},也是一个基本事件。事件 CC 表示掷出正面或反面,则 C={H,T}C = \{H, T\},是一个复合事件。

这是一个非常简单的例子,但它展示了概率空间的基本构成。我们可以通过定义不同的事件来分析各种情况,例如事件 BB 表示掷出反面,则 B={T}B = \{T\}

事件的发生: 事件 AA 发生当且仅当样本点 ωA\omega \in A。因此,若ABA \subseteq B,则事件 AA 发生时事件 BB 一定发生。

事件的关系类型:

  • ABA \subseteq B,则称事件 AA 是事件 BB 的子事件(Subevent)。
  • AB=A \cap B = \emptyset,则称事件 AA 和事件 BB 是互斥事件(Exclusive Event)。
  • AB=A \cap B = \emptysetAB=ΩA \cup B = \Omega,则称事件 AA 和事件 BB 是互补事件(Complementary Events)。

1.1.2 σ\sigma-代数

现代概率论中,由于一些历史上的悖论,柯尔莫哥洛夫引入了σ\sigma-代数的概念来定义事件的集合。

定义:设 Ω\Omega 是一个非空集合,F\mathcal{F}Ω\Omega 的子集的集合,如果满足以下条件,则称 F\mathcal{F}Ω\Omega 上的 σ\sigma-代数:

  1. ΩF\Omega \in \mathcal{F}
  2. 如果 AFA \in \mathcal{F},则 AˉF\bar{A} \in \mathcal{F}
  3. 如果 A1,A2,FA_1, A_2, \ldots \in \mathcal{F},则 i=1AiF\bigcup_{i=1}^{\infty} A_i \in \mathcal{F}

在测度论上,我们通常将σ\sigma-代数定义在Borel集上,确保了我们可以对事件进行合理的测度和概率分配。这种结构使得概率论具有了坚实的数学基础,避免了历史上的一些悖论问题。

Borel集: Borel集是具有如下性质的集合:

  1. 包含所有开区间。
  2. 闭区间也是Borel集。
  3. 通过有限次或可数次的集合运算(如并集、交集、补集)得到的集合也是Borel集。

我们来看一个例子:

例子:在实数轴上,开区间 (0,1)(0, 1) 和闭区间 [0,1][0, 1] 都是Borel集。通过集合运算,我们可以得到更多的Borel集,例如 A=(0,1)[2,3]A = (0, 1) \cup [2, 3] 也是一个Borel集。

Borel集合描述的是样本空间的一个子集族,这些集合可以被赋予概率值,从而构成一个概率空间。通过定义Borel集,我们可以确保我们讨论的事件是可测的,从而能够合理地分配概率。

1.1.4 概率(测度)

概率是定义在σ\sigma-代数上的一个测度函数P:FRP:\mathcal{F} \to \mathbb{R},满足以下条件:

  1. 非负性:对于所有 AFA \in \mathcal{F}P(A)0P(A) \geq 0
  2. 规范化:P(Ω)=1P(\Omega) = 1
  3. 可列可加性:如果 A1,A2,A_1, A_2, \ldotsF\mathcal{F} 中的两两不交事件,则 P(i=1Ai)=i=1P(Ai)P\left(\bigcup_{i=1}^{\infty} A_i\right) = \sum_{i=1}^{\infty} P(A_i)

在历史上,人们采用了很多不同的概率定义方法,主要包括古典概率、几何概率和公理化概率三种。下面我们将分别介绍这三种定义方法:

古典概率

古典概率建立在有限离散样本空间上,假设样本空间 Ω\Omega 中的每个基本事件发生的可能性相等,也就是说,wi,wj,P(wi)=P(wj)\forall w_i,w_j, P(w_i) = P(w_j)。那么事件 AA 的概率可以通过以下公式计算:

P(A)=AΩP(A) = \frac{|A|}{|\Omega|}

频率学派认为概率是事件在大量重复试验中出现的频率的极限值。

limnnAn=P(A)\lim_{n\to \infty} \frac{n_A}{n} = P(A)

布封投针实验: 在布封投针实验中,我们将一根长度为 ll 的针随机地投掷到一个平面上,平面上有平行的线条,线条之间的距离为 dd。我们想要计算针与线条相交的概率。通过几何分析和积分技巧,我们可以得出以下结论:

  • ldl \leq d 时,针与线条相交的概率为 P=2lπdP = \frac{2l}{\pi d}
  • l>dl > d 时,针与线条相交的概率为 P=2lπd2l2d2πdP = \frac{2l}{\pi d} - \frac{2\sqrt{l^2 - d^2}}{\pi d}

布封根据这个原理,通过大量的实验证明了随机试验可以估计 π\pi 的值,这也是频率概率的一个重要应用。

虽然这种定义在某些情况下是有用的,但它并不能适用于所有类型的事件,特别是那些无法进行大量重复试验的事件,我们需要更一般的概率定义方法来处理这些情况。

几何概率

几何概率适用于连续样本空间,事件 AA 的概率可以通过以下公式计算: P(A)=事件 A 的测度样本空间 Ω 的测度P(A) = \frac{\text{事件 } A \text{ 的测度}}{\text{样本空间 } \Omega \text{ 的测度}}

但是,人们尚未解决测度的严格定义问题,这导致了一些悖论的出现,例如巴拿赫-塔尔斯基悖论和斯特罗姆伯格悖论。这些悖论表明,在某些情况下,几何概率的定义可能会导致矛盾的结果,因此需要更严格的数学框架来解决这些问题。

公理化概率

公理化概率是现代概率论的基础,建立在柯尔莫哥洛夫的公理体系上。通过定义概率空间,我们可以系统地分析各种随机现象,并为后续的概率论和数理统计的学习打下坚实的基础。

公理化概率基于三条基本公理:

  1. 非负性:对于所有事件 AAP(A)0P(A) \ge 0
  2. 规范化:P(Ω)=1P(\Omega) = 1
  3. 可列可加性:如果 A1,A2,A_1, A_2, \ldotsF\mathcal{F} 中的两两不交事件,则 P(i=1Ai)=i=1P(Ai)P\left(\bigcup_{i=1}^{\infty} A_i\right) = \sum_{i=1}^{\infty} P(A_i)

注: 可列可加性蕴含了空集的概率为零,即 P()=0P(\emptyset) = 0。我们可以通过以下推导来证明这一点: P(Ω)=P(Ω)=P(Ω)+P()    P()=0P(\Omega) = P(\Omega \cup \emptyset) = P(\Omega) + P(\emptyset) \implies P(\emptyset) = 0

公理化概率统一了离散和连续的概率定义,同时解决了历史上的悖论问题,使得概率论具有了坚实的数学基础。

1.1.5 概率空间

概率空间是一个三元组,我们用 (Ω,F,P)(\Omega, \mathcal{F}, P) 来表示,其中 Ω\Omega 是样本空间,F\mathcal{F}Ω\Omega 上的 σ\sigma-代数,PP 是定义在 F\mathcal{F} 上的概率测度。

概率空间给予了我们一个研究事件与衡量事件发生可能性的代数结构,使得我们能够系统地分析各种随机现象。通过定义概率空间,我们可以将抽象的概率概念具体化,并为后续的概率论和数理统计的学习打下坚实的基础。

1.1.6 概率计算

概率计算建立在公理化概率的基础上,利用概率的基本性质和定理来计算事件的概率。常用的概率计算方法可以依靠若干组合学上的定理来实现,例如:

  • 容斥原理:对于任意事件 A1,A2,,AnA_1, A_2, \ldots, A_n,有 P(i=1nAi)=i=1nP(Ai)1i<jnP(AiAj)++(1)n+1P(i=1nAi)P\left(\bigcup_{i=1}^n A_i\right) = \sum_{i=1}^n P(A_i) - \sum_{1 \le i < j \le n} P(A_i \cap A_j) + \\ \cdots + (-1)^{n+1} P\left(\bigcap_{i=1}^n A_i\right)
  • 子集的概率比较:如果 ABA \subseteq B,则 P(A)P(B)P(A) \le P(B)。也就是说,概率测度不改变链上的偏序关系。我们可以通过以下推导来证明这一点: P(B)=P(A(BA))=P(A)+P(BA)P(A)P(B) = P(A \cup (B \setminus A)) = P(A) + P(B \setminus A) \ge P(A)
  • 其它的组合学定理…

由于概率的可列可加性,我们可以通过很多的组合学定理解决概率的计算问题,此处不再赘述。

1.1.7 一些习题

习题A组(集合论)

习题1AB=ABA \cap B = \overline{A \cup B}, 证明AB=ΩA \cup B = \Omega

习题2 对于i=1nAi\bigcup_{i=1}^n A_i,证明其可以分解为两两互斥的事件的并集。(提示:采用首次采用原则,B1=A1,B2=A2A1,,Bn=An(A1An1)B_1 = A_1, B_2 = A_2 \setminus A_1, \ldots, B_n = A_n \setminus (A_1 \cup \cdots \cup A_{n-1})

习题3 证明AC=BC(AB)C=(AˉC)(BˉC)A\cap C = B \cap C\Leftrightarrow (\overline{A\cup B}) \cap C = (\bar{A} \cap C) \cup (\bar{B} \cap C)

Proof. 右侧(AˉBˉ)C=(AˉC)(BˉC)=(AˉC)(BˉC)(\bar{A} \cap \bar{B}) \cap C = (\bar{A} \cup C) \cap (\bar{B} \cap C) = (\bar{A} \cap C) \cup (\bar{B} \cap C)

引理. XY=XYX=YX \cup Y = X \cap Y \Leftrightarrow X = Y

subproof.XY=XYX \cup Y = X \cap Y,我们有XYX \subseteq YYXY \subseteq X,所以X=YX = Y。反过来,由X=YX = Y,我们有XY=XYX \cup Y = X \cap Y.

因此我们令X=(AˉC)X = (\bar{A} \cap C)Y=(BˉC)Y = (\bar{B} \cap C),则有(AˉC)(BˉC)=(AˉC)(BˉC)(\bar{A} \cap C) \cup (\bar{B} \cap C) = (\bar{A} \cap C) \cap (\bar{B} \cap C)当且仅当(AˉC)=(BˉC)(\bar{A} \cap C) = (\bar{B} \cap C).

我们注意到左侧AC=BCA \cap C = B \cap C, 则C(AC)=C(BC)C \setminus (A \cap C) = C \setminus (B \cap C),即(AˉC)=(BˉC)(\bar{A} \cap C) = (\bar{B} \cap C).

因此左右可以互推。

习题4 用集合列表示极限:{fn(x),x[0,1]},limnfn(x)0\{f_n(x), x\in [0,1]\}, \lim_{n\to \infty} f_n(x) \to 0

习题B组(组合学)

习题1 求将nn个小球放入N(n)N(\geq n)个盒子中,使得每个盒子最多放一个球的方案数。

这个问题很简单,我们可以反过来考虑,找出nn个盒子放入nn个小球的方案数。如果不保证每个盒子只有一个小球,总共有NnN^n次选择(假设盒子有标号),但是我们需要保证每个盒子最多放一个小球,因此我们需要从NN个盒子中选择nn个来放置小球,这有N!(Nn)!\frac{N!}{(N-n)!}种选择。因此概率为P(A)=PNnNnP(A) = \frac{P_{N}^n}{N^n}

习题2(生日悖论) 在一个班级中,如果有nn个学生,那么至少有两个人生日相同的概率为多少?

我们算反面,注意到这等价于上一题的放小球问题,因此至少有两个人生日相同的概率为P(A)=1365!(365n)!365nP(A) = 1 - \frac{365!}{(365-n)!365^n}

习题3(伯努利信件错配问题)nn封信和nn个信封,每封信都有一个对应的信封。每一个信件都送错的概率是?

习题4 若事件A,BA, B中只有一个发生的概率为0.3,且P(A)+P(B)=0.5P(A) + P(B) = 0.5,则它们至少有一个不发生的概率是?

由题意,P(ABAB)=0.3P(A \cup B - AB) = 0.3,即P(AB)P(AB)=0.3P(A \cup B) - P(AB) = 0.3

P(AB)=1P(AB)P(\overline{A} \cup \overline{B}) = 1 - P(AB),且P(AB)=0.5P(AB)P(AB)+P(AB)=0.5P(A\cup B) = 0.5 - P(AB) \Rightarrow P(A\cup B)+P(AB) = 0.5

从而我们可以解出P(AB)P(AB)。

1.2 独立事件与条件概率

独立事件是指两个事件之间没有任何关联,即一个事件的发生与另一个事件的发生没有任何关系。对于两个事件 AABB,如果满足以下条件,则称它们是独立的: P(AB)=P(A)P(B)P(AB) = P(A)P(B)

独立性是对于事件之间关系性质的描述,而不是事件本身的性质。一个事件可以是独立的,也可以是非独立的,这取决于它与其他事件之间的关系。

如果两个事件的独立关系并不确定,我们引入条件概率来描述事件之间的关系。对于事件 AABB,如果 P(B)>0P(B) > 0,则条件概率 P(AB)P(A|B) 定义为: P(AB)=P(AB)P(B)P(A|B) = \frac{P(AB)}{P(B)}

注: P(AB)=0P(A|B) = 0不代表事件 AABB 是独立的,因为此时表明P(AB)=0P(AB) = 0,但 P(A)P(B)P(A)P(B) 不一定为零。

定理:条件概率是概率测度。

证明:对于任意事件 AAP(AB)0P(A|B) \ge 0P(ΩB)=1P(\Omega|B) = 1;如果 A1,A2,A_1, A_2, \ldotsF\mathcal{F} 中的两两不交事件,则 P(i=1AiB)=P(i=1AiB)P(B)=i=1P(AiB)P(B)=i=1P(AiB)P\left(\bigcup_{i=1}^{\infty} A_i \Big| B\right) = \frac{P\left(\bigcup_{i=1}^{\infty} A_i B\right)}{P(B)} = \frac{\sum_{i=1}^{\infty} P(A_i B)}{P(B)} = \sum_{i=1}^{\infty} P(A_i | B)

因此,条件概率满足概率测度的定义。

1.2.1 全概率公式与贝叶斯定理

全概率公式是条件概率的一个重要应用,它描述了事件 AA 的概率可以通过事件 BiB_i 的条件概率来计算。设 {B1,B2,,Bn}\{B_1, B_2, \ldots, B_n\} 是一个事件的划分,即 BiB_i 之间两两不交且 i=1nBi=Ω\bigcup_{i=1}^n B_i = \Omega,则全概率公式为:

P(A)=i=1nP(ABi)P(Bi)P(A) = \sum_{i=1}^n P(A|B_i)P(B_i)

这个公式的证明是显然的:

证明: 注意到P(A)=P(AΩ)=P(Ai=1nBi)=i=1nP(ABi)P(A) = P(A \cap \Omega) = P\left(A \cap \bigcup_{i=1}^n B_i\right) = \sum_{i=1}^n P(AB_i),而P(ABi)=P(ABi)P(Bi)P(AB_i) = P(A|B_i)P(B_i),因此得到全概率公式。

利用全概率公式我们可以轻易得到贝叶斯公式:

P(BiA)=P(ABi)P(Bi)j=1nP(ABj)P(Bj)P(B_i|A) = \frac{P(A|B_i)P(B_i)}{\sum_{j=1}^n P(A|B_j)P(B_j)}

我们称P(ABi)P(A|B_i)似然函数P(Bi)P(B_i)先验概率P(BiA)P(B_i|A)后验概率。贝叶斯定理在统计推断中有着重要的应用,特别是在贝叶斯统计中,我们通过更新先验概率来得到后验概率,从而进行推断和决策。后验概率的含义是,在观察到事件 AA 发生之后,事件 BiB_i 发生的概率。通过贝叶斯定理,我们可以将新的信息(事件 AA 的发生)纳入我们的概率评估中,从而得到更准确的概率估计。

贝叶斯公式给出了条件概率对于一般概率的加权公式,这表明,我们可以利用多余的信息来提高我们对于概率的分解,从而对于概率的结构有更深入的理解。

1.2.3 两两独立(pairwise independent)与相互独立(mutually independent)

对于多个事件的独立性,我们需要区分两两独立和相互独立的概念。两两独立是指对于任意两个事件 AiA_iAjA_j,它们是独立的,即 P(AiAj)=P(Ai)P(Aj)P(A_i A_j) = P(A_i)P(A_j);而相互独立是指对于任意子集 {Ai1,Ai2,,Aik}\{A_{i_1}, A_{i_2}, \ldots, A_{i_k}\},它们是独立的,即 P(Ai1Ai2Aik)=P(Ai1)P(Ai2)P(Aik)P(A_{i_1} A_{i_2} \cdots A_{i_k}) = P(A_{i_1})P(A_{i_2}) \cdots P(A_{i_k})

1.2.4 独立事件的性质

定理:若AABB是独立事件,则Aˉ\bar{A}BB也是独立事件。

证明:由于AABB是独立事件,我们有P(AB)=P(A)P(B)P(AB) = P(A)P(B)。因此, P(AˉB)=P(B)P(AB)=P(B)P(A)P(B)=P(B)(1P(A))=P(Aˉ)P(B)P(\bar{A}B) = P(B) - P(AB) = P(B) - P(A)P(B) = P(B)(1 - P(A)) = P(\bar{A})P(B) 所以Aˉ\bar{A}BB是独立事件。

1.2.5 一些习题

习题1 P(i=1nAi)i=1nP(Ai)(n1)P(\bigcap_{i=1}^n A_i) \geq \sum_{i=1}^n P(A_i) - (n-1)

习题2 P(AB)P(A)P(B)14|P(AB) - P(A)P(B)| \leq \frac{1}{4}

习题3 P(A)=0.6,P(B)=0.7P(A) = 0.6, P(B) = 0.7, 求P(AB)P(AB)的范围。

习题4 圆排列:设6个人围成一圈,求至少有两个人相邻的概率。(如果旋转之后一致,那么认为相同)。

1.3 随机变量与概率分布

1.3.1 随机变量

随机变量是一个函数X:ΩRX: \Omega \to \mathbb{R},它将样本空间 Ω\Omega 中的每个样本点 ω\omega 映射到实数轴上的一个实数 X(ω)X(\omega)。随机变量的引入使得我们可以用数值来描述随机现象,从而便于进行数学分析和计算。

例如,在掷一枚骰子的试验中,样本空间 Ω={1,2,3,4,5,6}\Omega = \{1, 2, 3, 4, 5, 6\},我们可以定义一个随机变量 XX 表示掷出的点数,即 X(ω)=ωX(\omega) = \omega。这样,我们就可以用数值来描述掷骰子的结果了。

随机变量可以分为离散型和连续型两种类型。离散型随机变量取值为有限个或可数无限个;连续型随机变量取值为某个区间上的所有实数。

我们发现,我们前面给出的Borel集的定义是为了确保随机变量是可测函数。

可测函数: 随机变量被定义为在Borel集上的可测函数,这意味着对于任意的Borel集 BB,保证了{ωX(ω)B}F\{\omega| X(\omega) \in B\} \in \mathcal{F},从而使得P(XB)P(X\in B)总是存在概率。如果XX不可测,那么累计分布函数可能无法定义、期望(XdP\int X \mathrm{d}P)可能不可积。

1.3.2 概率分布

累计分布函数

定义了随机变量之后,我们可以考虑其累计分布函数(CDF)和概率分布。累计分布函数 F(x)F(x) 定义为 F(x)=P(Xx)F(x) = P(X \le x),它描述了随机变量 XX 取值小于或等于 xx 的概率。

累计分布函数具有以下基本性质:

  1. 单调不减性:若 x1<x2x_1 < x_2,则 F(x1)F(x2)F(x_1) \le F(x_2)
  2. 右连续性limxx0+F(x)=F(x0)\lim_{x \to x_0^+} F(x) = F(x_0)
  3. 极限性质limxF(x)=0\lim_{x \to -\infty} F(x) = 0limx+F(x)=1\lim_{x \to +\infty} F(x) = 1

这些性质使得累计分布函数成为描述随机变量行为的强大工具。通过CDF,我们可以计算任意区间内的概率:P(a<Xb)=F(b)F(a)P(a < X \le b) = F(b) - F(a)

概率质量函数和概率密度函数

随机变量的概率分布描述了随机变量取不同值的概率情况。对于离散型随机变量,我们用概率质量函数(PMF)来描述其分布;对于连续型随机变量,我们用概率密度函数(PDF)来描述其分布。

离散型随机变量的概率质量函数: 对于离散型随机变量 XX,其概率质量函数 p(x)p(x) 定义为 p(x)=P(X=x)p(x) = P(X = x),满足 xp(x)=1\sum_{x} p(x) = 1

连续型随机变量的概率密度函数: 对于连续型随机变量 XX,其概率密度函数 f(x)f(x) 定义为满足 P(aXb)=abf(x)dxP(a \le X \le b) = \int_a^b f(x) \mathrm{d}x 的函数,且满足 f(x)dx=1\int_{-\infty}^{\infty} f(x) \mathrm{d}x = 1

注: 注意区分概率密度函数与概率测度——P:F[0,1]P:\mathcal{F} \to [0,1],而 f:R[0,)f: \mathbb{R} \to [0, \infty) 是一个函数,它不是概率测度,但可以通过积分得到概率测度。

对于连续型随机变量,需要注意 P(X=x)=0P(X = x) = 0 对任意单点成立,这与离散型情况有本质区别。概率密度函数 f(x)f(x) 在某点的值并不代表概率,而是概率的”密度”,只有经过积分后才能得到实际概率。

1.3.3 常见的离散分布

离散型随机变量在实际应用中非常常见,下面介绍几种重要的离散分布。

伯努利分布(Bernoulli Distribution)

伯努利分布是最简单的离散分布,描述只有两种可能结果的随机试验。

定义:若随机变量 XX 只取 0 和 1 两个值,且 P(X=1)=pP(X=1) = pP(X=0)=1pP(X=0) = 1-p,其中 0p10 \le p \le 1,则称 XX 服从参数为 pp 的伯努利分布,记为 XBernoulli(p)X \sim \text{Bernoulli}(p)

伯努利分布的期望和方差分别为:E[X]=pE[X] = pVar(X)=p(1p)\text{Var}(X) = p(1-p)

例子:抛一枚硬币,正面朝上记为 1,反面朝上记为 0。若硬币公平,则 p=0.5p = 0.5,服从伯努利分布。

二项分布(Binomial Distribution)

二项描述 nn 次独立伯努利试验中成功次数的分布。

定义:设 XXnn 次独立伯努利试验中成功的次数,每次成功概率为 pp,则 XX 的概率质量函数为: P(X=k)=(nk)pk(1p)nk,k=0,1,,nP(X = k) = \binom{n}{k} p^k (1-p)^{n-k}, \quad k = 0, 1, \ldots, nXX 服从参数为 (n,p)(n, p) 的二项分布,记为 XBinomial(n,p)X \sim \text{Binomial}(n, p)

二项分布的期望和方差:E[X]=npE[X] = npVar(X)=np(1p)\text{Var}(X) = np(1-p)

例子:连续抛掷 10 枚公平硬币,正面朝上的次数服从 Binomial(10,0.5)\text{Binomial}(10, 0.5) 分布。

泊松分布(Poisson Distribution)

泊松分布常用于描述单位时间或单位空间内随机事件发生次数的分布。

定义:若随机变量 XX 的概率质量函数为: P(X=k)=λkeλk!,k=0,1,2,P(X = k) = \frac{\lambda^k e^{-\lambda}}{k!}, \quad k = 0, 1, 2, \ldots 其中 λ>0\lambda > 0 为参数,则称 XX 服从参数为 λ\lambda 的泊松分布,记为 XPoisson(λ)X \sim \text{Poisson}(\lambda)

泊松分布的期望和方差相等:E[X]=Var(X)=λE[X] = \text{Var}(X) = \lambda

泊松分布与二项分布的关系:当 nn 很大且 pp 很小时,二项分布 Binomial(n,p)\text{Binomial}(n, p) 可以用泊松分布 Poisson(np)\text{Poisson}(np) 近似。具体来说,若 nn \to \inftyp0p \to 0,且 npλnp \to \lambda,则: (nk)pk(1p)nkλkeλk!\binom{n}{k} p^k (1-p)^{n-k} \approx \frac{\lambda^k e^{-\lambda}}{k!}

例子:某客服中心每小时平均接到 4 通电话,则一小时内接到的电话数服从 Poisson(4)\text{Poisson}(4) 分布。

几何分布(Geometric Distribution)

几何分布描述在独立伯努利试验中首次成功所需的试验次数。

定义:设 XX 为首次成功所需的试验次数,每次成功概率为 pp,则: P(X=k)=(1p)k1p,k=1,2,P(X = k) = (1-p)^{k-1} p, \quad k = 1, 2, \ldotsXX 服从参数为 pp 的几何分布,记为 XGeometric(p)X \sim \text{Geometric}(p)

几何分布具有无记忆性:P(X>m+nX>m)=P(X>n)P(X > m + n | X > m) = P(X > n)

期望和方差E[X]=1pE[X] = \frac{1}{p}Var(X)=1pp2\text{Var}(X) = \frac{1-p}{p^2}

负二项分布(Negative Binomial Distribution)

负二项分布是几何分布的推广,描述获得 rr 次成功所需的试验次数。

定义:设 XX 为获得 rr 次成功所需的试验次数,则: P(X=k)=(k1r1)pr(1p)kr,k=r,r+1,P(X = k) = \binom{k-1}{r-1} p^r (1-p)^{k-r}, \quad k = r, r+1, \ldots

r=1r = 1 时,负二项分布退化为几何分布。

1.3.4 常见的连续分布

连续型随机变量在实际应用中同样重要,下面介绍几种核心的连续分布。

均匀分布(Uniform Distribution)

均匀分布描述在区间内每个点等可能取值的随机变量。

定义:若随机变量 XX 在区间 [a,b][a, b] 上的概率密度函数为: f(x)={1ba,axb0,其他f(x) = \begin{cases} \frac{1}{b-a}, & a \le x \le b \\ 0, & \text{其他} \end{cases} 则称 XX 服从 [a,b][a, b] 上的均匀分布,记为 XUniform(a,b)X \sim \text{Uniform}(a, b)

均匀分布的期望和方差:E[X]=a+b2E[X] = \frac{a+b}{2}Var(X)=(ba)212\text{Var}(X) = \frac{(b-a)^2}{12}

例子:在 [0,1][0, 1] 区间随机取一点,该点的坐标服从 Uniform(0,1)\text{Uniform}(0, 1) 分布。

正态分布(Normal/Gaussian Distribution)

正态分布是概率论中最重要的分布,在自然界和社会现象中广泛存在。

定义:若随机变量 XX 的概率密度函数为: f(x)=12πσexp((xμ)22σ2),<x<+f(x) = \frac{1}{\sqrt{2\pi}\sigma} \exp\left(-\frac{(x-\mu)^2}{2\sigma^2}\right), \quad -\infty < x < +\infty 其中 μR\mu \in \mathbb{R}σ>0\sigma > 0,则称 XX 服从参数为 (μ,σ2)(\mu, \sigma^2) 的正态分布,记为 XN(μ,σ2)X \sim N(\mu, \sigma^2)

正态分布的期望和方差:E[X]=μE[X] = \muVar(X)=σ2\text{Var}(X) = \sigma^2

标准正态分布:当 μ=0\mu = 0σ=1\sigma = 1 时,称为标准正态分布,记为 ZN(0,1)Z \sim N(0, 1)。其概率密度函数为: ϕ(z)=12πez22\phi(z) = \frac{1}{\sqrt{2\pi}} e^{-\frac{z^2}{2}} 任何正态分布都可以通过标准化变换转化为标准正态分布:若 XN(μ,σ2)X \sim N(\mu, \sigma^2),则 Z=XμσN(0,1)Z = \frac{X-\mu}{\sigma} \sim N(0, 1)

例子:人的身高、测量误差、考试成绩等往往近似服从正态分布。

指数分布(Exponential Distribution)

指数分布常用于描述独立随机事件发生的时间间隔。

定义:若随机变量 XX 的概率密度函数为: f(x)={λeλx,x00,x<0f(x) = \begin{cases} \lambda e^{-\lambda x}, & x \ge 0 \\ 0, & x < 0 \end{cases} 其中 λ>0\lambda > 0,则称 XX 服从参数为 λ\lambda 的指数分布,记为 XExp(λ)X \sim \text{Exp}(\lambda)

指数分布的期望和方差:E[X]=1λE[X] = \frac{1}{\lambda}Var(X)=1λ2\text{Var}(X) = \frac{1}{\lambda^2}

无记忆性:指数分布与几何分布类似,具有无记忆性: P(X>s+tX>s)=P(X>t),s,t>0P(X > s + t | X > s) = P(X > t), \quad \forall s, t > 0 这使得指数分布在可靠性理论和排队论中有重要应用。

与泊松分布的关系:若单位时间内某事件发生的次数服从泊松分布,则事件发生的间隔时间服从指数分布。

伽马分布(Gamma Distribution)

伽马分布是指数分布的推广,描述多个独立指数分布随机变量之和的分布。

定义:若随机变量 XX 的概率密度函数为: f(x)={λαΓ(α)xα1eλx,x>00,x0f(x) = \begin{cases} \frac{\lambda^\alpha}{\Gamma(\alpha)} x^{\alpha-1} e^{-\lambda x}, & x > 0 \\ 0, & x \le 0 \end{cases} 其中 α>0\alpha > 0 为形状参数,λ>0\lambda > 0 为率参数,Γ(α)\Gamma(\alpha) 为伽马函数,则称 XX 服从伽马分布,记为 XΓ(α,λ)X \sim \Gamma(\alpha, \lambda)

伽马函数Γ(α)=0tα1etdt\Gamma(\alpha) = \int_0^\infty t^{\alpha-1} e^{-t} \mathrm{d}t,满足 Γ(n)=(n1)!\Gamma(n) = (n-1)!(当 nn 为正整数)。

伽马分布的期望和方差:E[X]=αλE[X] = \frac{\alpha}{\lambda}Var(X)=αλ2\text{Var}(X) = \frac{\alpha}{\lambda^2}

α=1\alpha = 1 时,伽马分布退化为指数分布。

卡方分布(Chi-Square Distribution)

卡方分布是伽马分布的特例,在统计推断中非常重要。

定义:若 Z1,Z2,,ZnZ_1, Z_2, \ldots, Z_n 是独立同分布的标准正态随机变量,则: X=Z12+Z22++Zn2X = Z_1^2 + Z_2^2 + \cdots + Z_n^2 服从自由度为 nn 的卡方分布,记为 Xχ2(n)X \sim \chi^2(n)

卡方分布是 Γ(n2,12)\Gamma(\frac{n}{2}, \frac{1}{2}) 的特例。其期望和方差:E[X]=nE[X] = nVar(X)=2n\text{Var}(X) = 2n

tt 分布(Student’s t-Distribution)

tt 分布在小样本统计推断中具有重要作用。

定义:设 ZN(0,1)Z \sim N(0, 1)Uχ2(n)U \sim \chi^2(n),且 ZZUU 独立,则: T=ZU/nT = \frac{Z}{\sqrt{U/n}} 服从自由度为 nntt 分布,记为 Tt(n)T \sim t(n)

tt 分布的概率密度函数为: f(t)=Γ(n+12)nπΓ(n2)(1+t2n)n+12f(t) = \frac{\Gamma(\frac{n+1}{2})}{\sqrt{n\pi} \Gamma(\frac{n}{2})} \left(1 + \frac{t^2}{n}\right)^{-\frac{n+1}{2}}

nn \to \infty 时,tt 分布趋近于标准正态分布。

FF 分布(F-Distribution)

FF 分布在方差分析和回归分析中广泛应用。

定义:设 Uχ2(m)U \sim \chi^2(m)Vχ2(n)V \sim \chi^2(n),且 UUVV 独立,则: F=U/mV/nF = \frac{U/m}{V/n} 服从自由度为 (m,n)(m, n)FF 分布,记为 FF(m,n)F \sim F(m, n)

FF 分布与 tt 分布的关系:若 Tt(n)T \sim t(n),则 T2F(1,n)T^2 \sim F(1, n)

1.4 期望、方差、协方差与矩

数字特征是描述随机变量分布特性的重要指标,它们提供了分布的简洁概括。

1.4.1 期望

期望(或均值)是随机变量取值的加权平均,权重为相应的概率。

定义:设 XX 为随机变量:

  • XX 为离散型,P(X=xi)=piP(X = x_i) = p_i,则 E[X]=ixipiE[X] = \sum_i x_i p_i(要求 ixipi<\sum_i |x_i| p_i < \infty)。
  • XX 为连续型,概率密度函数为 f(x)f(x),则 E[X]=xf(x)dxE[X] = \int_{-\infty}^{\infty} x f(x) \mathrm{d}x(要求 xf(x)dx<\int_{-\infty}^{\infty} |x| f(x) \mathrm{d}x < \infty)。

期望具有以下重要性质:

  1. 线性性E[aX+b]=aE[X]+bE[aX + b] = aE[X] + b,其中 a,ba, b 为常数。
  2. 可加性E[X+Y]=E[X]+E[Y]E[X + Y] = E[X] + E[Y],无论 XXYY 是否独立。
  3. 独立性下的乘积性:若 XXYY 独立,则 E[XY]=E[X]E[Y]E[XY] = E[X]E[Y]

函数的期望( LOTUS 法则):设 Y=g(X)Y = g(X),则:

  • 离散型:E[Y]=ig(xi)piE[Y] = \sum_i g(x_i) p_i
  • 连续型:E[Y]=g(x)f(x)dxE[Y] = \int_{-\infty}^{\infty} g(x) f(x) \mathrm{d}x 无需先求 YY 的分布,直接利用 XX 的分布即可计算。

1.4.2 方差

方差度量随机变量取值与其期望的偏离程度。

定义:随机变量 XX 的方差定义为: Var(X)=E[(XE[X])2]=E[X2](E[X])2\text{Var}(X) = E[(X - E[X])^2] = E[X^2] - (E[X])^2 标准差定义为 σX=Var(X)\sigma_X = \sqrt{\text{Var}(X)}

方差的性质:

  1. Var(X)0\text{Var}(X) \ge 0,且 Var(X)=0\text{Var}(X) = 0 当且仅当 XX 以概率 1 取常数值。
  2. Var(aX+b)=a2Var(X)\text{Var}(aX + b) = a^2 \text{Var}(X)
  3. XXYY 独立,则 Var(X+Y)=Var(X)+Var(Y)\text{Var}(X + Y) = \text{Var}(X) + \text{Var}(Y)

切比雪夫不等式:对于任意 ε>0\varepsilon > 0,有: P(XE[X]ε)Var(X)ε2P(|X - E[X]| \ge \varepsilon) \le \frac{\text{Var}(X)}{\varepsilon^2} 这个不等式给出了偏离均值的概率上界,在证明大数定律中有重要应用。

1.4.3 协方差与相关系数

协方差度量两个随机变量之间的线性关联程度。

定义:随机变量 XXYY 的协方差定义为: Cov(X,Y)=E[(XE[X])(YE[Y])]=E[XY]E[X]E[Y]\text{Cov}(X, Y) = E[(X - E[X])(Y - E[Y])] = E[XY] - E[X]E[Y]

协方差的性质:

  1. 对称性:Cov(X,Y)=Cov(Y,X)\text{Cov}(X, Y) = \text{Cov}(Y, X)
  2. 双线性:Cov(aX+b,cY+d)=acCov(X,Y)\text{Cov}(aX + b, cY + d) = ac \cdot \text{Cov}(X, Y)
  3. XXYY 独立,则 Cov(X,Y)=0\text{Cov}(X, Y) = 0(但反之不成立)。
  4. 方差公式:Var(X+Y)=Var(X)+Var(Y)+2Cov(X,Y)\text{Var}(X + Y) = \text{Var}(X) + \text{Var}(Y) + 2\text{Cov}(X, Y)

相关系数是标准化后的协方差,消除了量纲的影响。

定义XXYY 的相关系数定义为: ρXY=Cov(X,Y)σXσY\rho_{XY} = \frac{\text{Cov}(X, Y)}{\sigma_X \sigma_Y} 其中 σX=Var(X)\sigma_X = \sqrt{\text{Var}(X)}σY=Var(Y)\sigma_Y = \sqrt{\text{Var}(Y)}

相关系数的性质:

  1. 1ρXY1-1 \le \rho_{XY} \le 1
  2. ρXY=1|\rho_{XY}| = 1 当且仅当 XXYY 之间存在线性关系:Y=aX+bY = aX + b(几乎必然)。
  3. ρXY=0\rho_{XY} = 0 表示 XXYY 不相关(无线性相关),但可能有非线性关系。

注意:独立一定不相关,但不相关不一定独立。例如,设 XUniform(1,1)X \sim \text{Uniform}(-1, 1)Y=X2Y = X^2,则 Cov(X,Y)=0\text{Cov}(X, Y) = 0,但 XXYY 显然不独立。

1.4.4 矩

矩是期望概念的推广,可以描述分布的更多特征。

定义:随机变量 XXkk 阶原点矩定义为 μk=E[Xk]\mu_k' = E[X^k]kk 阶中心矩定义为 μk=E[(XE[X])k]\mu_k = E[(X - E[X])^k]

特别地:

  • 一阶原点矩 μ1=E[X]\mu_1' = E[X] 就是期望。
  • 二阶中心矩 μ2=Var(X)\mu_2 = \text{Var}(X) 就是方差。

偏度(Skewness):三阶标准化矩,度量分布的不对称性: γ1=μ3σ3=E[(Xμ)3](Var(X))3/2\gamma_1 = \frac{\mu_3}{\sigma^3} = \frac{E[(X - \mu)^3]}{(\text{Var}(X))^{3/2}}

  • γ1=0\gamma_1 = 0:对称分布(如正态分布)。
  • γ1>0\gamma_1 > 0:右偏(长尾在右)。
  • γ1<0\gamma_1 < 0:左偏(长尾在左)。

峰度(Kurtosis):四阶标准化矩,度量分布的尾部厚重程度: γ2=μ4σ43=E[(Xμ)4](Var(X))23\gamma_2 = \frac{\mu_4}{\sigma^4} - 3 = \frac{E[(X - \mu)^4]}{(\text{Var}(X))^2} - 3 减去 3 是为了使正态分布的峰度为 0(超值峰度)。

  • γ2>0\gamma_2 > 0:比正态分布更尖峰厚尾。
  • γ2<0\gamma_2 < 0:比正态分布更平峰薄尾。

1.5 多维随机变量与联合分布

在实际问题中,我们经常需要同时考虑多个随机变量,这就引入了多维随机变量的概念。

1.5.1 多维随机变量

定义:设 X1,X2,,XnX_1, X_2, \ldots, X_n 是定义在同一样本空间 Ω\Omega 上的 nn 个随机变量,则称向量 X=(X1,X2,,Xn)\mathbf{X} = (X_1, X_2, \ldots, X_n)nn 维随机向量或 nn 维随机变量。

多维随机变量的研究重点在于描述各分量之间的相互关系,这通过联合分布来实现。

1.5.2 联合分布

联合累计分布函数

定义nn 维随机变量 X=(X1,,Xn)\mathbf{X} = (X_1, \ldots, X_n) 的联合累计分布函数定义为: F(x1,,xn)=P(X1x1,,Xnxn)F(x_1, \ldots, x_n) = P(X_1 \le x_1, \ldots, X_n \le x_n)

对于二维情况 (X,Y)(X, Y),联合CDF F(x,y)=P(Xx,Yy)F(x, y) = P(X \le x, Y \le y) 具有以下性质:

  1. 0F(x,y)10 \le F(x, y) \le 1
  2. F(x,y)F(x, y) 对每个变量都是单调不减的。
  3. F(,y)=F(x,)=0F(-\infty, y) = F(x, -\infty) = 0F(+,+)=1F(+\infty, +\infty) = 1
  4. 对任意 x1<x2x_1 < x_2y1<y2y_1 < y_2,有: P(x1<Xx2,y1<Yy2)=F(x2,y2)F(x2,y1)F(x1,y2)+F(x1,y1)0P(x_1 < X \le x_2, y_1 < Y \le y_2) = F(x_2, y_2) - F(x_2, y_1) - F(x_1, y_2) + F(x_1, y_1) \ge 0
联合概率质量函数与联合概率密度函数

对于离散型随机变量:

联合PMFp(x,y)=P(X=x,Y=y)p(x, y) = P(X = x, Y = y),满足 xyp(x,y)=1\sum_x \sum_y p(x, y) = 1

对于连续型随机变量:

联合PDF:函数 f(x,y)f(x, y) 满足: P((X,Y)D)=Df(x,y)dxdyP((X, Y) \in D) = \iint_D f(x, y) \mathrm{d}x \mathrm{d}yf(x,y)0f(x, y) \ge 0f(x,y)dxdy=1\int_{-\infty}^{\infty} \int_{-\infty}^{\infty} f(x, y) \mathrm{d}x \mathrm{d}y = 1

在点 (x,y)(x, y) 处,联合PDF可以看作概率的”面密度”: f(x,y)=2F(x,y)xyf(x, y) = \frac{\partial^2 F(x, y)}{\partial x \partial y}

独立性

定义:随机变量 XXYY 独立,当且仅当:

  • 离散型:p(x,y)=pX(x)pY(y)p(x, y) = p_X(x) \cdot p_Y(y) 对所有 (x,y)(x, y) 成立。
  • 连续型:f(x,y)=fX(x)fY(y)f(x, y) = f_X(x) \cdot f_Y(y) 对所有 (x,y)(x, y) 成立。
  • 统一表述:F(x,y)=FX(x)FY(y)F(x, y) = F_X(x) \cdot F_Y(y) 对所有 x,yx, y 成立。

独立性意味着一个随机变量的取值不影响另一个随机变量的分布。对于独立随机变量,有 E[XY]=E[X]E[Y]E[XY] = E[X]E[Y]Var(X+Y)=Var(X)+Var(Y)\text{Var}(X + Y) = \text{Var}(X) + \text{Var}(Y)

1.5.3 边缘分布与条件分布

边缘分布

从联合分布可以得到单个随机变量的分布,称为边缘分布。

离散型边缘PMFpX(x)=yp(x,y),pY(y)=xp(x,y)p_X(x) = \sum_y p(x, y), \quad p_Y(y) = \sum_x p(x, y)

连续型边缘PDFfX(x)=f(x,y)dy,fY(y)=f(x,y)dxf_X(x) = \int_{-\infty}^{\infty} f(x, y) \mathrm{d}y, \quad f_Y(y) = \int_{-\infty}^{\infty} f(x, y) \mathrm{d}x

边缘分布描述了单个随机变量的分布特性,但丢失了与其他变量的关系信息。

条件分布

条件分布描述在给定一个随机变量取值的条件下,另一个随机变量的分布。

离散型条件PMFpXY(xy)=P(X=xY=y)=p(x,y)pY(y),pY(y)>0p_{X|Y}(x|y) = P(X = x | Y = y) = \frac{p(x, y)}{p_Y(y)}, \quad p_Y(y) > 0

连续型条件PDFfXY(xy)=f(x,y)fY(y),fY(y)>0f_{X|Y}(x|y) = \frac{f(x, y)}{f_Y(y)}, \quad f_Y(y) > 0

条件分布满足概率分布的所有性质。例如,对于连续型: P(aXbY=y)=abfXY(xy)dxP(a \le X \le b | Y = y) = \int_a^b f_{X|Y}(x|y) \mathrm{d}x

乘法公式

  • 离散型:p(x,y)=pXY(xy)pY(y)=pYX(yx)pX(x)p(x, y) = p_{X|Y}(x|y) \cdot p_Y(y) = p_{Y|X}(y|x) \cdot p_X(x)
  • 连续型:f(x,y)=fXY(xy)fY(y)=fYX(yx)fX(x)f(x, y) = f_{X|Y}(x|y) \cdot f_Y(y) = f_{Y|X}(y|x) \cdot f_X(x)

这给出了联合分布、边缘分布和条件分布之间的关系。

条件期望与全期望公式

条件期望:给定 Y=yY = y 时,XX 的条件期望为:

  • 离散型:E[XY=y]=xxpXY(xy)E[X | Y = y] = \sum_x x \cdot p_{X|Y}(x|y)
  • 连续型:E[XY=y]=xfXY(xy)dxE[X | Y = y] = \int_{-\infty}^{\infty} x \cdot f_{X|Y}(x|y) \mathrm{d}x

条件期望 E[XY]E[X | Y] 本身是 YY 的函数,也是一个随机变量。

全期望公式(迭代期望法则)E[X]=E[E[XY]]E[X] = E[E[X | Y]] 具体地:

  • 离散型:E[X]=yE[XY=y]pY(y)E[X] = \sum_y E[X | Y = y] \cdot p_Y(y)
  • 连续型:E[X]=E[XY=y]fY(y)dyE[X] = \int_{-\infty}^{\infty} E[X | Y = y] \cdot f_Y(y) \mathrm{d}y

全期望公式在计算复杂期望时非常有用,可以先固定一个变量进行条件期望计算,再对该变量求期望。

1.5.4 多维正态分布

多维正态分布是单变量正态分布在多维情形的推广,在统计学和机器学习中具有核心地位。

定义:设 μ=(μ1,,μn)TRn\boldsymbol{\mu} = (\mu_1, \ldots, \mu_n)^T \in \mathbb{R}^nΣ\boldsymbol{\Sigma}n×nn \times n 正定对称矩阵。若随机向量 X=(X1,,Xn)T\mathbf{X} = (X_1, \ldots, X_n)^T 的联合概率密度函数为: f(x)=1(2π)n/2Σ1/2exp(12(xμ)TΣ1(xμ))f(\mathbf{x}) = \frac{1}{(2\pi)^{n/2} |\boldsymbol{\Sigma}|^{1/2}} \exp\left(-\frac{1}{2}(\mathbf{x} - \boldsymbol{\mu})^T \boldsymbol{\Sigma}^{-1} (\mathbf{x} - \boldsymbol{\mu})\right) 则称 X\mathbf{X} 服从 nn 维正态分布,记为 XNn(μ,Σ)\mathbf{X} \sim N_n(\boldsymbol{\mu}, \boldsymbol{\Sigma})

其中 μ\boldsymbol{\mu} 是均值向量,Σ\boldsymbol{\Sigma} 是协方差矩阵: Σ=(σ11σ12σ1nσ21σ22σ2nσn1σn2σnn)\boldsymbol{\Sigma} = \begin{pmatrix} \sigma_{11} & \sigma_{12} & \cdots & \sigma_{1n} \\ \sigma_{21} & \sigma_{22} & \cdots & \sigma_{2n} \\ \vdots & \vdots & \ddots & \vdots \\ \sigma_{n1} & \sigma_{n2} & \cdots & \sigma_{nn} \end{pmatrix} 其中 σij=Cov(Xi,Xj)\sigma_{ij} = \text{Cov}(X_i, X_j)σii=Var(Xi)=σi2\sigma_{ii} = \text{Var}(X_i) = \sigma_i^2

多维正态分布的重要性质:

  1. 边缘分布仍为正态:每个分量 XiN(μi,σii)X_i \sim N(\mu_i, \sigma_{ii})
  2. 不相关等价于独立:对于多维正态分布,XiX_iXjX_j 不相关当且仅当它们独立。
  3. 线性变换不变性:若 XNn(μ,Σ)\mathbf{X} \sim N_n(\boldsymbol{\mu}, \boldsymbol{\Sigma})A\mathbf{A}m×nm \times n 矩阵,bRm\mathbf{b} \in \mathbb{R}^m,则: Y=AX+bNm(Aμ+b,AΣAT)\mathbf{Y} = \mathbf{A}\mathbf{X} + \mathbf{b} \sim N_m(\mathbf{A}\boldsymbol{\mu} + \mathbf{b}, \mathbf{A}\boldsymbol{\Sigma}\mathbf{A}^T)
  4. 条件分布仍为正态:在给定部分分量的条件下,其余分量的条件分布也是正态分布。

二维正态分布是常见的特例。设 (X,Y)N2(μ1,μ2,σ12,σ22,ρ)(X, Y) \sim N_2(\mu_1, \mu_2, \sigma_1^2, \sigma_2^2, \rho),其中 ρ\rho 是相关系数,则:

条件分布XY=yN(μ1+ρσ1σ2(yμ2),σ12(1ρ2))X | Y = y \sim N\left(\mu_1 + \rho\frac{\sigma_1}{\sigma_2}(y - \mu_2), \sigma_1^2(1 - \rho^2)\right)

条件期望 E[XY=y]=μ1+ρσ1σ2(yμ2)E[X | Y = y] = \mu_1 + \rho\frac{\sigma_1}{\sigma_2}(y - \mu_2)yy 的线性函数,这是正态分布的重要特征。

1.6 大数定律与中心极限定理

大数定律和中心极限定理是概率论中最重要的极限定理,它们描述了随机变量序列在大量试验下的渐近行为。

1.6.1 依概率收敛(XnPXX_n \overset{P}{\to} X)与几乎处处收敛(a.s.)

在讨论极限定理之前,我们需要明确随机变量序列收敛的含义。

依概率收敛:设 {Xn}\{X_n\} 是随机变量序列,XX 是随机变量。若对任意 ε>0\varepsilon > 0,有: limnP(XnXε)=0\lim_{n \to \infty} P(|X_n - X| \ge \varepsilon) = 0 则称 XnX_n 依概率收敛于 XX,记为 XnPXX_n \overset{P}{\to} X

依概率收敛意味着当 nn 足够大时,XnX_nXX 的差距超过任意给定阈值的概率趋于零。

几乎处处收敛(以概率 1 收敛):若: P(limnXn=X)=1P\left(\lim_{n \to \infty} X_n = X\right) = 1 或等价地: P(ω:limnXn(ω)=X(ω))=1P\left(\omega: \lim_{n \to \infty} X_n(\omega) = X(\omega)\right) = 1 则称 XnX_n 几乎处处收敛于 XX,记为 Xna.s.XX_n \overset{a.s.}{\to} XXnXX_n \to X a.s.。

几乎处处收敛是更强的收敛形式:对几乎所有的样本点,序列都收敛。

关系:几乎处处收敛蕴含依概率收敛,但反之不成立。

1.6.2 弱大数定律

弱大数定律(Weak Law of Large Numbers, WLLN)描述了样本均值依概率收敛于期望值。

定理(切比雪夫弱大数定律):设 {Xn}\{X_n\} 是两两不相关的随机变量序列,E[Xi]=μE[X_i] = \muVar(Xi)C\text{Var}(X_i) \le C(方差有界)。令 Xˉn=1ni=1nXi\bar{X}_n = \frac{1}{n}\sum_{i=1}^n X_i,则: XˉnPμ\bar{X}_n \overset{P}{\to} \mu

证明:首先计算 Xˉn\bar{X}_n 的期望和方差: E[Xˉn]=1ni=1nE[Xi]=μE[\bar{X}_n] = \frac{1}{n}\sum_{i=1}^n E[X_i] = \mu 由于两两不相关: Var(Xˉn)=1n2i=1nVar(Xi)nCn2=Cn\text{Var}(\bar{X}_n) = \frac{1}{n^2}\sum_{i=1}^n \text{Var}(X_i) \le \frac{nC}{n^2} = \frac{C}{n} 由切比雪夫不等式: P(Xˉnμε)Var(Xˉn)ε2Cnε20(n)P(|\bar{X}_n - \mu| \ge \varepsilon) \le \frac{\text{Var}(\bar{X}_n)}{\varepsilon^2} \le \frac{C}{n\varepsilon^2} \to 0 \quad (n \to \infty)

更一般的弱大数定律不需要方差存在的条件:

定理(辛钦弱大数定律):设 {Xn}\{X_n\} 是独立同分布(i.i.d.)的随机变量序列,E[X1]=μE[X_1] = \mu 存在,则: XˉnPμ\bar{X}_n \overset{P}{\to} \mu

弱大数定律为频率学派的概率解释提供了理论基础:事件发生的频率依概率收敛于其理论概率。

1.6.3 强大数定律

强大数定律(Strong Law of Large Numbers, SLLN)是更强的结果,描述了样本均值几乎处处收敛于期望值。

定理(科尔莫戈罗夫强大数定律):设 {Xn}\{X_n\} 是独立同分布的随机变量序列,则: Xˉna.s.μ\bar{X}_n \overset{a.s.}{\to} \mu 当且仅当 E[X1]<E[|X_1|] < \infty,此时 μ=E[X1]\mu = E[X_1]

强大数定律表明,对于几乎所有样本路径,样本均值都会收敛到期望值。这比弱大数定律”更强的概率趋于目标”更加确定。

中心极限定理(Central Limit Theorem, CLT)

虽然不在小节标题中,但中心极限定理是与大数定律并列的核心极限定理,必须提及。

定理(林德伯格-列维中心极限定理):设 {Xn}\{X_n\} 是独立同分布的随机变量序列,E[X1]=μE[X_1] = \muVar(X1)=σ2<\text{Var}(X_1) = \sigma^2 < \infty。令 Xˉn=1ni=1nXi\bar{X}_n = \frac{1}{n}\sum_{i=1}^n X_i,则: Xˉnμσ/n=i=1nXinμnσdN(0,1)\frac{\bar{X}_n - \mu}{\sigma/\sqrt{n}} = \frac{\sum_{i=1}^n X_i - n\mu}{\sqrt{n}\sigma} \overset{d}{\to} N(0, 1) 即对任意 xRx \in \mathbb{R}limnP(Xˉnμσ/nx)=Φ(x)\lim_{n \to \infty} P\left(\frac{\bar{X}_n - \mu}{\sigma/\sqrt{n}} \le x\right) = \Phi(x) 其中 Φ(x)\Phi(x) 是标准正态分布的CDF。

中心极限定理揭示了正态分布的普遍性:无论原始分布是什么(只要方差有限),大量独立随机变量之和的标准化形式都渐近服从正态分布。这解释了为什么正态分布在自然界和统计学中如此普遍。

注: 记号 d\overset{d}{\to} 表示依分布收敛,即分布函数逐点收敛(在连续点)。

1.7 特征函数

特征函数是研究随机变量分布和极限定理的重要工具,它本质上是随机变量的傅里叶变换。

1.7.1 定义与性质

定义:随机变量 XX 的特征函数定义为: φX(t)=E[eitX]={xeitxp(x),离散型eitxf(x)dx,连续型\varphi_X(t) = E[e^{itX}] = \begin{cases} \sum_x e^{itx} p(x), & \text{离散型} \\ \int_{-\infty}^{\infty} e^{itx} f(x) \mathrm{d}x, & \text{连续型} \end{cases} 其中 i=1i = \sqrt{-1}tRt \in \mathbb{R}

由于 eitX=1|e^{itX}| = 1,特征函数对所有随机变量都存在(包括没有矩的随机变量如柯西分布)。

特征函数的基本性质:

  1. φ(0)=1\varphi(0) = 1φ(t)1|\varphi(t)| \le 1
  2. φ(t)=φ(t)\varphi(-t) = \overline{\varphi(t)}(共轭对称性)。
  3. φ(t)\varphi(t)R\mathbb{R} 上一致连续。
  4. XXYY 独立,则 φX+Y(t)=φX(t)φY(t)\varphi_{X+Y}(t) = \varphi_X(t) \cdot \varphi_Y(t)
  5. Y=aX+bY = aX + b,则 φY(t)=eitbφX(at)\varphi_Y(t) = e^{itb} \varphi_X(at)

特征函数与矩的关系:

定理:若 E[Xk]<E[|X|^k] < \infty,则 φ(t)\varphi(t)t=0t = 0kk 次可导,且: φ(k)(0)=ikE[Xk]\varphi^{(k)}(0) = i^k E[X^k] 特别地,E[X]=φ(0)iE[X] = \frac{\varphi'(0)}{i}E[X2]=φ(0)E[X^2] = -\varphi''(0)

这为计算矩提供了另一种途径。

常见分布的特征函数:

  • 标准正态:φ(t)=et2/2\varphi(t) = e^{-t^2/2}
  • 一般正态 N(μ,σ2)N(\mu, \sigma^2)φ(t)=eitμσ2t2/2\varphi(t) = e^{it\mu - \sigma^2 t^2/2}
  • 泊松分布 Poisson(λ)\text{Poisson}(\lambda)φ(t)=eλ(eit1)\varphi(t) = e^{\lambda(e^{it}-1)}
  • 指数分布 Exp(λ)\text{Exp}(\lambda)φ(t)=λλit\varphi(t) = \frac{\lambda}{\lambda - it}

特征函数最重要的性质是唯一性:

唯一性定理:两个随机变量具有相同的特征函数当且仅当它们具有相同的分布函数。

这意味着特征函数完全刻画了随机变量的分布。

1.7.2 逆转公式

逆转公式提供了从特征函数恢复分布函数的方法。

定理(逆转公式):设 φ(t)\varphi(t) 是随机变量 XX 的特征函数,F(x)F(x) 是其分布函数。若 a<ba < bFF 的连续点,则: F(b)F(a)=limT12πTTeitaeitbitφ(t)dtF(b) - F(a) = \lim_{T \to \infty} \frac{1}{2\pi} \int_{-T}^{T} \frac{e^{-ita} - e^{-itb}}{it} \varphi(t) \mathrm{d}t

XX 是连续型随机变量,概率密度函数 f(x)f(x) 连续,则有更简洁的逆转公式:

密度逆转公式f(x)=12πeitxφ(t)dtf(x) = \frac{1}{2\pi} \int_{-\infty}^{\infty} e^{-itx} \varphi(t) \mathrm{d}t

这正是傅里叶逆变换的形式,表明特征函数与密度函数构成傅里叶变换对。

对于离散型随机变量,设其取值为 {xk}\{x_k\},则:

离散逆转公式P(X=xk)=limT12TTTeitxkφ(t)dtP(X = x_k) = \lim_{T \to \infty} \frac{1}{2T} \int_{-T}^{T} e^{-itx_k} \varphi(t) \mathrm{d}t

逆转公式的重要性在于它保证了特征函数与分布函数之间的一一对应关系,使得我们可以通过特征函数来研究分布的性质,特别是在证明极限定理时非常有用。

连续性定理:设 {Fn}\{F_n\} 是分布函数序列,{φn}\{\varphi_n\} 是对应的特征函数序列。则 FnF_n 弱收敛于分布函数 FF(即在某分布函数 FF 的所有连续点上收敛)当且仅当 φn(t)\varphi_n(t) 逐点收敛于某函数 φ(t)\varphi(t),且 φ(t)\varphi(t)t=0t = 0 处连续(此时 φ\varphi 是极限分布的特征函数)。

连续性定理是证明中心极限定理的关键工具:我们可以通过证明标准化和的特征函数收敛于标准正态分布的特征函数 et2/2e^{-t^2/2},来推出分布的收敛性。

Comments