期望和方差

期望和方差是概率论中的两个基本概念,它们描述了随机变量分布的中心趋势和离散程度。

下文涉及有限期望的等式,均假设可积,即 E∣X∣<∞E|X|<\infty;方差、协方差公式假设二阶矩有限。非负变量的期望可以是 +∞+\infty,但不能相减两个无穷大。连续情形还要求函数可测,并使用通常的积分运算法则。

期望值(均值)

期望值,也称为均值或期望,表示随机变量在多次试验中的平均值。

对于离散随机变量

E[X]=μX=∑xx⋅pX(x)\mathbb{E}[X] = \mu_X = \sum_{x} x \cdot p_X(x)

其中:

  • pX(x)p_X(x) 是概率质量函数(PMF)
  • 求和是对XX的所有可能值进行的

性质:

  • 线性和齐次性:E[aX+b]=aE[X]+b\mathbb{E}[aX + b] = a\mathbb{E}[X] + b
  • 对于两个随机变量:E[X+Y]=E[X]+E[Y]\mathbb{E}[X + Y] = \mathbb{E}[X] + \mathbb{E}[Y]
  • 对于独立随机变量:E[XY]=E[X]E[Y]\mathbb{E}[XY] = \mathbb{E}[X]\mathbb{E}[Y]

关键性质的证明

证明线性性

对于 a,b∈Ra, b \in \mathbb{R}

E[aX+b]=∑x(ax+b)⋅pX(x)=a∑xx⋅pX(x)+b∑xpX(x)=aE[X]+b\begin{aligned} \mathbb{E}[aX + b] &= \sum_{x} (ax + b) \cdot p_X(x) \\ &= a\sum_{x} x \cdot p_X(x) + b\sum_{x} p_X(x) \\ &= a\mathbb{E}[X] + b \end{aligned}
证明可加性
E[X+Y]=∑x∑y(x+y)⋅pX,Y(x,y)=∑x∑yx⋅pX,Y(x,y)+∑x∑yy⋅pX,Y(x,y)=E[X]+E[Y]\begin{aligned} \mathbb{E}[X + Y] &= \sum_{x}\sum_{y} (x + y) \cdot p_{X,Y}(x,y) \\ &= \sum_{x}\sum_{y} x \cdot p_{X,Y}(x,y) + \sum_{x}\sum_{y} y \cdot p_{X,Y}(x,y) \\ &= \mathbb{E}[X] + \mathbb{E}[Y] \end{aligned}
证明独立变量的乘积

如果XX和YY独立,则pX,Y(x,y)=pX(x)pY(y)p_{X,Y}(x,y) = p_X(x)p_Y(y),所以:

E[XY]=∑x∑yxy⋅pX,Y(x,y)=∑x∑yxy⋅pX(x)pY(y)=(∑xxpX(x))(∑yypY(y))=E[X]E[Y]\begin{aligned} \mathbb{E}[XY] &= \sum_{x}\sum_{y} xy \cdot p_{X,Y}(x,y) \\ &= \sum_{x}\sum_{y} xy \cdot p_X(x)p_Y(y) \\ &= \left(\sum_{x} x p_X(x)\right)\left(\sum_{y} y p_Y(y)\right) \\ &= \mathbb{E}[X]\mathbb{E}[Y] \end{aligned}

对于连续随机变量

E[X]=μX=∫−∞∞x⋅fX(x)dx\mathbb{E}[X] = \mu_X = \int_{-\infty}^{\infty} x \cdot f_X(x)dx

其中:

  • fX(x)f_X(x) 是概率密度函数(PDF)

方差

方差衡量随机变量的值偏离其均值的程度。

定义方差
V(X)=σX2=E[(X−μX)2]=E[X2]−(E[X])2\mathbb{V}(X) = \sigma_X^2 = \mathbb{E}[(X - \mu_X)^2] = \mathbb{E}[X^2] - (\mathbb{E}[X])^2

相同期望,不同方差。这两个示例分布的均值相同,但离散程度不同,因此方差不同。

相同期望,不同方差。这两个示例分布的均值相同,但离散程度不同,因此方差不同。

这两个示例分布的均值相同,但离散程度不同,因此方差不同。

对于离散随机变量

V(X)=∑x(x−μX)2⋅pX(x)\mathbb{V}(X) = \sum_{x} (x - \mu_X)^2 \cdot p_X(x)

对于连续随机变量

V(X)=∫−∞∞(x−μX)2⋅fX(x)dx\mathbb{V}(X) = \int_{-\infty}^{\infty} (x - \mu_X)^2 \cdot f_X(x)dx

标准差

标准差是方差的平方根:

σX=V(X)\sigma_X = \sqrt{\mathbb{V}(X)}

方差的性质

  • V(X)≥0\mathbb{V}(X) \geq 0
  • V(a)=0\mathbb{V}(a) = 0 对于任何常数aa
  • V(aX)=a2V(X)\mathbb{V}(aX) = a^2 \mathbb{V}(X)
  • V(X+a)=V(X)\mathbb{V}(X + a) = \mathbb{V}(X)
  • 对于独立随机变量:V(X+Y)=V(X)+V(Y)\mathbb{V}(X + Y) = \mathbb{V}(X) + \mathbb{V}(Y)

方差性质的证明

证明缩放性质

对于 a∈Ra \in \mathbb{R}

V(aX)=E[(aX−E[aX])2]=E[(aX−aE[X])2]=E[a2(X−E[X])2]=a2E[(X−E[X])2]=a2V(X)\begin{aligned} \mathbb{V}(aX) &= \mathbb{E}[(aX - \mathbb{E}[aX])^2] \\ &= \mathbb{E}[(aX - a\mathbb{E}[X])^2] \\ &= \mathbb{E}[a^2(X - \mathbb{E}[X])^2] \\ &= a^2\mathbb{E}[(X - \mathbb{E}[X])^2] \\ &= a^2\mathbb{V}(X) \end{aligned}
证明平移不变性
V(X+a)=E[(X+a−E[X+a])2]=E[(X+a−E[X]−a)2]=E[(X−E[X])2]=V(X)\begin{aligned} \mathbb{V}(X + a) &= \mathbb{E}[(X + a - \mathbb{E}[X + a])^2] \\ &= \mathbb{E}[(X + a - \mathbb{E}[X] - a)^2] \\ &= \mathbb{E}[(X - \mathbb{E}[X])^2] \\ &= \mathbb{V}(X) \end{aligned}
证明独立变量的可加性

如果XX和YY独立:

V(X+Y)=E[(X+Y)2]−(E[X+Y])2=E[X2+2XY+Y2]−(E[X]+E[Y])2=E[X2]+2E[X]E[Y]+E[Y2]−E[X]2−2E[X]E[Y]−E[Y]2=(E[X2]−E[X]2)+(E[Y2]−E[Y]2)=V(X)+V(Y)\begin{aligned} \mathbb{V}(X + Y) &= \mathbb{E}[(X + Y)^2] - (\mathbb{E}[X + Y])^2 \\ &= \mathbb{E}[X^2 + 2XY + Y^2] - (\mathbb{E}[X] + \mathbb{E}[Y])^2 \\ &= \mathbb{E}[X^2] + 2\mathbb{E}[X]\mathbb{E}[Y] + \mathbb{E}[Y^2] - \mathbb{E}[X]^2 - 2\mathbb{E}[X]\mathbb{E}[Y] - \mathbb{E}[Y]^2 \\ &= (\mathbb{E}[X^2] - \mathbb{E}[X]^2) + (\mathbb{E}[Y^2] - \mathbb{E}[Y]^2) \\ &= \mathbb{V}(X) + \mathbb{V}(Y) \end{aligned}
证明二阶矩恒等式与零方差

记 μ=E[X]\mu=E[X]。展开平方并用线性性,得 E[(X−μ)2]=E[X2]−2μE[X]+μ2=E[X2]−μ2E[(X-\mu)^2]=E[X^2]-2\mu E[X]+\mu^2=E[X^2]-\mu^2。平方非负,故方差非负;常量的中心化平方为零。反过来,若这个平方的期望为零,由事件 {∣X−μ∣≥1/k}\{|X-\mu|\ge1/k\} 上的下界 (X−μ)2≥k−2(X-\mu)^2\ge k^{-2},可知每个这样的事件概率均为零。它们的可数并为 {X≠μ}\{X\ne\mu\},所以零方差意味着 X=μX=\mu 几乎处处成立。

例子

例离散情况(掷骰子)

对于一个公平的六面骰子:

  • PMF:pX(x)=16p_X(x) = \frac{1}{6},对于x∈{1,2,3,4,5,6}x \in \{1, 2, 3, 4, 5, 6\}

期望值:

E[X]=∑x=16x⋅16=1+2+3+4+5+66=216=3.5\mathbb{E}[X] = \sum_{x=1}^{6} x \cdot \frac{1}{6} = \frac{1+2+3+4+5+6}{6} = \frac{21}{6} = 3.5

方差:

E[X2]=∑x=16x2⋅16=1+4+9+16+25+366=916\mathbb{E}[X^2] = \sum_{x=1}^{6} x^2 \cdot \frac{1}{6} = \frac{1+4+9+16+25+36}{6} = \frac{91}{6}V(X)=E[X2]−(E[X])2=916−(3.5)2=916−494=182−14712=3512≈2.92\mathbb{V}(X) = \mathbb{E}[X^2] - (\mathbb{E}[X])^2 = \frac{91}{6} - (3.5)^2 = \frac{91}{6} - \frac{49}{4} = \frac{182 - 147}{12} = \frac{35}{12} \approx 2.92
例连续情况(正态分布)

对于X∼N(μ,σ2)X \sim N(\mu, \sigma^2):

  • PDF:fX(x)=1σ2πe−(x−μ)22σ2f_X(x) = \frac{1}{\sigma\sqrt{2\pi}} e^{-\frac{(x-\mu)^2}{2\sigma^2}}

期望值:E[X]=μ\mathbb{E}[X] = \mu

方差:V(X)=σ2\mathbb{V}(X) = \sigma^2

例连续情况(均匀分布)

对于X∼U(a,b)X \sim U(a, b):

  • PDF:fX(x)=1b−af_X(x) = \frac{1}{b-a},对于a≤x≤ba \leq x \leq b

期望值:

E[X]=∫abx⋅1b−adx=a+b2\mathbb{E}[X] = \int_a^b x \cdot \frac{1}{b-a} dx = \frac{a+b}{2}

方差:

V(X)=∫ab(x−a+b2)2⋅1b−adx=(b−a)212\mathbb{V}(X) = \int_a^b \left(x - \frac{a+b}{2}\right)^2 \cdot \frac{1}{b-a} dx = \frac{(b-a)^2}{12}

随机变量函数的期望

当我们对随机变量应用函数时,会得到一个新的随机变量。计算这个新随机变量的期望是概率论中的重要问题。

无意识统计学家定律(LOTUS)

计算随机变量函数期望的核心原理是无意识统计学家定律(Law of the Unconscious Statistician, LOTUS)。该定律指出:要计算 E[g(X)]\mathbb{E}[g(X)],我们不需要先找到 g(X)g(X) 的分布,而是可以直接使用 XX 的原始分布进行计算。

计算公式

对于函数 g:R→Rg: \mathbb{R} \to \mathbb{R} 和随机变量 XX,g(X)g(X) 的期望为:

E[g(X)]={∑xg(x)⋅pX(x)(离散)∫−∞∞g(x)⋅fX(x)dx(连续)\mathbb{E}[g(X)] = \begin{cases} \sum_{x} g(x) \cdot p_X(x) & \text{(离散)} \\ \int_{-\infty}^{\infty} g(x) \cdot f_X(x) dx & \text{(连续)} \end{cases}

重要性质

  1. 线性性:E[a⋅g(X)+b⋅h(X)]=aE[g(X)]+bE[h(X)]\mathbb{E}[a \cdot g(X) + b \cdot h(X)] = a\mathbb{E}[g(X)] + b\mathbb{E}[h(X)]
  2. 单调性:如果对于所有 xx 都有 g(x)≤h(x)g(x) \leq h(x),那么 E[g(X)]≤E[h(X)]\mathbb{E}[g(X)] \leq \mathbb{E}[h(X)]
证明LOTUS 与单调性

离散情形按 y=g(x)y=g(x) 分组。因为 P(g(X)=y)=∑x:g(x)=ypX(x)P(g(X)=y)=\sum_{x:g(x)=y}p_X(x),代入 E[g(X)]E[g(X)] 后重新分组,即得 ∑xg(x)pX(x)\sum_x g(x)p_X(x)。非负项或绝对收敛的级数允许这一步。

有密度时,先取示性函数 g=1Bg=\mathbf1_B,两边都是 P(X∈B)=∫BfXP(X\in B)=\int_B f_X。线性性把结论推广到简单函数,即示性函数的有限线性组合;再用递增简单函数逼近非负可测函数,应用单调收敛定理。对于可积的有符号函数,分别处理正负部分后相减即可。这里把单调收敛定理作为积分前提,其一般证明尚未在微积分笔记中展开。联合分布同样适用。最后,由 h−g≥0h-g\ge0 得 E[h(X)]−E[g(X)]≥0E[h(X)]-E[g(X)]\ge0,在差有定义时便证明期望的单调性。

应用实例

例平方函数的期望

对于任意随机变量 XX,计算 E[X2]\mathbb{E}[X^2]:

  • 离散情况:E[X2]=∑xx2⋅pX(x)\mathbb{E}[X^2] = \sum_{x} x^2 \cdot p_X(x)
  • 连续情况:E[X2]=∫−∞∞x2⋅fX(x)dx\mathbb{E}[X^2] = \int_{-\infty}^{\infty} x^2 \cdot f_X(x) dx

这个结果在计算方差时至关重要:V(X)=E[X2]−(E[X])2\mathbb{V}(X) = \mathbb{E}[X^2] - (\mathbb{E}[X])^2

例指数函数的期望

对于任意随机变量 XX,计算 E[etX]\mathbb{E}[e^{tX}]:

  • 离散情况:E[etX]=∑xetx⋅pX(x)\mathbb{E}[e^{tX}] = \sum_{x} e^{tx} \cdot p_X(x)
  • 连续情况:E[etX]=∫−∞∞etx⋅fX(x)dx\mathbb{E}[e^{tX}] = \int_{-\infty}^{\infty} e^{tx} \cdot f_X(x) dx

这就是矩生成函数的定义,在概率论中有广泛应用。

数值估计方法

当函数复杂或分布非标准时,解析解可能难以获得。此时可使用泰勒级数近似进行数值估计。

泰勒级数近似法

对于均值为 μ\mu、方差为 σ2\sigma^2 的随机变量 XX,函数 f(X)f(X) 的期望和方差可以通过泰勒展开近似。

证明期望的近似推导
  1. 在 μ\mu 处对 f(X)f(X) 进行二阶泰勒展开:
f(X)=f(μ)+f′(μ)(X−μ)+f′′(μ)2(X−μ)2+R2f(X) = f(\mu) + f'(\mu)(X-\mu) + \frac{f''(\mu)}{2}(X-\mu)^2 + R_2

其中 R2R_2 是余项。

  1. 对两边取期望:
E[f(X)]=E[f(μ)]+E[f′(μ)(X−μ)]+E[f′′(μ)2(X−μ)2]+E[R2]\mathbb{E}[f(X)] = \mathbb{E}[f(\mu)] + \mathbb{E}[f'(\mu)(X-\mu)] + \mathbb{E}\left[\frac{f''(\mu)}{2}(X-\mu)^2\right] + \mathbb{E}[R_2]
  1. 由于 f(μ)f(\mu)、f′(μ)f'(\mu) 和 f′′(μ)f''(\mu) 都是常数:
E[f(X)]=f(μ)+f′(μ)E[X−μ]+f′′(μ)2E[(X−μ)2]+E[R2]\mathbb{E}[f(X)] = f(\mu) + f'(\mu)\mathbb{E}[X-\mu] + \frac{f''(\mu)}{2}\mathbb{E}[(X-\mu)^2] + \mathbb{E}[R_2]
  1. 利用 E[X−μ]=0\mathbb{E}[X-\mu] = 0 和 E[(X−μ)2]=σ2\mathbb{E}[(X-\mu)^2] = \sigma^2,并忽略高阶余项:
E[f(X)]≈f(μ)+f′′(μ)2σ2\mathbb{E}[f(X)] \approx f(\mu) + \frac{f''(\mu)}{2}\sigma^2
证明方差的近似推导
  1. 使用一阶泰勒展开(对于方差计算,一阶通常足够):
f(X)≈f(μ)+f′(μ)(X−μ)f(X) \approx f(\mu) + f'(\mu)(X-\mu)
  1. 由于 f(μ)f(\mu) 是常数,它不影响方差:
V[f(X)]≈V[f′(μ)(X−μ)]\mathbb{V}[f(X)] \approx \mathbb{V}[f'(\mu)(X-\mu)]
  1. 常数因子可以提出:
V[f(X)]≈[f′(μ)]2V[X−μ]\mathbb{V}[f(X)] \approx [f'(\mu)]^2 \mathbb{V}[X-\mu]
  1. 由于 V[X−μ]=V[X]=σ2\mathbb{V}[X-\mu] = \mathbb{V}[X] = \sigma^2:
V[f(X)]≈[f′(μ)]2σ2\mathbb{V}[f(X)] \approx [f'(\mu)]^2 \sigma^2

总结公式:

E[f(X)]≈f(μ)+f′′(μ)σ22V[f(X)]≈(f′(μ))2σ2\begin{aligned} \mathbb{E}\left[f(X)\right] &\approx f(\mu) + f''(\mu)\frac{\sigma^2}{2} \\ \mathbb{V}\left[f(X)\right] &\approx \left(f'(\mu)\right)^2\sigma^2 \end{aligned}

近似精度说明

  • 期望的近似使用了二阶展开,精度较高
  • 方差的近似使用了一阶展开,对于非线性较强的函数可能需要更高阶项
  • 当 f(X)f(X) 是线性函数时,近似结果是精确的
  • 近似精度取决于下面的余项界。

方差小本身不能控制 Taylor 余项。若 f(3)f^{(3)} 在 μ\mu 与 XX 每个可能取值之间的线段上满足 ∣f(3)∣≤M|f^{(3)}|\le M,Taylor 余项给出

∣E[f(X)]−f(μ)−12f′′(μ)σ2∣≤M6E∣X−μ∣3.\left|E[f(X)]-f(\mu)-\tfrac12f''(\mu)\sigma^2\right| \le\frac{M}{6}E|X-\mu|^3.

对一次近似,写 f(X)=f(μ)+L+Rf(X)=f(\mu)+L+R,其中 L=f′(μ)(X−μ)L=f'(\mu)(X-\mu)。各项二阶矩有限时,协方差展开和柯西–施瓦茨不等式给出

∣Var⁡(f(X))−Var⁡(L)∣≤2Var⁡(L)Var⁡(R)+Var⁡(R).|\operatorname{Var}(f(X))-\operatorname{Var}(L)| \le2\sqrt{\operatorname{Var}(L)\operatorname{Var}(R)}+\operatorname{Var}(R).

这些界明确指出需要小的是哪些量;如果不控制导数与尾部,仅凭分布集中不能保证近似准确。

协方差和相关系数

当处理多个随机变量时,我们经常想要衡量它们之间的关系。

协方差

Cov(X,Y)=E[(X−μX)(Y−μY)]=E[XY]−E[X]E[Y]\text{Cov}(X,Y) = \mathbb{E}[(X - \mu_X)(Y - \mu_Y)] = \mathbb{E}[XY] - \mathbb{E}[X]\mathbb{E}[Y]

相关系数

ρX,Y=Cov(X,Y)σXσY\rho_{X,Y} = \frac{\text{Cov}(X,Y)}{\sigma_X \sigma_Y}

性质:

  • −1≤ρX,Y≤1-1 \leq \rho_{X,Y} \leq 1
  • ρ=1\rho = 1:完全正线性关系
  • ρ=−1\rho = -1:完全负线性关系
  • ρ=0\rho = 0:无线性关系(但可能有非线性关系)
证明协方差与相关系数的界

展开中心化乘积,得到 Cov⁡(X,Y)=E[XY]−E[X]E[Y]\operatorname{Cov}(X,Y)=E[XY]-E[X]E[Y],并有

Var⁡(X+Y)=Var⁡(X)+Var⁡(Y)+2Cov⁡(X,Y).\operatorname{Var}(X+Y)=\operatorname{Var}(X)+\operatorname{Var}(Y)+2\operatorname{Cov}(X,Y).

令 U=X−E[X]U=X-E[X]、V=Y−E[Y]V=Y-E[Y],在 E[(U−tV)2]≥0E[(U-tV)^2]\ge0 中取 t=E[UV]/E[V2]t=E[UV]/E[V^2],便得 E[UV]2≤E[U2]E[V2]E[UV]^2\le E[U^2]E[V^2]。两方差均为正时,这就是 ∣ρ∣≤1|\rho|\le1。由零方差的论证,等号等价于 U=tVU=tV 几乎处处成立:t>0t>0 对应 ρ=1\rho=1,t<0t<0 对应 ρ=−1\rho=-1。若某个方差为零,相关系数没有定义。

独立通过乘积公式推出协方差为零,但逆命题不成立。若 XX 在 {−1,0,1}\{-1,0,1\} 上均匀分布,Y=X2Y=X^2,则 E[X]=E[X3]=0E[X]=E[X^3]=0,协方差为零;然而 YY 完全由 XX 决定且不是常量,因此并不独立。

常见分布及其矩

分布期望值方差
伯努利(p)ppp(1−p)p(1-p)
二项(n,p)npnpnp(1−p)np(1-p)
泊松(λ)λ\lambdaλ\lambda
均匀(a,b)a+b2\frac{a+b}{2}(b−a)212\frac{(b-a)^2}{12}
正态(μ,σ²)μ\muσ2\sigma^2
指数(λ)1λ\frac{1}{\lambda}1λ2\frac{1}{\lambda^2}

重要定理

定理大数定律

对于具有均值μ\mu的独立同分布随机变量X1,X2,...,XnX_1, X_2, ..., X_n:

1n∑i=1nXi→Pμ 当 n→∞\frac{1}{n}\sum_{i=1}^{n} X_i \xrightarrow{P} \mu \text{ 当 } n \to \infty

本章采用有限方差版本:对无限的独立同分布序列,假设 E[Xi]=μE[X_i]=\mu 且 Var⁡(Xi)<∞\operatorname{Var}(X_i)<\infty。大数弱定律笔记给出了完整的 Chebyshev 证明。一般独立同分布弱律只需有限一阶矩,但还需截断论证,不能由这里的方差证明直接得到。

定理中心极限定理

对于具有均值μ\mu和方差σ2\sigma^2的独立同分布随机变量:

∑i=1nXi−nμσn→DN(0,1) 当 n→∞\frac{\sum_{i=1}^{n} X_i - n\mu}{\sigma\sqrt{n}} \xrightarrow{D} N(0,1) \text{ 当 } n \to \infty

这里要求无限的独立同分布序列,且 0<σ2<∞0<\sigma^2<\infty;零方差时上述标准化没有定义。特征函数证明会先把标准化单变量的变换展开为 1−t2/2+o(t2)1-t^2/2+o(t^2),在 t/nt/\sqrt n 处取 nn 次幂得到 e−t2/2e^{-t^2/2},最后应用 Lévy 连续性定理。有限二阶矩下的这个展开及最后的连续性定理,目前尚未在笔记集建立;这里记录的是待写概率极限章节的依赖,不把它算作已完成证明。

多个随机变量的期望

当处理多个随机变量的函数时,我们需要理解如何计算它们的期望。

多变量函数的期望

对于两个随机变量的函数g(X,Y)g(X,Y),期望使用联合分布计算:

E[g(X,Y)]={∑x∑yg(x,y)⋅pX,Y(x,y)(离散)∬R2g(x,y)⋅fX,Y(x,y)dxdy(连续)\mathbb{E}[g(X,Y)] = \begin{cases} \sum_{x}\sum_{y} g(x,y) \cdot p_{X,Y}(x,y) & \text{(离散)} \\ \iint_{\mathbb{R}^2} g(x,y) \cdot f_{X,Y}(x,y) dx dy & \text{(连续)} \end{cases}

关键性质

从这个定义,我们推导出重要性质:

  1. 线性性:E[X+Y]=E[X]+E[Y]\mathbb{E}[X + Y] = \mathbb{E}[X] + \mathbb{E}[Y](总是成立)
  2. 乘积:E[XY]=E[X]E[Y]\mathbb{E}[XY] = \mathbb{E}[X]\mathbb{E}[Y](仅在XX和YY独立时成立)

从联合分布计算期望

连续情况的几何解释

对于联合概率密度函数f(x,y)f(x,y),计算E[X]\mathbb{E}[X]涉及在整个平面上积分:

E[X]=∬R2x⋅f(x,y)dxdy\mathbb{E}[X] = \iint_{\mathbb{R}^2} x \cdot f(x,y) dx dy

这可以在几何上理解为找到联合密度形成的三维曲面在xx方向的"质心"。

计算可以通过两种等效方式进行:

  1. 直接积分:在整个平面上对x⋅f(x,y)x \cdot f(x,y)积分
  2. 使用边缘密度:首先找到fX(x)=∫−∞∞f(x,y)dyf_X(x) = \int_{-\infty}^{\infty} f(x,y) dy,然后计算E[X]=∫−∞∞x⋅fX(x)dx\mathbb{E}[X] = \int_{-\infty}^{\infty} x \cdot f_X(x) dx

第二种方法有效是因为:

E[X]=∫−∞∞∫−∞∞x⋅f(x,y)dydx=∫−∞∞x(∫−∞∞f(x,y)dy)dx=∫−∞∞x⋅fX(x)dx\mathbb{E}[X] = \int_{-\infty}^{\infty} \int_{-\infty}^{\infty} x \cdot f(x,y) dy dx = \int_{-\infty}^{\infty} x \left(\int_{-\infty}^{\infty} f(x,y) dy\right) dx = \int_{-\infty}^{\infty} x \cdot f_X(x) dx

与离散情况的联系

类似地,对于离散随机变量:

E[X]=∑x∑yx⋅pX,Y(x,y)=∑xx(∑ypX,Y(x,y))=∑xx⋅pX(x)\mathbb{E}[X] = \sum_{x}\sum_{y} x \cdot p_{X,Y}(x,y) = \sum_{x} x \left(\sum_{y} p_{X,Y}(x,y)\right) = \sum_{x} x \cdot p_X(x)

这表明无论我们直接使用联合分布还是先计算边缘分布,我们都得到相同的期望。

条件期望

给定X=xX = x时YY的条件期望为:

E[Y∣X=x]={∑yy⋅pY∣X(y∣x)(离散)∫−∞∞y⋅fY∣X(y∣x)dy(连续)\mathbb{E}[Y|X = x] = \begin{cases} \sum_{y} y \cdot p_{Y|X}(y|x) & \text{(离散)} \\ \int_{-\infty}^{\infty} y \cdot f_{Y|X}(y|x) dy & \text{(连续)} \end{cases}

这导出了全期望公式:

E[Y]=E[E[Y∣X]]\mathbb{E}[Y] = \mathbb{E}[\mathbb{E}[Y|X]]
证明全期望公式

离散情形只在 pX(x)>0p_X(x)>0 的地方定义条件均值,则

∑xE[Y∣X=x]pX(x)=∑x:pX(x)>0∑yy pX,Y(x,y)=E[Y].\sum_x E[Y\mid X=x]p_X(x) =\sum_{x:p_X(x)>0}\sum_y y\,p_{X,Y}(x,y) =E[Y].

边缘概率为零的点不贡献质量,条件值可以任意指定。YY 绝对可积保证重新求和合法。存在联合密度时,把求和换成积分,在 fX(x)>0f_X(x)>0 处使用 fY∣X(y∣x)fX(x)=fX,Y(x,y)f_{Y\mid X}(y\mid x)f_X(x)=f_{X,Y}(x,y),再用 Fubini 定理即可。这证明了上面列出的两种情形,一般测度论条件期望还需要额外构造。

练习

练习离散均匀整数抽样

在集合 {1,2,…,103}\{1, 2, \ldots, 10^3\} 中等可能随机抽取一个整数 NN。

  1. NN 能被 3 整除的概率是多少?能被 5 整除?能被 7 整除?
  2. 计算期望值 E[N]\mathbb{E}[N]。
  3. 计算方差 V(N)\mathbb{V}(N)。
解
  1. 整除概率:

    • 能被 3 整除的数有 ⌊1000/3⌋=333\lfloor 1000/3 \rfloor = 333 个,故 P(3∣N)=3331000=0.333P(3 \mid N) = \frac{333}{1000} = 0.333。
    • 能被 5 整除的数有 ⌊1000/5⌋=200\lfloor 1000/5 \rfloor = 200 个,故 P(5∣N)=2001000=0.200P(5 \mid N) = \frac{200}{1000} = 0.200。
    • 能被 7 整除的数有 ⌊1000/7⌋=142\lfloor 1000/7 \rfloor = 142 个,故 P(7∣N)=1421000=0.142P(7 \mid N) = \frac{142}{1000} = 0.142。
  2. 期望值: 对于集合 {1,2,…,n}\{1, 2, \ldots, n\} 上的离散均匀随机变量(此处 n=1000n = 1000):

E[N]=1n∑k=1nk=n(n+1)2n=n+12=10012=500.5.\mathbb{E}[N] = \frac{1}{n} \sum_{k=1}^{n} k = \frac{n(n+1)}{2n} = \frac{n+1}{2} = \frac{1001}{2} = 500.5.
  1. 方差: 利用平方和公式 ∑k=1nk2=n(n+1)(2n+1)6\sum_{k=1}^n k^2 = \frac{n(n+1)(2n+1)}{6}:
E[N2]=(n+1)(2n+1)6=1001⋅20016=333833.5.\mathbb{E}[N^2] = \frac{(n+1)(2n+1)}{6} = \frac{1001 \cdot 2001}{6} = 333833.5.V(N)=E[N2]−(E[N])2=n2−112=10002−112=99999912=83333.25.\mathbb{V}(N) = \mathbb{E}[N^2] - (\mathbb{E}[N])^2 = \frac{n^2 - 1}{12} = \frac{1000^2 - 1}{12} = \frac{999999}{12} = 83333.25.
练习两次非对称抛硬币的正面总数

独立抛掷两枚硬币。第一枚正面朝上的概率为 0.60.6,第二枚正面朝上的概率为 0.70.7。设 XX 为正面朝上的总次数。求 E[X]\mathbb{E}[X] 与 V(X)\mathbb{V}(X)。

解

设 X1∼Bernoulli(0.6)X_1 \sim \text{Bernoulli}(0.6) 与 X2∼Bernoulli(0.7)X_2 \sim \text{Bernoulli}(0.7) 分别为第一枚和第二枚硬币正面朝上的指示变量。则 X=X1+X2X = X_1 + X_2。

  • 由期望的线性性质:
E[X]=E[X1]+E[X2]=0.6+0.7=1.3.\mathbb{E}[X] = \mathbb{E}[X_1] + \mathbb{E}[X_2] = 0.6 + 0.7 = 1.3.
  • 由于两次抛掷相互独立:
V(X)=V(X1)+V(X2)=0.6(1−0.6)+0.7(1−0.7)=0.24+0.21=0.45.\mathbb{V}(X) = \mathbb{V}(X_1) + \mathbb{V}(X_2) = 0.6(1 - 0.6) + 0.7(1 - 0.7) = 0.24 + 0.21 = 0.45.
练习二分查找猜数问题的提问次数期望

在数字集合 {1,2,…,10}\{1, 2, \dots, 10\} 中等可能随机选取一个数字。通过提出形如“该数是否严格大于 kk”的是非问题,按照最优二分查找决策树来猜出该数。计算所需提问次数的数学期望。

解

在 10 个元素上建立最优二分查找树:

  • 第一问提问 “N>5N > 5?”(将空间划分为 {1..5}\{1..5\} 与 {6..10}\{6..10\})。
  • 对于分支 {1..5}\{1..5\} 提问 “N>2N > 2?”,对于分支 {6..10}\{6..10\} 提问 “N>7N > 7?”。

决策树中的叶子深度:

  • 提问 3 次即可确定的数字有 6 个。
  • 提问 4 次才能确定的数字有 4 个。

由于 10 个数字等可能出现:

E[提问次数]=6×3+4×410=18+1610=3.4.\mathbb{E}[\text{提问次数}] = \frac{6 \times 3 + 4 \times 4}{10} = \frac{18 + 16}{10} = 3.4.
练习圣彼得堡抛硬币博弈

重复抛掷一枚均匀硬币,直至第一次出现反面为止。若第一次反面出现在第 nn 次抛掷,玩家赢得 2n2^n 元。设 XX 为玩家的收益,证明 E[X]=+∞\mathbb{E}[X] = +\infty。

解

首次出现反面的等待时间服从参数 p=1/2p = 1/2 的几何分布:

P(N=n)=(12)n−1⋅12=12n,n∈{1,2,3,…}P(N = n) = \left(\frac{1}{2}\right)^{n-1} \cdot \frac{1}{2} = \frac{1}{2^n}, \quad n \in \{1, 2, 3, \ldots\}

当 N=nN = n 时收益为 X=2nX = 2^n。期望收益为:

E[X]=∑n=1∞2n⋅P(N=n)=∑n=1∞2n⋅12n=∑n=1∞1=+∞.\mathbb{E}[X] = \sum_{n=1}^{\infty} 2^n \cdot P(N = n) = \sum_{n=1}^{\infty} 2^n \cdot \frac{1}{2^n} = \sum_{n=1}^{\infty} 1 = +\infty.
练习校车乘客悖论(检验悖论)

4 辆载有 148 名学生的校车到达学校,4 辆车上的学生人数分别为 40、33、25 和 50 人。

  1. 在 148 名学生中等可能随机抽取 1 名学生,设 XX 为该学生所在校车上的总人数。
  2. 在 4 辆校车中等可能随机抽取 1 辆校车,设 YY 为该校车上的学生人数。 分别计算 E[X]\mathbb{E}[X] 与 E[Y]\mathbb{E}[Y],并解释两者差异。
解
  1. 学生视角的期望 (XX): 抽中某辆车上学生的概率与该车的载客量成正比:
P(X=i)=i148,i∈{40,33,25,50}P(X = i) = \frac{i}{148}, \quad i \in \{40, 33, 25, 50\}E[X]=∑i⋅i148=402+332+252+502148=1600+1089+625+2500148=5814148≈39.28.\mathbb{E}[X] = \sum i \cdot \frac{i}{148} = \frac{40^2 + 33^2 + 25^2 + 50^2}{148} = \frac{1600 + 1089 + 625 + 2500}{148} = \frac{5814}{148} \approx 39.28.
  1. 校车视角的期望 (YY): 每辆车被抽中的概率均为 14\frac{1}{4}:
E[Y]=40+33+25+504=1484=37.0.\mathbb{E}[Y] = \frac{40 + 33 + 25 + 50}{4} = \frac{148}{4} = 37.0.

E[X]>E[Y]\mathbb{E}[X] > \mathbb{E}[Y] 体现了概率论中著名的检验悖论(Inspection Paradox):载客量更大的校车由于承载了更多学生,按人头抽样时更容易被命中。两者满足理论关系 E[X]=E[Y]+V(Y)E[Y]\mathbb{E}[X] = \mathbb{E}[Y] + \frac{\mathbb{V}(Y)}{\mathbb{E}[Y]}。

练习校车悖论的方差计算

计算上述校车问题中随机变量 XX 与 YY 的方差 V(X)\mathbb{V}(X) 与 V(Y)\mathbb{V}(Y)。

解
  1. XX 的方差:
E[X2]=403+333+253+503148=64000+35937+15625+125000148=240562148≈1625.42.\mathbb{E}[X^2] = \frac{40^3 + 33^3 + 25^3 + 50^3}{148} = \frac{64000 + 35937 + 15625 + 125000}{148} = \frac{240562}{148} \approx 1625.42.V(X)=E[X2]−(E[X])2≈1625.42−(39.2838)2≈1625.42−1543.22=82.20.\mathbb{V}(X) = \mathbb{E}[X^2] - (\mathbb{E}[X])^2 \approx 1625.42 - (39.2838)^2 \approx 1625.42 - 1543.22 = 82.20.
  1. YY 的方差:
E[Y2]=402+332+252+5024=58144=1453.5.\mathbb{E}[Y^2] = \frac{40^2 + 33^2 + 25^2 + 50^2}{4} = \frac{5814}{4} = 1453.5.V(Y)=E[Y2]−(E[Y])2=1453.5−372=1453.5−1369=84.50.\mathbb{V}(Y) = \mathbb{E}[Y^2] - (\mathbb{E}[Y])^2 = 1453.5 - 37^2 = 1453.5 - 1369 = 84.50.
练习天气预报的严格适定评分规则

气象预报员预报明天降雨的概率为 p∈[0,1]p \in [0, 1]。若实际下雨,预报员获得评分 1−(1−p)21 - (1 - p)^2;若不下雨,获得评分 1−p21 - p^2。设预报员内心真实的下雨概率信念为 p∗p^*。为了最大化期望得分,预报员应该报告怎样的 pp?

解

期望得分关于报告概率 pp 的函数为:

E[得分]=p∗[1−(1−p)2]+(1−p∗)[1−p2]=p∗[2p−p2]+(1−p∗)(1−p2)=2pp∗−p∗p2+1−p2−p∗+p∗p2=2pp∗−p2+1−p∗.\begin{aligned} \mathbb{E}[\text{得分}] &= p^* \left[1 - (1 - p)^2\right] + (1 - p^*)\left[1 - p^2\right] \\ &= p^* [2p - p^2] + (1 - p^*)(1 - p^2) \\ &= 2p p^* - p^* p^2 + 1 - p^2 - p^* + p^* p^2 \\ &= 2p p^* - p^2 + 1 - p^*. \end{aligned}

对 pp 求导寻找极值:

ddpE[得分]=2p∗−2p.\frac{d}{dp}\mathbb{E}[\text{得分}] = 2p^* - 2p.

令导数等于零,得到 p=p∗p = p^*。二阶导数 d2dp2E[得分]=−2<0\frac{d^2}{dp^2}\mathbb{E}[\text{得分}] = -2 < 0 证明这是严格全局最大值点。因此该评分规则是严格适定的(strictly proper):预报员当且仅当如实汇报真实信念 p=p∗p = p^* 时才能最大化期望得分。

练习累积分布函数商形式与独立性

说明为什么随机变量 X1,X2,…,XnX_1, X_2, \ldots, X_n 的相互独立性不能采用累积分布函数的商形式来刻画:

FX1,…,Xn(x1,…,xn)FX1(x1)=FX2(x2)⋯FXn(xn).\frac{F_{X_1, \ldots, X_n}(x_1, \ldots, x_n)}{F_{X_1}(x_1)} = F_{X_2}(x_2) \cdots F_{X_n}(x_n).
解

随机变量的独立性在本质上由联合概率的可乘性定义:FX1,…,Xn(x1,…,xn)=∏i=1nFXi(xi)F_{X_1, \ldots, X_n}(x_1, \ldots, x_n) = \prod_{i=1}^n F_{X_i}(x_i)。

商形式 FX,Y(x,y)FX(x)\frac{F_{X, Y}(x, y)}{F_X(x)} 隐含了条件概率形式 P(Y≤y∣X≤x)P(Y \leq y \mid X \leq x)。但独立性表达的是无需任何条件限制时各变量的无条件对称因式分解。此外,商形式在分母 FX1(x1)=0F_{X_1}(x_1) = 0 的区间无定义,无法完整覆盖全定义域。因此必须采用乘积形式而非商形式。

练习独立离散随机变量的线性组合与分布

设 XX 和 YY 为相互独立的离散随机变量,其分布分别为:

x−101P(X=x)161312y024P(Y=y)141214\begin{array}{c|ccc} x & -1 & 0 & 1 \\ \hline P(X = x) & \frac{1}{6} & \frac{1}{3} & \frac{1}{2} \end{array} \qquad \begin{array}{c|ccc} y & 0 & 2 & 4 \\ \hline P(Y = y) & \frac{1}{4} & \frac{1}{2} & \frac{1}{4} \end{array}

令 W=3Y−6XW = 3Y - 6X 以及 Z=2X+YZ = 2X + Y。

  1. 计算 E[X]\mathbb{E}[X] 与 V(X)\mathbb{V}(X)。
  2. 计算 E[W]\mathbb{E}[W]。
  3. 列出 ZZ 的概率分布表。
解
  1. XX 的矩:
E[X]=(−1)(16)+0(13)+1(12)=−16+36=13.\mathbb{E}[X] = (-1)\left(\frac{1}{6}\right) + 0\left(\frac{1}{3}\right) + 1\left(\frac{1}{2}\right) = -\frac{1}{6} + \frac{3}{6} = \frac{1}{3}.E[X2]=(−1)2(16)+02(13)+12(12)=16+36=23.\mathbb{E}[X^2] = (-1)^2\left(\frac{1}{6}\right) + 0^2\left(\frac{1}{3}\right) + 1^2\left(\frac{1}{2}\right) = \frac{1}{6} + \frac{3}{6} = \frac{2}{3}.V(X)=E[X2]−(E[X])2=23−19=59.\mathbb{V}(X) = \mathbb{E}[X^2] - (\mathbb{E}[X])^2 = \frac{2}{3} - \frac{1}{9} = \frac{5}{9}.
  1. 期望 E[W]\mathbb{E}[W]: 先求 E[Y]\mathbb{E}[Y]:
E[Y]=0(14)+2(12)+4(14)=0+1+1=2.\mathbb{E}[Y] = 0\left(\frac{1}{4}\right) + 2\left(\frac{1}{2}\right) + 4\left(\frac{1}{4}\right) = 0 + 1 + 1 = 2.

由线性性质:

E[W]=3E[Y]−6E[X]=3(2)−6(13)=6−2=4.\mathbb{E}[W] = 3\mathbb{E}[Y] - 6\mathbb{E}[X] = 3(2) - 6\left(\frac{1}{3}\right) = 6 - 2 = 4.
  1. Z=2X+YZ = 2X + Y 的分布: 2X2X 的取值集合为 {−2,0,2}\{-2, 0, 2\},YY 的取值集合为 {0,2,4}\{0, 2, 4\}。 Z=2X+YZ = 2X + Y 的可能取值为 {−2,0,2,4,6}\{-2, 0, 2, 4, 6\}。 由于 X,YX, Y 独立,各组合概率为 P(X=x,Y=y)=P(X=x)P(Y=y)P(X=x, Y=y) = P(X=x)P(Y=y):
    • P(Z=−2)=P(X=−1,Y=0)=16⋅14=124P(Z = -2) = P(X=-1, Y=0) = \frac{1}{6} \cdot \frac{1}{4} = \frac{1}{24}。
P(Z=0)=P(X=−1,Y=2)+P(X=0,Y=0)=16⋅12+13⋅14=112+112=16P(Z = 0) = P(X=-1, Y=2) + P(X=0, Y=0) = \frac{1}{6} \cdot \frac{1}{2} + \frac{1}{3} \cdot \frac{1}{4} = \frac{1}{12} + \frac{1}{12} = \frac{1}{6}

。

P(Z=2)=P(X=−1,Y=4)+P(X=0,Y=2)+P(X=1,Y=0)=124+16+18=13P(Z = 2) = P(X=-1, Y=4) + P(X=0, Y=2) + P(X=1, Y=0) = \frac{1}{24} + \frac{1}{6} + \frac{1}{8} = \frac{1}{3}

。

  • P(Z=4)=P(X=0,Y=4)+P(X=1,Y=2)=112+14=13P(Z = 4) = P(X=0, Y=4) + P(X=1, Y=2) = \frac{1}{12} + \frac{1}{4} = \frac{1}{3}。
  • P(Z=6)=P(X=1,Y=4)=12⋅14=18P(Z = 6) = P(X=1, Y=4) = \frac{1}{2} \cdot \frac{1}{4} = \frac{1}{8}。
z−20246P(Z=z)12416131318\begin{array}{c|ccccc} z & -2 & 0 & 2 & 4 & 6 \\ \hline P(Z = z) & \frac{1}{24} & \frac{1}{6} & \frac{1}{3} & \frac{1}{3} & \frac{1}{8} \end{array}
练习独立随机变量方差可加性的数学归纳法证明

证明对于任意两两独立的有限方差随机变量序列 {X1,X2,…,Xn}\{X_1, X_2, \ldots, X_n\},满足:

V(∑i=1nXi)=∑i=1nV(Xi).\mathbb{V}\left(\sum_{i=1}^n X_i\right) = \sum_{i=1}^n \mathbb{V}(X_i).
证明

对序列长度 nn 使用数学归纳法。

基础步骤 (n=1,2n=1, 2):n=1n=1 时显然成立。当 n=2n=2 时:

V(X1+X2)=E[(X1+X2)2]−(E[X1+X2])2=E[X12]+2E[X1X2]+E[X22]−(E[X1]+E[X2])2.\begin{aligned} \mathbb{V}(X_1 + X_2) &= \mathbb{E}[(X_1 + X_2)^2] - (\mathbb{E}[X_1 + X_2])^2 \\ &= \mathbb{E}[X_1^2] + 2\mathbb{E}[X_1 X_2] + \mathbb{E}[X_2^2] - (\mathbb{E}[X_1] + \mathbb{E}[X_2])^2. \end{aligned}

由于 X1,X2X_1, X_2 独立,E[X1X2]=E[X1]E[X2]\mathbb{E}[X_1 X_2] = \mathbb{E}[X_1]\mathbb{E}[X_2],交叉项抵消:

V(X1+X2)=(E[X12]−E[X1]2)+(E[X22]−E[X2]2)=V(X1)+V(X2).\mathbb{V}(X_1 + X_2) = (\mathbb{E}[X_1^2] - \mathbb{E}[X_1]^2) + (\mathbb{E}[X_2^2] - \mathbb{E}[X_2]^2) = \mathbb{V}(X_1) + \mathbb{V}(X_2).

归纳步骤:假设当 n=kn=k 时结论成立,即 V(∑i=1kXi)=∑i=1kV(Xi)\mathbb{V}\left(\sum_{i=1}^k X_i\right) = \sum_{i=1}^k \mathbb{V}(X_i)。 当 n=k+1n=k+1 时,记 Sk=∑i=1kXiS_k = \sum_{i=1}^k X_i。由于 Xk+1X_{k+1} 与 X1,…,XkX_1, \dots, X_k 均独立,它与前 kk 项的和 SkS_k 亦相互独立。应用两变量方差可加性公式:

V(Sk+Xk+1)=V(Sk)+V(Xk+1)=∑i=1kV(Xi)+V(Xk+1)=∑i=1k+1V(Xi).\mathbb{V}(S_k + X_{k+1}) = \mathbb{V}(S_k) + \mathbb{V}(X_{k+1}) = \sum_{i=1}^k \mathbb{V}(X_i) + \mathbb{V}(X_{k+1}) = \sum_{i=1}^{k+1} \mathbb{V}(X_i).

由数学归纳法原理,该性质对所有 n≥1n \geq 1 均成立。