矩生成函数

矩生成函数把一系列期望压缩成一个函数。真正使用求导和唯一性时,必须先检查它在哪个区间内有限。

定义矩生成函数

对实随机变量 XX,在期望有限的地方定义 MX(t)=E[etX]M_X(t)=E[e^{tX}]。离散情形与有密度的情形分别为

MX(t)=∑xetxpX(x),MX(t)=∫RetxfX(x) dx.M_X(t)=\sum_x e^{tx}p_X(x),\qquad M_X(t)=\int_{\mathbb R}e^{tx}f_X(x)\,dx.

总有 MX(0)=1M_X(0)=1。说 MGF 在零点附近存在,是指有某个 a>0a>0,使它在整个 (−a,a)(-a,a) 内都有限。

所有多项式矩都存在,并不足以保证零点附近存在 MGF。例如令 ZZ 为标准正态变量,X=eZX=e^Z。配方可得每个非负整数阶矩 E[Xn]=en2/2E[X^n]=e^{n^2/2};但任意 t>0t>0 都有 E[etX]=∞E[e^{tX}]=\infty。因为正态积分中的指数 tez−z2/2→∞te^z-z^2/2\to\infty,被积函数最终大于某个正常数,积分发散。

求导为什么能够生成矩

定理由导数得到各阶矩

若 MXM_X 在 (−a,a)(-a,a) 内有限,则所有绝对矩均有限,并且

MX(n)(t)=E[XnetX],∣t∣<a.M_X^{(n)}(t)=E[X^ne^{tX}],\qquad |t|<a.

特别地,MX(n)(0)=E[Xn]M_X^{(n)}(0)=E[X^n]。

证明

选取 ∣t∣<b<c<a|t|<b<c<a。由 ec∣X∣≤ecX+e−cXe^{c|X|}\le e^{cX}+e^{-cX},右边期望有限。函数 une−(c−b)uu^n e^{-(c-b)u} 在 u≥0u\ge0 上有界,因此存在有限常数 CnC_n 使

∣X∣neb∣X∣≤Cnec∣X∣.|X|^n e^{b|X|}\le C_n e^{c|X|}.

把 nn 换成 n+1n+1,再用中值定理,就能在 tt 的一个小邻域内控制第 nn 阶导数的差商。控制函数可积,故支配收敛定理允许把求导移进期望。逐次应用便得全部阶数;在 t=0t=0 处,同一估计也保证所有绝对矩有限。这里使用支配收敛定理作为积分前提,其一般证明尚未在本站展开。

仿射变换与独立变量的和

令 Y=aX+bY=aX+b,直接代入定义得

MY(t)=E[et(aX+b)]=ebtMX(at),M_Y(t)=E[e^{t(aX+b)}]=e^{bt}M_X(at),

条件是 MX(at)M_X(at) 有限。若 X,YX,Y 独立,联合分布可以分解,所以在共同的有限定义域内有

MX+Y(t)=E[etXetY]=MX(t)MY(t).M_{X+Y}(t)=E[e^{tX}e^{tY}]=M_X(t)M_Y(t).

离散情形把二重和拆成乘积,有密度时把二重积分拆开;非负性允许交换次序,有限性保证结果有限。反复应用可得有限个相互独立变量的乘法公式,仅有两两独立不足以支持多个因子的分解。

唯一性究竟需要什么条件

定理零点邻域内的 MGF 唯一性

若包含零点的某个开区间上处处有 MX(t)=MY(t)<∞M_X(t)=M_Y(t)<\infty,则 X,YX,Y 同分布。

若两者都只取有限个不同的值 x1,…,xmx_1,\ldots,x_m,可以给出初等证明。零点处各阶导数相同,意味着任意多项式的期望相同。取 Lagrange 多项式

ℓj(x)=∏i≠jx−xixj−xi,\ell_j(x)=\prod_{i\ne j}\frac{x-x_i}{x_j-x_i},

它在 xjx_j 处为一,在其余支撑点为零。因此每个 jj 都有 P(X=xj)=E[ℓj(X)]=E[ℓj(Y)]=P(Y=xj)P(X=x_j)=E[\ell_j(X)]=E[\ell_j(Y)]=P(Y=x_j)。

对于一般实分布,通常先把 E[ezX]E[e^{zX}] 解析延拓到竖直带状区域,再用恒等定理证明虚轴上相等,最后使用特征函数唯一性。这两个分析唯一性定理尚未在本笔记集建立,因此一般结论在这里是明确引用的前提,不能把有限支撑证明当成一般证明。MIT 概率讲义也明确列出零点邻域条件并讨论变换的唯一性[1][1] M. I. of Technology, “Fundamentals of Probability: Lecture 13, Moment Generating Functions,” 2018. https://ocw.mit.edu/courses/6-436j-fundamentals-of-probability-fall-2018/1a592ed184fb4c444547f67c9bcdd8ec_MIT6_436JF18_lec13.pdf。仅仅在 t=0t=0 相等没有辨别作用,因为所有分布在这里都取一。

常见 MGF 及其推导

以下假设 0≤p≤10\le p\le1,n≥0n\ge0 为整数,λ>0\lambda>0,σ>0\sigma>0,a<ba<b。

分布MGF有限定义域
伯努利1−p+pet1-p+pe^t所有实数 tt
二项(1−p+pet)n(1-p+pe^t)^n所有实数 tt
泊松exp⁡(λ(et−1))\exp(\lambda(e^t-1))所有实数 tt
正态exp⁡(μt+σ2t2/2)\exp(\mu t+\sigma^2t^2/2)所有实数 tt
指数λ/(λ−t)\lambda/(\lambda-t)t<λt<\lambda
均匀t≠0t\ne0 时为 (etb−eta)/(t(b−a))(e^{tb}-e^{ta})/(t(b-a)),t=0t=0 时为 11所有实数 tt

伯努利分布直接对两个结果求和;二项变量是独立伯努利变量之和,应用乘法规则即可。泊松分布使用指数级数:

MX(t)=e−λ∑k=0∞(λet)kk!=e−λeλet.M_X(t)=e^{-\lambda}\sum_{k=0}^{\infty}\frac{(\lambda e^t)^k}{k!} =e^{-\lambda}e^{\lambda e^t}.

正态分布先配方:

tx−(x−μ)22σ2=−(x−μ−σ2t)22σ2+μt+σ2t22.tx-\frac{(x-\mu)^2}{2\sigma^2} =-\frac{(x-\mu-\sigma^2t)^2}{2\sigma^2} +\mu t+\frac{\sigma^2t^2}{2}.

移位后的正态密度积分仍为一,只留下表中的因子。指数分布在 [0,∞)[0,\infty) 上积分 λe−(λ−t)x\lambda e^{-(\lambda-t)x},恰在 t<λt<\lambda 时有限。均匀分布则在 [a,b][a,b] 上积分 etx/(b−a)e^{tx}/(b-a);t=0t=0 时被积函数为常数,商式中的奇点只是可去奇点。

完整计算一次矩

对泊松变量,

MX′(t)=λetMX(t),MX′′(t)=(λet+λ2e2t)MX(t).M'_X(t)=\lambda e^tM_X(t),\qquad M''_X(t)=(\lambda e^t+\lambda^2e^{2t})M_X(t).

所以 E[X]=λE[X]=\lambda,E[X2]=λ+λ2E[X^2]=\lambda+\lambda^2,进而 Var⁡(X)=λ\operatorname{Var}(X)=\lambda。最后一步使用的二阶矩恒等式已在期望与方差中证明。

参考文献

  1. [1] M. I. of Technology, “Fundamentals of Probability: Lecture 13, Moment Generating Functions,” 2018. https://ocw.mit.edu/courses/6-436j-fundamentals-of-probability-fall-2018/1a592ed184fb4c444547f67c9bcdd8ec_MIT6_436JF18_lec13.pdf ↩