向量空间规定一类对象内部的运算,线性映射则在空间之间保持这些运算。有了基与坐标,就能准确说明一张矩阵何时足以表示整个映射。

保持线性组合

如果 T:V→WT:V\to W 满足

T(au+bv)=aT(u)+bT(v),T(a\mathbf u+b\mathbf v) =aT(\mathbf u)+bT(\mathbf v),

就称 TT 为线性映射。它把“先组合再处理”与“先处理再组合”联系起来。第一章的响应模型正是在假设这一性质。

这里有两个不同问题:向量空间规定对象内部怎样加、怎样缩放;线性映射规定从一种对象到另一种对象的处理是否保留这些运算。仅有向量作为输入,并不能保证处理过程线性。

一个直接推论是 T(0)=0T(\mathbf0)=\mathbf0:把加法保持性质用于 0+0\mathbf0+\mathbf0,再消去一项即可。因而加上固定非零偏移的映射不是线性的。例如 T(v)=v+cT(\mathbf v)=\mathbf v+\mathbf c 更适合称为仿射映射。是否先减去基准值,在建模中有实际意义。

检查线性,必须检查任意输入

保持加法与保持数乘可以分别写为

T(u+v)=T(u)+T(v),T(av)=aT(v).T(\mathbf u+\mathbf v)=T(\mathbf u)+T(\mathbf v),\qquad T(a\mathbf v)=aT(\mathbf v).

两条一起成立,就推出任意两项线性组合的保持性质。反过来,在组合公式中分别取 a=b=1a=b=1,或令一个向量为零,也能得到这两条。因此可以选方便的形式检验,但量词必须覆盖所有输入与标量。

例如,T(x,y)=(x+2y,3x−y)T(x,y)=(x+2y,3x-y) 的输出每个分量都是输入的固定线性组合,所以逐分量展开即可验证线性。

而 T(x,y)=(x,y2)T(x,y)=(x,y^2) 虽然把零映成零,却有

T(0,2)=(0,4)≠2T(0,1)=(0,2).T(0,2)=(0,4)\ne2T(0,1)=(0,2).

一个反例就足以否定线性;检查几个“碰巧成立”的输入却不足以证明线性。

还要区分线性与仿射。在 T(x)=Ax+bT(\mathbf x)=A\mathbf x+\mathbf b 中,固定偏移 b≠0\mathbf b\ne0 破坏了零映到零的性质。但若把输出改为相对于 b\mathbf b 的变化量,剩余规则 x↦Ax\mathbf x\mapsto A\mathbf x 是线性的。这解释了为什么建模时经常先减去基准状态。

核、像与方程的解集

线性映射的核与像分别为

ker⁡T={v:T(v)=0},im⁡T={T(v):v∈V}.\ker T=\{\mathbf v:T(\mathbf v)=\mathbf0\},\qquad \operatorname{im}T=\{T(\mathbf v):\mathbf v\in V\}.

核收集无法从输出区分的变化;像收集能够产生的输出。线性性保证二者都是各自空间的子空间。

核与像为什么都是子空间

若 u,v∈ker⁡T\mathbf u,\mathbf v\in\ker T,线性性给出

T(au+bv)=a0+b0=0,T(a\mathbf u+b\mathbf v)=a\mathbf0+b\mathbf0=\mathbf0,

所以核对线性组合封闭。它也含零向量。

若 y1=T(u)\mathbf y_1=T(\mathbf u)、y2=T(v)\mathbf y_2=T(\mathbf v) 属于像,则

ay1+by2=T(au+bv),a\mathbf y_1+b\mathbf y_2=T(a\mathbf u+b\mathbf v),

仍然是某个输入的像。注意核属于定义域 VV,像属于陪域 WW,两者甚至可能有不同维数。

有限维情形的维数关系也可以直接从基证明。取核的一组基,并补成定义域的基。新增基向量的像生成整个像空间,因为核中的部分映为零;它们的像也无关,否则一个非平凡组合会落回核,与扩充后的基无关相矛盾。因此

dim⁡V=dim⁡ker⁡T+dim⁡im⁡T.\dim V=\dim\ker T+\dim\operatorname{im}T.

单射、满射与可逆性

TT 是单射,当且仅当 ker⁡T={0}\ker T=\{\mathbf0\}。若单射,只有零输入能映成零;反过来,若 T(u)=T(v)T(\mathbf u)=T(\mathbf v),则 u−v∈ker⁡T\mathbf u-\mathbf v\in\ker T,核只有零就迫使两个输入相同。

TT 是满射,当且仅当 im⁡T=W\operatorname{im}T=W。因此可逆要求两件事同时成立:所有输出都能达到,而且每个输出只有一个原像。

若 V,WV,W 都有限维,且 dim⁡V=dim⁡W=n\dim V=\dim W=n,秩与零空间维数的关系说明,单射与满射等价:核为零就使像维数为 nn;像等于 WW 也使核维数为零。若两端维数不同,这个等价不成立。例如

J:R2→R3,J(x,y)=(x,y,0)J:\mathbb R^2\to\mathbb R^3,\quad J(x,y)=(x,y,0)

是单射但不是满射,而

R:R3→R2,R(x,y,z)=(x,y)R:\mathbb R^3\to\mathbb R^2,\quad R(x,y,z)=(x,y)

是满射但不是单射。后者丢掉了整个 zz 方向。

从具体映射读出核、像与全部原像

考虑

T:R3→R2,T(x,y,z)=(x+y,y+z).\begin{gathered} T:\mathbb R^3\to\mathbb R^2,\\ T(x,y,z)=(x+y,y+z). \end{gathered}

求核就是令输出为零:x=−y,z=−yx=-y,z=-y,故

ker⁡T=span⁡((−1,1,−1)).\ker T=\operatorname{span}((-1,1,-1)).

对任意目标 (p,q)(p,q),取输入 (p,0,q)(p,0,q) 就能到达,所以像是整个 R2\mathbb R^2。这是满射,但一维的核使原像不唯一:

T−1({(p,q)})={(p−t,t,q−t):t∈R}.T^{-1}(\{(p,q)\}) =\{(p-t,t,q-t):t\in\mathbb R\}.

这里的 T−1T^{-1} 表示集合的原像,不意味着 TT 存在逆函数。核、像与原像分别回答:哪些变化丢失、哪些输出可达、某个输出来自哪些输入。

一个输出的全部原像

若 T(v)=bT(\mathbf v)=\mathbf b 有一个特解 vp\mathbf v_p,那么全部解恰好为

vp+ker⁡T.\mathbf v_p+\ker T.

因为任意两解之差都映为零,而给特解加上核中的元素仍映为 b\mathbf b。当 b≠0\mathbf b\ne\mathbf0 时,这个解集不含零向量,因此不是线性子空间。

这就是交通流参数解背后的结构。后续电路微分方程中的“齐次解加特解”也会用同一条论证;非线性方程则不能直接套用叠加原则。

有限维线性映射为什么由一张矩阵完全确定

设 VV 有有序基 B=(b1,…,bn)\mathcal B=(\mathbf b_1,\ldots,\mathbf b_n),WW 有有序基 C=(c1,…,cm)\mathcal C=(\mathbf c_1,\ldots,\mathbf c_m)。已知 TT 对基向量的作用,就能计算任意输入的输出:

v=∑jxjbj⟹T(v)=∑jxjT(bj).\mathbf v=\sum_j x_j\mathbf b_j \quad\Longrightarrow\quad T(\mathbf v)=\sum_j x_jT(\mathbf b_j).

把 T(bj)T(\mathbf b_j) 在基 C\mathcal C 下的坐标作为矩阵 AA 的第 jj 列,就得到

[T(v)]C=A[v]B.[T(\mathbf v)]_{\mathcal C}=A[\mathbf v]_{\mathcal B}.

左侧是输出向量的坐标,不能把矩阵 AA 本身当作空间 VV 的元素。

这不仅说明“能找到一个矩阵”,还说明对应关系是唯一的:相同的矩阵给出相同的基向量像,线性性再迫使所有输入的像相同。反过来,任意 m×nm\times n 矩阵都能按这个公式定义一个线性映射。因此,在两端有限维且基已经固定时,线性映射与这些矩阵一一对应。

求导也可以有矩阵表示

考虑次数不超过二的多项式空间 P2\mathcal P_2,基取 (1,t,t2)(1,t,t^2)。求导算子 DD 满足

D(1)=0,D(t)=1,D(t2)=2t.D(1)=0,\qquad D(t)=1,\qquad D(t^2)=2t.

把三个输出的坐标放成列:

[D]B←B=(010002000).[D]_{\mathcal B\leftarrow\mathcal B} =\begin{pmatrix}0&1&0\\0&0&2\\0&0&0\end{pmatrix}.

因此系数 (a,b,c)T(a,b,c)^{\mathsf T} 映成 (b,2c,0)T(b,2c,0)^{\mathsf T},恰好对应 (a+bt+ct2)′=b+2ct(a+bt+ct^2)'=b+2ct。三次作用后得到零矩阵,因为二次以下的多项式求三次导都为零。

这里选定了一个有限维、对求导封闭的空间。全部多项式的空间是无限维的,不能直接用这一张固定大小的矩阵表示其上的完整求导算子;一般函数空间也不能跳过这个限制。

换基改变矩阵,不改变映射

为简化记号,考虑 T:V→VT:V\to V。旧基下的矩阵为 AA,新基向量在旧基下的坐标组成矩阵 SS。于是

[v]old=S[v]new.[\mathbf v]_{\mathrm{old}}=S[\mathbf v]_{\mathrm{new}}.

先将输入换成旧坐标,施加 AA,再将输出换回新坐标,得到

Anew=S−1AS.A_{\mathrm{new}}=S^{-1}AS.

例如旧坐标下 A=diag⁡(2,1)A=\operatorname{diag}(2,1),新基取 (1,1),(1,−1)(1,1),(1,-1),则

S=(111−1),Anew=(3/21/21/23/2).S=\begin{pmatrix}1&1\\1&-1\end{pmatrix},\qquad A_{\mathrm{new}}=\begin{pmatrix}3/2&1/2\\1/2&3/2\end{pmatrix}.

第一列表示:原来的向量 (1,1)(1,1) 经变换成为 (2,1)(2,1),在新基下坐标为 (3/2,1/2)(3/2,1/2)。映射仍然把旧坐标的第一分量扩大两倍,变化的是描述方法。

两端使用不同基时怎样计算

一般的 T:V→WT:V\to W 不要求两端是同一个空间。设旧基下矩阵为 AA,定义域的新基向量在旧基下的坐标组成 SS,陪域的新基向量在旧基下的坐标组成 RR,那么

Anew=R−1AS.A_{\mathrm{new}}=R^{-1}AS.

右侧的 SS 负责输入坐标,左侧的 R−1R^{-1} 负责输出坐标。只有对同一空间使用同一次换基,才化成 S−1ASS^{-1}AS。

例如恒等映射 I:R2→R2I:\mathbb R^2\to\mathbb R^2,定义域用基 (1,1),(1,−1)(1,1),(1,-1),陪域用标准基,则矩阵为

[I]standard←new=(111−1).[I]_{\mathrm{standard}\leftarrow\mathrm{new}} =\begin{pmatrix}1&1\\1&-1\end{pmatrix}.

它并非单位矩阵,因为输入和输出采用不同的坐标系统。输入坐标 (1,0)(1,0) 表示向量 (1,1)(1,1),输出的标准坐标自然是 (1,1)(1,1)。只有两端使用相同基时,恒等映射才表示为单位矩阵。

复合映射的中间坐标必须一致

若 T:U→VT:U\to V 的矩阵为 AA,S:V→WS:V\to W 的矩阵为 BB,且两者在中间空间 VV 使用同一组基,那么 S∘TS\circ T 的矩阵是 BABA。

如果一个输出用旧基、另一个输入用新基,就必须先插入换基矩阵,不能仅看数字数组的大小吻合便直接相乘。坐标的语义与维数一样重要。

练习

练习零映到零,是否就说明线性

设 T(x,y)=(x,y2)T(x,y)=(x,y^2)。它满足 T(0,0)=(0,0)T(0,0)=(0,0),但是否为线性映射?

解答

不是。取 v=(0,1)\mathbf v=(0,1),则 T(2v)=(0,4)T(2\mathbf v)=(0,4),而 2T(v)=(0,2)2T(\mathbf v)=(0,2),不满足缩放保持性质。零映到零只是线性的必要条件,并非充分条件。

练习把函数映成一个数

对定义在实数上的实值函数,定义 E(f)=f(0)E(f)=f(0)。证明 EE 是从函数空间到 R\mathbb R 的线性映射,并说明为什么它不能唯一恢复原函数。

解答

按逐点运算定义,

E(af+bg)=af(0)+bg(0)=aE(f)+bE(g).E(af+bg)=a f(0)+b g(0)=aE(f)+bE(g).

因此 EE 线性。但零函数与函数 f(t)=tf(t)=t 都映为零,说明这个映射不是单射。保持线性组合与保留全部信息,是两个不同要求。

练习采样映射丢掉什么

在 P2\mathcal P_2 上定义 E(p)=(p(0),p(1))E(p)=(p(0),p(1))。求核的一组基,并判断它是否满射。

解答

令 p(t)=a+bt+ct2p(t)=a+bt+ct^2。核的条件为 a=0,b+c=0a=0,b+c=0,所以核由 t(t−1)t(t-1) 张成。任意 (u,v)(u,v) 可由 p(t)=u+(v−u)tp(t)=u+(v-u)t 达到,所以满射,但不单射。

练习基的顺序不能省略

若将定义域基的第一、第二个向量交换,而陪域基不变,映射矩阵怎样改变?

解答

矩阵的第 jj 列是第 jj 个定义域基向量的像,因此交换对应两列。输出坐标基未变,不应同时交换行。这里与图的节点重编号所做的双边置换不同。