(2)几何与线性代数

mathematics
linear-algebra
线性代数与几何的进阶内容。
发布于

2026年8月14日

线性变换的几何

首先,我们先理解一下Basis(基):
例如(1, 0), (0, 1),这两个向量可以生成整个二维空间,但是,同一个空间,可以有不同的basis。

假设有一个矩阵: $ A = \begin{bmatrix} a & b \\ c & d \end{bmatrix} $ 且有一个向量$v^T = \begin{bmatrix} x & y \end{bmatrix}

$

可以得出: Av = \begin{bmatrix}a & b \\ c & d\end{bmatrix} \begin{bmatrix}x\\ y \end{bmatrix} = \begin{bmatrix}ax+by\\ cx+dy \end{bmatrix} =x\begin{bmatrix}a\\ c \end{bmatrix}+y\begin{bmatrix}b\\ d \end{bmatrix} =x{A\begin{bmatrix} 1 \\ 0 \end{bmatrix}}+y{A\begin{bmatrix} 0 \\ 1 \end{bmatrix}} 从这我们可以看出,一个矩阵可以变换为任意新矩阵或向量

我们再用一个具体的例子来说明:

可以看出,矩阵本质上是把基向量进行了转化,本例中的基向量(1, 0)➡(1, -1), (0, 1)➡(2, 3)

具体情况如图:

我们可以得到以下结论,矩阵对空间进行了倾斜,旋转,缩放,但是只能做线性变换!

但是,有的矩阵,如$ B = \begin{bmatrix} 2 & -1 \\ 4 & -2 \end{bmatrix} ,其转化后的两个向量为 \begin{bmatrix} 2\\ 4 \end{bmatrix} , \begin{bmatrix} -1\\ -2 \end{bmatrix}

$ 这两个向量是反向的,坐标轴从平面变成了一条直线,这就导致了信息丢失了,维度缺少了。

线性相关

前一部分的最后一部分,可以看出其转换后的基向量,呈倍数关系,显然有一个向量是多余的。

定义:存在不全为0的系数a,使得: a_1v_1+a_2v_2+a_3v_3+...+a_kv_k=0 就叫线性相关,反之,只有全为零系数,才满足该公式的,称为线性无关。

线性相关与无关是针对于向量集合而言的,每个向量都需要进行考虑。

矩阵的秩

如果我们有一个n×m大小的矩阵,有个问题,这个矩阵最终把向量映射到一个几维的空间去?

在线性相关部分我们可以看出,如果矩阵的列向量之间存在线性相关,代表有的向量就是无意义的,那么矩阵实际上把空间压缩到了更低维度。

因此,我们可以利用”有没有压缩”,来定义矩阵的秩:

$ rank(A) = 最大线性无关列数 $

rank就是有多少个真正不同的方向。

下面我们用几个例子来解释其具体含义。

可逆性

我们前面学习到,如果一个矩阵的列向量之间存在线性相关的关系,那么这个矩阵的乘法是无法被逆转的,所以说不存在一个逆操作。

反之,对于一个满秩矩阵,如A \in \mathbb{R}^{n \times n}, 且rank(A)=n,那么我们可以找到一个逆矩阵,逆转其原本的线性转化。

在此之前,我们先介绍一下单位矩阵,其是一个与A同样形状大小的矩阵,且只有主对角线元素为1,其余元素均为0,即: I_n = \begin{bmatrix} 1 & 0 & \cdots & 0 \\ 0 & 1 & \cdots & 0 \\ \vdots & \vdots & \ddots & \vdots \\ 0 & 0 & \cdots & 1 \end{bmatrix} 对于任意矩阵:AI=A

根据前文我们可以知道,逆矩阵就是为了撤销A做的事,寻找A^{-1}, 其满足:A^{-1}A=AA^{-1}=I

只要行列式det(A)≠0,我们就说矩阵A一定可逆。实际计算中,我们通常不会直接求逆,使用高斯消元会更好一些。即构造一个(A,I)的矩阵,将其化简为(I,B),这时候,B就是A^{-1}

我们讨论一下其数值稳定性问题: 1. 低秩矩阵会导致不稳定,如例如显式计算时,要除以行列式,如\frac{1}{0.00001} = 100000,而如果我们加一点误差,\frac{1}{0.000011} = 90909可以看出来差别巨大。 2. 矩阵也一样,如果有$ A = \begin{bmatrix} 1 & 1 \\ 1 & 1.0001 \end{bmatrix} $ 与$ B = \begin{bmatrix} 1 & 1 \\ 1 & 1 \end{bmatrix}

,二者之间明明就差一点,但是rank(A)=2, rank(B)=1$

并且,一般来说,稀疏矩阵的逆矩阵基本都是非零元素,这对我们的内存消耗巨大。

因此,在工程实际中,我们常用更稳定的方法求解,而不是使用显式公式计算A^{-1}

行列式

行列式的物理意义就是,面积的变化比例

回到矩阵线性变化的那部分内容,我们利用矩阵A,转化了基向量。其面积会发生什么变化呢?

如图: 我们可以看出来,原本是一个单位正方形,S = 1,
变换后,是一个平行四边形S' = \lvert ad-bc \rvert = 5

即矩阵A把空间扩大了五倍。

故有以下总结:

因此我们可以得出,det(A)=0的时候,其rank<n,且是不可逆的。

一些常见操作

矩阵乘法:

有 $ A = \begin{bmatrix} a_{11} & a_{12} \\ a_{21} & a_{22} \end{bmatrix} $, $ B = \begin{bmatrix} b_{11} & b_{12} \\ b_{21} & b_{22} \end{bmatrix} $, $ C = \begin{bmatrix} c_{11} & c_{12} \\ c_{21} & c_{22} \end{bmatrix}

三个矩阵,假设C=AB$

我们是如何从AB变换到C的呢?其实只要以下一个公式即可: c_{ij}=\sum_{k}a_{ik}b_{kj}, 如c_{12}=a_{11}b_{12}+a_{12}b_{22} 即,在C矩阵的i行j列的这个元素,是由A矩阵的i行与B矩阵的j列各个元素相乘后累加得到的。

Tensor Contraction:
对于高维张量,我们要明确,哪些下标进行了处理?不然会有误解。

例如y_{il}=\sum_{jk}x_{ijk}a_{jk} 可能会有点难理解

可以理解为,X张量的形状为(2, 3, 4), A张量的形状为(3, 4),我们上面的公式就是,对于其第一个维度,即2,拆成了两个(3, 4)的矩阵X'_1,X'_2,然后让X'_1,X'_2A分别做矩阵内积,最后就可以得到结果了。

Einstein Notation 爱因斯坦求和约定:

求和自动发生在重复出现的指标上,如: y_{il}=x_{ijk}a_{jk} 与前文中的公式,差距就是不用写求和符号了。

以下有一些常用的公式定义:

  1. 矩阵的迹 trac : tr(A)=\sum_i a_{ij}

  2. 范数:常见的有L_1, L_2 ,以及P-范数,F-范数等等: L_1 Norm = \sum \lvert x_i \rvert L_2 Norm = \sqrt{\sum x^2_i } P-Norm = (\sum \lvert x_i \rvert^p)^{1/p} F-Norm = \sqrt{\sum \sum \lvert x_{ij} \rvert^2}

第一章就先结束吧 讲了一些最常见的线性代数的基础知识,张量是什么,向量怎么理解,点积与向量方向,超平面,矩阵是怎么作用的,矩阵的秩,线性相关,逆矩阵,行列式。