1、什么是相似矩阵
定义:设A,B都是n阶方阵,如果存在可逆矩阵P,使得
B=P^{-1}AP
就称:B和A相似。
对角化 P^{-1}AP=\Lambda,本质就是:矩阵A和对角矩阵Λ相似。
通俗大白话:
同一个线性变换,只是换了一组坐标系(基)去描述。
- A:在旧坐标系下的变换矩阵
- P:坐标变换矩阵(把旧坐标转为新坐标)
- \Lambda:同一套变换,在新的特征向量坐标系下,变成简单对角矩阵
举个生活化比喻:
同一个人,拍两张照片,一张正面拍、一张侧面拍。人本身没有变,只是观察的坐标系(角度)变了。
A、B相似 = 同一个线性变换,不同“拍照角度”。
2、相似矩阵有什么共同性质(重要,做题+AI底层都要用)
如果A \sim B(A相似于B)
1. 特征值完全相同;
2. 行列式相等 |A|=|B|;
3. 迹相等(主对角线求和)\mathrm{tr}(A)=\mathrm{tr}(B);
4. 秩相等 r(A)=r(B)。
⚠️注意:特征向量一般不一样!只是特征值相同。
对角化就是找一组最好的基(特征向量),把矩阵变成对角阵,计算大幅简化。
3、几何过程完整梳理
1. 输入一个向量\boldsymbol{x}(旧坐标系)
2. P^{-1}:把旧坐标,映射到特征向量构成的新坐标系
3. \Lambda(对角矩阵):只做简单的“各维度独立伸缩”,每个维度按对应特征值\lambda缩放,没有旋转、耦合
4. P:把计算完的结果,转换回原来坐标系
核心价值:原本矩阵A会把各个维度互相搅和耦合;经过相似对角化之后,各个维度互不干扰,各自伸缩。
4、对应AI大模型里面的实际意义
大模型里面大量权重矩阵,做特征分解、PCA主成分分析、Transformer注意力矩阵分析,底层就是相似对角化。
1. 注意力权重矩阵W,通过相似变换对角化之后:
- 对角上的特征值代表:这个方向上信息的重要程度;
- 大特征值:该方向信息能量强,代表关键语义;
- 很小的特征值:代表噪声、冗余信息,可以直接截断丢弃,实现降维、压缩模型。
2. 为什么要做对角化?
原始权重矩阵,维度之间互相纠缠耦合,很难看懂;
相似变换换到特征基之后,每个坐标轴独立,一眼看出哪些方向是有效信息,哪些是噪声。
模型压缩、降维、PCA降维、频谱分析,本质就是:相似对角化,保留大特征值,扔掉过小特征值。
5、容易踩坑易错点
1. 矩阵可对角化 ⇔ 和对角矩阵相似;不是所有矩阵都能对角化。不能对角化的矩阵叫亏损矩阵,不能找到一组特征向量做完整的坐标系。
2. 相似矩阵特征值一样,但是特征值相同,矩阵不一定相似。
例:A=\begin{pmatrix}1&0\\0&1\end{pmatrix},B=\begin{pmatrix}1&1\\0&1\end{pmatrix},特征值都是\lambda=1,但是不相似。
课后小思考题
已知 A=\begin{pmatrix} 3&1\\0&2 \end{pmatrix}
1. 求特征值;
2. 判断是否可以对角化;
3. 如果可以,写出P和对角阵\Lambda。
转载自 CSDN-专业IT技术社区
原文链接:https://blog.csdn.net/2601_96546232/article/details/165570320




