船厂电气自动化ai大模型头像
关注
AI大模型与数学|第79课 课程主题:相似矩阵、相似对角化的几何含义 + 在大模型中的作用封面图

AI大模型与数学|第79课 课程主题:相似矩阵、相似对角化的几何含义 + 在大模型中的作用

1、什么是相似矩阵

定义:设A,B都是n阶方阵,如果存在可逆矩阵P,使得

B=P^{-1}AP

就称:B和A相似。

对角化 P^{-1}AP=\Lambda,本质就是:矩阵A和对角矩阵Λ相似。

通俗大白话:

同一个线性变换,只是换了一组坐标系(基)去描述。

- A:在旧坐标系下的变换矩阵

- P:坐标变换矩阵(把旧坐标转为新坐标)

- \Lambda:同一套变换,在新的特征向量坐标系下,变成简单对角矩阵

举个生活化比喻:

同一个人,拍两张照片,一张正面拍、一张侧面拍。人本身没有变,只是观察的坐标系(角度)变了。

A、B相似 = 同一个线性变换,不同“拍照角度”。

2、相似矩阵有什么共同性质(重要,做题+AI底层都要用)

如果A \sim B(A相似于B)

1. 特征值完全相同;

2. 行列式相等 |A|=|B|;

3. 迹相等(主对角线求和)\mathrm{tr}(A)=\mathrm{tr}(B);

4. 秩相等 r(A)=r(B)。

⚠️注意:特征向量一般不一样!只是特征值相同。

对角化就是找一组最好的基(特征向量),把矩阵变成对角阵,计算大幅简化。

3、几何过程完整梳理

1. 输入一个向量\boldsymbol{x}(旧坐标系)

2. P^{-1}:把旧坐标,映射到特征向量构成的新坐标系

3. \Lambda(对角矩阵):只做简单的“各维度独立伸缩”,每个维度按对应特征值\lambda缩放,没有旋转、耦合

4. P:把计算完的结果,转换回原来坐标系

核心价值:原本矩阵A会把各个维度互相搅和耦合;经过相似对角化之后,各个维度互不干扰,各自伸缩。

4、对应AI大模型里面的实际意义

大模型里面大量权重矩阵,做特征分解、PCA主成分分析、Transformer注意力矩阵分析,底层就是相似对角化。

1. 注意力权重矩阵W,通过相似变换对角化之后:

- 对角上的特征值代表:这个方向上信息的重要程度;

- 大特征值:该方向信息能量强,代表关键语义;

- 很小的特征值:代表噪声、冗余信息,可以直接截断丢弃,实现降维、压缩模型。

2. 为什么要做对角化?

原始权重矩阵,维度之间互相纠缠耦合,很难看懂;

相似变换换到特征基之后,每个坐标轴独立,一眼看出哪些方向是有效信息,哪些是噪声。

模型压缩、降维、PCA降维、频谱分析,本质就是:相似对角化,保留大特征值,扔掉过小特征值。

5、容易踩坑易错点

1. 矩阵可对角化 ⇔ 和对角矩阵相似;不是所有矩阵都能对角化。不能对角化的矩阵叫亏损矩阵,不能找到一组特征向量做完整的坐标系。

2. 相似矩阵特征值一样,但是特征值相同,矩阵不一定相似。

例:A=\begin{pmatrix}1&0\\0&1\end{pmatrix},B=\begin{pmatrix}1&1\\0&1\end{pmatrix},特征值都是\lambda=1,但是不相似。

课后小思考题

已知 A=\begin{pmatrix} 3&1\\0&2 \end{pmatrix}

1. 求特征值;

2. 判断是否可以对角化;

3. 如果可以,写出P和对角阵\Lambda。

转载自 CSDN-专业IT技术社区

原文链接:https://blog.csdn.net/2601_96546232/article/details/165570320

文章来源转载

评论

赞0

评论列表

微信小程序
QQ小程序

关于作者

点赞数:0
关注数:0
粉丝:0
文章:0
关注标签:0
加入于:--