本文从全局依赖、并行计算、可扩展性三个维度,系统对比 Transformer 与 CNN、RNN 的差异,解释为什么 Transformer 能成为大模型时代的基础架构。
一、为什么需要对比?
在 Transformer 出现之前,处理序列数据的主流架构是:
| 架构 | 代表 | 核心思想 |
|---|---|---|
| RNN | LSTM、GRU | 按时间步顺序处理 |
| CNN | TextCNN、ResNet | 局部卷积 + 堆叠 |
它们都能处理序列,但都有各自的瓶颈。
Transformer(2017) 用自注意力机制替代循环和卷积,一次性解决了两个核心问题:
-
长依赖
-
并行计算
二、三大维度对比
维度一:依赖建模
| 架构 | 依赖范围 | 说明 |
|---|---|---|
| Transformer | 全局 | 任意两位置直接交互 |
| RNN | 序列 | 长距离信息衰减 |
| CNN | 局部 | 需堆叠扩大感受野 |
RNN 的问题:
-
信息必须逐步传递
-
长距离依赖会衰减
-
「我 昨天 在 公园 看到 一只 可爱的 小猫」——处理「小猫」时可能忘了「昨天」
CNN 的问题:
-
卷积核只看局部
-
要靠堆叠多层才能扩大感受野
-
仍然难以建模全局依赖
Transformer 的优势:
-
自注意力让任意两个 token 直接建立关联
-
不随距离衰减
-
长依赖建模能力强
维度二:并行计算
转载自 CSDN-专业IT技术社区
原文链接:https://blog.csdn.net/qq_58109679/article/details/167084357




