程序猿阿森头像
关注
Transformer 相对 CNN/RNN 的核心优势:全局依赖、并行计算与可扩展性封面图

Transformer 相对 CNN/RNN 的核心优势:全局依赖、并行计算与可扩展性

本文从全局依赖、并行计算、可扩展性三个维度,系统对比 Transformer 与 CNN、RNN 的差异,解释为什么 Transformer 能成为大模型时代的基础架构。


一、为什么需要对比?

在 Transformer 出现之前,处理序列数据的主流架构是:

架构 代表 核心思想
RNN LSTM、GRU 按时间步顺序处理
CNN TextCNN、ResNet 局部卷积 + 堆叠

它们都能处理序列,但都有各自的瓶颈。

Transformer(2017) 用自注意力机制替代循环和卷积,一次性解决了两个核心问题:

  • 长依赖

  • 并行计算


二、三大维度对比

维度一:依赖建模

架构 依赖范围 说明
Transformer 全局 任意两位置直接交互
RNN 序列 长距离信息衰减
CNN 局部 需堆叠扩大感受野

RNN 的问题:

  • 信息必须逐步传递

  • 长距离依赖会衰减

  • 「我 昨天 在 公园 看到 一只 可爱的 小猫」——处理「小猫」时可能忘了「昨天」

CNN 的问题:

  • 卷积核只看局部

  • 要靠堆叠多层才能扩大感受野

  • 仍然难以建模全局依赖

Transformer 的优势:

  • 自注意力让任意两个 token 直接建立关联

  • 不随距离衰减

  • 长依赖建模能力强


维度二:并行计算

转载自 CSDN-专业IT技术社区

原文链接:https://blog.csdn.net/qq_58109679/article/details/167084357

文章来源转载

评论

赞0

评论列表

微信小程序
QQ小程序

关于作者

点赞数:0
关注数:0
粉丝:0
文章:0
关注标签:0
加入于:--