Transformer 与 Attention

2017 年 Transformer 架构出现之后,自然语言处理领域发生了巨大的变化。

Self-Attention

Self-Attention 允许模型判断输入序列中不同 Token 之间的重要程度。

核心公式:

Code
Attention(Q, K, V) = softmax(QK^T / sqrt(dk))V

Transformer 的优势

相比 RNN,它能够:

  • 并行计算
  • 建模长距离依赖
  • 更容易扩展模型规模

现代主流 LLM 基本都建立在 Transformer 架构之上。

文章已读完,感谢你的耐心阅读 🙏

评论交流

认真讨论,友善表达

0 条评论
0/1000

全部评论

还没有评论

成为第一个参与讨论的人。