Transformer 与 Attention
2017 年 Transformer 架构出现之后,自然语言处理领域发生了巨大的变化。
Self-Attention
Self-Attention 允许模型判断输入序列中不同 Token 之间的重要程度。
核心公式:
Code
Attention(Q, K, V) = softmax(QK^T / sqrt(dk))VTransformer 的优势
相比 RNN,它能够:
- 并行计算
- 建模长距离依赖
- 更容易扩展模型规模
现代主流 LLM 基本都建立在 Transformer 架构之上。
赞赏支持
如果这些经验帮你少走了弯路, 欢迎请我喝杯咖啡补充脑力。☕
文章已读完,感谢你的耐心阅读 🙏
评论交流
认真讨论,友善表达
0/1000
还没有评论
成为第一个参与讨论的人。
全部评论