一文彻底搞懂Transformer - 注意力机制
来源:互联网
时间:2026-08-17 14:23:20
在深入Transformer之前,得先搞明白它最核心的部件——注意力机制。这东西听起来玄乎,其实背后的逻辑挺直白:就是让模型在处理一串东西(比如一句话)时,别只顾着最后一个词,而是能回头看,知道哪里更重要。
一、注意力机制

注意力机制背景
注意力机制目标
Transformer注意力机制
注意力机制案例
二、注意力机制工作流程
注意力机制计算公式
注意力机制计算Q、K、V
- :输入序列的每个单词,都通过一个线性变换层,从嵌入向量映射出属于自己的Query、Key和Value。
生成Q、K、V向量
- :把Query和所有Key的内积算出来,分数越高说明关联越紧密。
计算Q、K点积(注意力分数)
- :对分数做Softmax,让它们变成总和为1的权重,代表每个位置该被“关注”多少。
Softmax归一化(注意力权重)
- :用这些权重去乘对应的Value,然后加起来。得到的新向量就是当前位置吸收了全局信息后的表示。
加权求和(加权和向量)
三、3种注意力机制
Transformer架构里,注意力层不是只有一个版本,而是根据位置和用途分成了三种。
编码器中的自注意力层
解码器中的交叉注意力层
解码器中的因果自注意力层
神经网络算法 - 一文搞懂Transformer中的三种注意力机制
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名