transformer是用注意力代替记忆的序列处理架构,核心包括自注意力机制、多头协同、位置编码、堆叠编码器和掩码解码器五部分。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您听到“Transformer”这个词,却不清楚它在大模型中扮演什么角色,那很可能是因为它被裹挟在大量数学公式和工程术语中。其实,Transformer并不是某种神秘硬件或黑箱算法,而是一套全新的、用注意力代替记忆的序列处理逻辑。以下是用直观方式拆解它的关键环节:
一、它不靠“记性”,靠“盯住重点”
传统模型如RNN像逐字默读小说的人,必须读完前一句才能理解后一句,既慢又容易遗忘开头。Transformer则像一位同时扫视整页文字的编辑,能瞬间判断“总统”和“签署”之间关系更紧,而不是机械地只看邻近词。这种能力来自自注意力机制——它让每个词主动计算自己与句中所有其他词的相关程度。
1、把每个词变成三个向量:Query(提问向量)、Key(标签向量)、Value(内容向量)。
2、用Query和所有Key做点积,得到一组“匹配分”,再经Softmax归一化为权重。
3、用这些权重加权求和所有Value,生成该词的新表示——这个新表示已融合了全句中最相关的上下文信息。
二、它不是单眼看,而是“多视角协同”
单个注意力头容易偏科,比如只关注语法主谓,忽略情感修饰。Transformer让模型并行运行多个独立的注意力头,每个头学习不同的关联模式,再把结果拼接起来重新投影。这就像请多位专家分别审阅同一段话,有人专看逻辑链,有人紧盯情绪词,最后汇总成更立体的理解。
1、将输入向量线性投影为多组Q/K/V,组数即头数(如8头)。
2、每组独立执行自注意力计算,产出一个子结果。
3、将全部子结果沿特征维度拼接,再经一次线性变换压缩回原始维度。
三、它不认识“前后”,所以得“贴座位号”
自注意力本身对词序完全无感——打乱“猫追老鼠”和“老鼠追猫”的向量顺序,计算结果可能一模一样。为此,Transformer在词向量上叠加位置编码,相当于给每个词发一张带编号的座位卡。这个编号不是简单数字,而是由正弦和余弦函数生成的实数值向量,确保模型能推断出“第5位”和“第10位”之间的距离关系,也能泛化到从未见过的更长句子。
1、设定模型总维度d_model(如512),对每个位置pos和每个维度i,按公式生成值。
将小说章节转换为电影分镜剧本。用户上传txt/md/docx文本,AI分析场景、角色、情绪、镜头语言,输出专业分镜脚本。适用于用户提及“分镜”“storyboard”“小说转分镜”“影视改编”“镜头脚本”或需要将小说改编为分镜的场景。
2、偶数维使用sin(pos/10000^(2i/d_model)),奇数维使用cos(pos/10000^(2i/d_model))。
3、将该位置编码向量直接加到对应词嵌入向量上,作为最终输入。
四、它靠“堆叠+校准”加深理解
单层注意力只能捕捉浅层关联,比如“他”指代“张三”。要理解“因为张三迟到,所以会议取消,导致项目延期”,需要多层抽象。Transformer用N个结构相同的编码器层纵向堆叠,每层输出都经过残差连接和层归一化——前者防止信号衰减,后者稳定训练波动,使深层网络依然可训可用。
1、每一编码器层包含两个子层:多头自注意力子层、前馈神经网络子层。
2、每个子层输出先与输入相加(残差连接),再做层归一化(LayerNorm)。
3、前馈网络由两层线性变换夹着ReLU激活构成,对每个位置独立操作,不共享参数。
五、它翻译时“边写边瞄”,不偷看答案
解码器在生成目标句时,不能提前知道后面要写的词,否则会作弊。因此第一子层采用掩码自注意力:当前词只能看到自己及之前生成的词,后续位置权重被强制设为负无穷,Softmax后变为零。第二子层才是编码器-解码器注意力,让解码器每一步都能聚焦于编码器输出中最相关的源语片段。
1、在计算注意力分数矩阵时,将下三角以外的所有位置填入负无穷大值。
2、对该矩阵做Softmax,确保每行概率和为1,且未来位置无贡献。
3、用此掩码权重与Value相乘,完成仅依赖历史的自注意力更新。










