transfomer中Multi-Head Attention的源码实现

2024-01-17 02:12

本文主要是介绍transfomer中Multi-Head Attention的源码实现,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

简介

Multi-Head Attention是一种注意力机制,是transfomer的核心机制,就是图中黄色框内的部分.
在这里插入图片描述

Multi-Head Attention的原理是通过将模型分为多个头,形成多个子空间,让模型关注不同方面的信息。每个头独立进行注意力运算,得到一个注意力权重矩阵。输出的结果再通过线性变换和拼接操作组合在一起。这样可以提高模型的表示能力和泛化性能。
在Multi-Head Attention中,每个头的权重矩阵是随机初始化生成的,并在训练过程中通过梯度下降等优化算法进行更新。通过这种方式,模型可以学习到如何将输入序列的不同部分关联起来,从而捕获更多的上下文信息。
总之,Multi-Head Attention通过将模型分为多个头,形成多个子空间,让模型关注不同方面的信息,提高了模型的表示能力和泛化性能。它的源码实现基于Scaled Dot-Product Attention,通过并行运算和组合输出来实现多头注意力机制。

源码实现:

具体源码及其注释如下,配好环境可直接运行:

import torch
from torch import nnclass MultiheadAttention(nn.Module):def __init__(self,embed_dim,num_heads,att_dropout=0.1,out_dropout=0.1,average_attn_weights=True,use_separate_proj_weight = False,device=None,dtype=None):super(MultiheadAttention, self).__init__()self.embed_dim = embed_dimself.num_heads = num_headsself.att_dropout = nn.Dropout(att_dropout)self.out_dropout = nn.Dropout(out_dropout)self.average_attn_weights = average_attn_weightsself.head_dim = embed_dim // num_headsself.scale = self.head_dim ** 0.5assert self.embed_dim == self.num_heads * self.head_dim, \'embed_dim <{}> must be divisible by num_heads <{}>'.format(self.embed_dim, self.num_heads)self.fuse_heads = nn.Linear(self.embed_dim, self.embed_dim)factory_kwargs = {'device': device, 'dtype': dtype}self.use_separate_proj_weight = use_separate_proj_weight # 是否对输入进行线性映射if not use_separate_proj_weight:self.in_proj_weight = nn.Parameter(torch.empty((3 * embed_dim, embed_dim), **factory_kwargs))self.in_proj_bias = nn.Parameter(torch.empty(3 * embed_dim, **factory_kwargs))self._reset_parameters()def _reset_parameters(self):nn.init.xavier_uniform_(self.in_proj_weight)nn.init.constant_(self.in_proj_bias, 0.)def forward(self,query: torch.Tensor,key: torch.Tensor,value: torch.Tensor,identity=None,query_pos=None,key_pos=None,use_separate_proj_weight: bool = False):'''Args:query:key:value:identity:query_pos:key_pos:use_separate_proj_weight: 参考pytorchReturns:'''assert query.dim() == 3 and key.dim() == 3 and value.dim() == 3assert key.shape == value.shape, f"key shape {key.shape} does not match value shape {value.shape}"tgt_len, bsz, embed_dim = query.shape  # [查询数量 batch数量 特征维度]src_len, _, _ = key.shape  # [被查询数量,_,_]# 默认和query进行shortcut(要在位置编码前,因为output为输出特征,特征和原特征shortcut,下一层再重新加位置编码,否则不就重了)if identity is None:identity = query.clone()# 位置编码if query_pos is not None:query = query + query_posif key_pos is not None:key = key + key_pos# 是否需要对输入进行映射,mmcv中 q=k=v,那么就需要此处进行映射if not self.use_separate_proj_weight:assert self.in_proj_weight is not None, "use_separate_proj_weight is False but in_proj_weight is None"query, key, value = nn.functional._in_projection_packed(query, key, value, self.in_proj_weight, self.in_proj_bias)# 特征划分为self.num_heads 份 [tgt,b,embed_dim] -> [b,n_h, tgt, d_h]# [n,b,n_h*d_h] -> [b,n_h,n,d_h] 主要是target和source之前的特征匹配和提取, batch和n_h维度不处理query = query.contiguous().view(tgt_len, bsz, self.num_heads, self.head_dim).permute(1, 2, 0, 3)key = key.contiguous().view(src_len, bsz, self.num_heads, self.head_dim).permute(1, 2, 0, 3)value = value.contiguous().view(src_len, bsz, self.num_heads, self.head_dim).permute(1, 2, 0, 3)# [b,n_h,tgt_len,src_len]# Scaled Dot-Product Attentionattention = query @ key.transpose(-2, -1)attention /= self.scale  # 参考: https://blog.csdn.net/zwhdldz/article/details/135462127attention = torch.softmax(attention, dim=-1)  # 行概率矩阵attention = self.att_dropout(input=attention)  # 正则化方法 DropKey,用于缓解 Vision Transformer 中的过拟合问题# [b,n_h,tgt_len,d_h] = [b,n_h,tgt_len,src_len] * [b,n_h,src_len,d_h]output = attention @ value# [b,n_h,tgt_len,d_h] -> [b,tgt_len,embed_dim]output = output.permute(0, 2, 1, 3).contiguous().view(tgt_len, bsz, embed_dim)# 头之间通过全连接融合一下output = self.fuse_heads(output)output = self.out_dropout(output)# shortcutoutput = output + identity# 多头head求平均if self.average_attn_weights:attention = attention.sum(dim=1) / self.num_heads# [tgt_len,b,embed_dim],[b,tgt_len,src_len]return output, attentionif __name__ == '__main__':query = torch.rand(size=(10, 2, 64))key = torch.rand(size=(5, 2, 64))value = torch.rand(size=(5, 2, 64))query_pos = torch.rand(size=(10, 2, 64))key_pos = torch.rand(size=(5, 2, 64))att = MultiheadAttention(64, 4)# 返回特征采样结果和attention矩阵output = att(query=query, key=key, value=value,query_pos=query_pos,key_pos=key_pos)pass

具体流程说明:

  1. 将input映射为qkv,如果是cross_attention,q与kv的行数可以不同,但列数(编码维度/通道数)必须相同
  2. q和v附加位置编码
  3. Scaled Dot-Product :通过计算Query和Key之间的点积除以scale得到注意力权重,经过dropout再与Value矩阵相乘得到输出。*scale和dropout的说明参考我的上一篇博客
  4. 输出的结果再通过线性变换融合多头信息。

在实现中,参考pytorch我在内部加输入映射,具体作用参考下一篇博客。

这篇关于transfomer中Multi-Head Attention的源码实现的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/614624

相关文章

MySQL中查找重复值的实现

《MySQL中查找重复值的实现》查找重复值是一项常见需求,比如在数据清理、数据分析、数据质量检查等场景下,我们常常需要找出表中某列或多列的重复值,具有一定的参考价值,感兴趣的可以了解一下... 目录技术背景实现步骤方法一:使用GROUP BY和HAVING子句方法二:仅返回重复值方法三:返回完整记录方法四:

IDEA中新建/切换Git分支的实现步骤

《IDEA中新建/切换Git分支的实现步骤》本文主要介绍了IDEA中新建/切换Git分支的实现步骤,通过菜单创建新分支并选择是否切换,创建后在Git详情或右键Checkout中切换分支,感兴趣的可以了... 前提:项目已被Git托管1、点击上方栏Git->NewBrancjsh...2、输入新的分支的

Python实现对阿里云OSS对象存储的操作详解

《Python实现对阿里云OSS对象存储的操作详解》这篇文章主要为大家详细介绍了Python实现对阿里云OSS对象存储的操作相关知识,包括连接,上传,下载,列举等功能,感兴趣的小伙伴可以了解下... 目录一、直接使用代码二、详细使用1. 环境准备2. 初始化配置3. bucket配置创建4. 文件上传到os

关于集合与数组转换实现方法

《关于集合与数组转换实现方法》:本文主要介绍关于集合与数组转换实现方法,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录1、Arrays.asList()1.1、方法作用1.2、内部实现1.3、修改元素的影响1.4、注意事项2、list.toArray()2.1、方

使用Python实现可恢复式多线程下载器

《使用Python实现可恢复式多线程下载器》在数字时代,大文件下载已成为日常操作,本文将手把手教你用Python打造专业级下载器,实现断点续传,多线程加速,速度限制等功能,感兴趣的小伙伴可以了解下... 目录一、智能续传:从崩溃边缘抢救进度二、多线程加速:榨干网络带宽三、速度控制:做网络的好邻居四、终端交互

java实现docker镜像上传到harbor仓库的方式

《java实现docker镜像上传到harbor仓库的方式》:本文主要介绍java实现docker镜像上传到harbor仓库的方式,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地... 目录1. 前 言2. 编写工具类2.1 引入依赖包2.2 使用当前服务器的docker环境推送镜像2.2

C++20管道运算符的实现示例

《C++20管道运算符的实现示例》本文简要介绍C++20管道运算符的使用与实现,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友们下面随着小编来一起学习学习吧... 目录标准库的管道运算符使用自己实现类似的管道运算符我们不打算介绍太多,因为它实际属于c++20最为重要的

Java easyExcel实现导入多sheet的Excel

《JavaeasyExcel实现导入多sheet的Excel》这篇文章主要为大家详细介绍了如何使用JavaeasyExcel实现导入多sheet的Excel,文中的示例代码讲解详细,感兴趣的小伙伴可... 目录1.官网2.Excel样式3.代码1.官网easyExcel官网2.Excel样式3.代码

python实现对数据公钥加密与私钥解密

《python实现对数据公钥加密与私钥解密》这篇文章主要为大家详细介绍了如何使用python实现对数据公钥加密与私钥解密,文中的示例代码讲解详细,感兴趣的小伙伴可以跟随小编一起学习一下... 目录公钥私钥的生成使用公钥加密使用私钥解密公钥私钥的生成这一部分,使用python生成公钥与私钥,然后保存在两个文

浏览器插件cursor实现自动注册、续杯的详细过程

《浏览器插件cursor实现自动注册、续杯的详细过程》Cursor简易注册助手脚本通过自动化邮箱填写和验证码获取流程,大大简化了Cursor的注册过程,它不仅提高了注册效率,还通过友好的用户界面和详细... 目录前言功能概述使用方法安装脚本使用流程邮箱输入页面验证码页面实战演示技术实现核心功能实现1. 随机