本发明涉及的方案属于计算机视觉领域,具体为对抗机器学习领域,一种面向自注意力模型的干净标签后门攻击方法。
背景技术:
1、近年来,随着人工智能技术的不断发展,基于深度学习技术构建的模型在图像分类、目标检测以及自然语言处理等领域都表现出了非常的优异效果,从而得到广泛应用。以图像分类技术为例子,基于人工智能技术的模型在许多前沿领域中都有广泛应用。在自动驾驶技术中,可以利用摄像头、雷达和其他传感器获取的数据来实现车辆的实时环境感知和识别;在人脸识别技术中,可以对输入的人脸图像进行特征提取和识别,从而实现准确的身份认证和人脸搜索;在医疗图像分类技术中,可以实现对不同疾病的自动识别和分类,并为医生提供辅助诊断。
2、然而在这些应用的背后,却存在着隐藏的安全风险。因为上述深度学习技术构建起来的模型表现出的超强性能,通常是由复杂网络结构、高资源消耗和高时间消耗所支撑起来的。但不是所有使用到此类模型的公司或者个人都有能力去从头去收集数据、设计模型和训练模型。这些需求者通常会寻求第三方资源,包括获取数据集、迁移学习或者直接购买第三方服务。如果第三方资源或服务被恶意攻击,那么受影响的范围会非常大。以图像分类领域为例,后门攻击就是近年来发现的会造成严重威胁的一种攻击方法,攻击者通过向模型植入后门,使用触发器促使模型输出攻击者所预期的结果。
3、随着深度学习技术的不断推广,自注意力模型在视觉领域上的变种——视觉自注意力模型 (vit) 成为目前研究领域和工业领域中炙手可热的一类新型模型,其在图像分类应用中取得了非常优异的效果。正如上述介绍,广泛使用的模型更容易被攻击者所选中,从而造成更大的后门攻击潜在风险。因此,开展针对vit 模型的后门攻击研究变得尤为必要,以期拓宽攻击方法认知,从而构建防御方法。
4、本方案关注干净标签场景下,针对视觉自注意力模型 (vit)的后门攻击开展研究。针对干净标签场景下的后门攻击有效性开展研究,提升攻击成功率,提升后门隐蔽性。
技术实现思路
1、针对干净标签场景下的后门攻击成功率低问题,如何实现一种兼容高成功率和高隐蔽性的双阶段特异触发器的干净标签后门攻击,是本发明需要解决的问题。
2、一种面向自注意力模型的干净标签后门攻击方法包括如下步骤:
3、步骤1:设计双阶段特异触发器;
4、步骤2:利用模型解释性工具对靶向类干净图像和非靶向类干净图像生成图像特异的热点区域图,通过注意力热力图生成得到热力区域;
5、步骤3:针对靶向类干净图像以及非靶向类干净图像在图像加强模块中采取不同的加强方法来促进后门植入;
6、步骤4:双阶段触发器生成器设计;
7、步骤5:投毒数据生成,使用生成好的触发器生成器分别生成投毒图像和攻击加强图像;
8、步骤6:后门植入和激活,选择靶向类中的部分图像使用触发器生成器生成带有图像特异触发器的投毒数据图像,将其他靶向类的其他干净图像保留在重训练数据集中,得到混合数据集;使用混合数据集对预训练模型进行微调重训练,获得后门模型;在后门激活阶段,将非靶向类的干净图像输入触发器生成器中,以获得带有图像特异触发器的恶意输入,然后将这个恶意输入输入到后门模型中。
9、优选的,实现步骤一的具体方案为:
10、步骤1.1:在后门植入阶段使用带有特异触发器的靶向类投毒数据;使用非靶向快速梯度符号下降法将原始靶向类图像偏移出其原有标签的方法来建立起和靶向类标签之间的联系,减少原有图像特征,促进模型学习触发器的特征;
11、步骤1.2:在后门激活阶段使用靶向快速梯度符号下降法将原始非靶向类图像的预测结果偏向靶向类标签的方法来使模型输出攻击者所期望的靶向类标签。
12、优选的,实现步骤三的具体方案为:
13、步骤3.1:对靶向类干净图像,通过加强模块后生成的靶向类投毒图像促进后门植入。具体表现为干净模型对靶向类投毒图像的预测结果不再是靶向类原标签,而是偏移后的一个标签;这样的投毒数据有助于干净模型学习触发器特征,从而构建后门;
14、步骤3.2:针对非靶向类干净图像,加强模块目标在添加触发器后,增加一种可以额外提升攻击效果的扰动;具体表现为干净模型对攻击图像的预测结果为不再为其源标签,而是恶意指定的靶向类标签;
15、优选的,实现步骤四的具体方案为:
16、步骤4.1:本方案根据不同类型的图像设计了一个包含靶向类图像损失、非靶向类图像损失和lpips损失的损失函数来训练自动编码器;最后再通过超参数将这些损失项线性相加得到总损失;最后再通过优化器对双阶段触发器生成器进行参数更新;
17、步骤4.2:为了促进双阶段触发器生成器生成更强大靶向类触发器,对训练中使用到的靶向类数据集进行预处理操作;对训练模型所使用的数据集 dtraing 中的靶向类图像添加非靶向快速梯度符号下降扰动(ntfgsm),将攻击成功的靶向类数据作为训练双阶段触发器生成器的一部分数据集;
18、步骤4.3:在两类图像加强模块中,都包含根据热点区域图限定触发器和扰动遮罩操作来设计触发器生成器;遮罩主要包括权重添加和高值热力区域限定两种方式,遮罩操作一方面有助于帮助模型限定重要特征区域以提高攻击成功率,另外一方面有助于减小非必要的扰动区域,提高图像的隐蔽性。
19、有益效果在于:本方案生成的干净标签场景下的投毒图像相较于修改标签场景下的投毒图像更加能逃避人工审查,在3%投毒率的情况下,可以取得超过80%的攻击成功率,在9%投毒率的情况下,可以取得超过95%的攻击成功率。
1.一种面向自注意力模型的干净标签后门攻击方法,其特征在于:所述干净标签后门攻击方法包括如下步骤:
2.如权利要求1所述的一种面向自注意力模型的干净标签后门攻击方法,其特征在于:实现步骤一的具体方案为:
3.如权利要求1所述的一种面向自注意力模型的干净标签后门攻击方法,其特征在于:实现步骤三的具体方案为:
4.如权利要求1所述的一种面向自注意力模型的干净标签后门攻击方法,其特征在于:实现步骤四的具体方案为:
