ARM++:面向深度伪造检测器的多域智能体协同可迁移对抗攻击框架
ARM++:面向深度伪造检测器的多域智能体协同可迁移对抗攻击框架arXiv:2607.15246v1 [cs.CV] 2026-07-16摘要深度伪造检测器在黑盒对抗迁移攻击下极易失效,核心原因是现有检测器依赖脆弱、绑定网络架构的取证特征。现有可迁移攻击方案普遍缺少图像语义感知,且在无查询严格约束场景性能大幅衰减;尤其是从卷积代理模型向Transformer目标检测器跨架构迁移时效果断崖式下跌。本文提出ARM++多智能体对抗攻击框架,基于Qwen2.5-VL多模态大模型提取图像空间语义先验,搭配Qwen3大语言模型完成攻击基元调度、自适应超参重参数化、熵正则扰动融合。框架融合五大互补攻击基元:稠密CW优化、稀疏显著性JSMA、几何形变STA、频域SSA、分块BSR,全方位覆盖CNN/Transformer异构模型的归纳偏置漏洞。基于AADD-2025权威深度伪造攻防基准开展完整对照实验,在低画质(LQ)、高画质(HQ)两大图像场景下,ARM++全面超越单智能体、静态集成、传统迁移攻击基线。统计学检验证明,相比SOTA智能体攻击ARM,ARM++盲目标攻击成功率(ASR)显著提升;在两类主流防御机制下仍保持高逃逸率。实验结论证明当前商用深度伪造检测器存在显著可靠性漏洞,同时验证智能体闭环调度、多域扰动融合对跨架构迁移攻击的核心增益。关键词:深度伪造检测;黑盒对抗攻击;可迁移对抗样本;多智能体;多模态大模型;频域扰动;分块变换;无查询攻击1 引言1.1 研究背景生成式AI快速普及,GAN、扩散模型、人脸交换技术可生成人眼难以分辨的伪造图像,深度伪造自动检测成为内容风控、生物核验、数字取证核心技术。现有CNN、ViT、Swin-B检测器在干净测试集准确率均超96,但黑盒对抗迁移场景下可靠性急剧下滑。现有迁移攻击(MI-FGSM、DI-FGSM等)仅做梯度时序平滑、随机输入变换优化,存在两大致命短板:无图像语义理解,无法针对性定位人脸伪造薄弱区域;仅单一像素/空域扰动,难以同时攻破CNN局部纹理、Transformer全局分块两类归纳偏置;大量方案需要频繁查询目标检测器梯度,不符合真实线上无查询黑盒威胁模型。1.2 现有智能体攻击ARM局限性基线ARM仅集成CW、JSMA、STA三类空域基元,存在四大缺陷:缺少频域、分块扰动,对Swin等分块Transformer迁移效果极差;扰动融合分数引入目标检测器查询项,违背严格无查询约束;代理模型仅ResNet50+DenseNet121两类CNN,模型多样性不足;评测仅覆盖单一低画质子集与ViT-B单一目标,高画质、多Transformer泛化能力未验证。1.3 ARM++四大核心创新五基元多域扰动体系:新增SSA频域模拟、BSR分块打乱,同时覆盖空域、频率、分块三类模型漏洞;严格无查询闭环智能体:移除目标检测器查询项,仅依靠代理集成梯度完成全部优化、融合;VLM视觉语义智能体+LLM调度分层架构:VLM提取人脸伪造语义掩码,LLM完成停滞检测、自适应超参调优、熵正则混合权重求解;完备评测体系:LQ/HQ双画质、ViT/Swin双Transformer目标、自适应防御消融、跨数据集零样本泛化、GPU算力量化、故障模式分类。1.4 框架整体流程ARM++闭环执行流水线:Qwen2.5-VL语义智能体解析人脸,输出伪造区域软掩码;编排智能体初始化五类攻击基元超参、全局约束;并行Method智能体独立生成CW/JSMA/STA/SSA扰动;批判智能体打分所有候选扰动,策略智能体检测收敛停滞并放宽ϵ\epsilonϵ扰动上限、降低SSIM阈值;顾问智能体自适应修正每类基元超参;混合智能体熵正则加权融合多扰动,生成主候选对抗图;循环迭代至最大轮次,从全部历史候选中选取最优无查询对抗样本,仅最后一步测试盲目标ASR。2 相关工作2.1 传统静态可迁移对抗攻击MI-FGSM、TI-FGSM、SINI-FGSM依靠动量、平移不变提升迁移,但仅空域梯度优化;AutoAttack为多静态扰动集成,无语义引导,扰动幅度大、人眼可见失真严重;Square、SimBA为无梯度查询攻击,但迭代开销极高、迁移率低。缺陷:全部为固定扰动流程,无法根据图像伪造特征自适应调整,缺少多域互补扰动融合。2. 频域/分块专项攻击SSA通过DCT频域随机调制,针对CNN频域过拟合;BSR对图像分块置换旋转,破坏Transformer窗口注意力;两类方法单独使用迁移有限,ARM++将其纳入智能体动态调度池。2. LLM/VLM智能体对抗框架ARM是首个LLM调度攻击智能体,但仅三类空域基元;AutoDA、L-AutoDA依靠决策式梯度+强化学习,无视觉语义输入;AnyAttack、FOA-Attack针对MLLM模型攻击,不面向人脸伪造检测器。现有智能体均未实现VLM视觉语义+多域扰动+无查询约束三位一体设计。深度伪造攻防评测基准FaceForensics++、DFDC、AADD-2025为行业标准伪造数据集;AADD区分LQ/HQ两类伪造图像,高画质伪造细微痕迹极难捕捉,是更贴合真实线上测试集。现有攻击评测大多仅在LQ数据集验证,忽略高画质场景迁移衰减问题。3 前置理论与威胁模型3.1 符号定义原始人脸图像x∈[0,1]H×W×3\boldsymbol{x}\in[0,1]^{H\times W\times3}x∈[0,1]H×W×3,真实标签y=fakey=\text{fake}y=fake,攻击目标:让检测器预测y^=real\hat{y}=\text{real}y^=real;代理模型集成Fsurr={ ResNet50,DenseNet121,EfficientNet-B4}\mathcal{F}_{\text{surr}}=\{\text{ResNet50},\text{DenseNet121},\text{EfficientNet-B4}\}Fsurr={ResNet50,DenseNet121,EfficientNet-B4},仅可访问前向/反向梯度;盲目标检测器g∈{ ViT-B/16,Swin-B}g\in\{\text{ViT-B/16},\text{Swin-B}\}g∈{ViT-B/16,Swin-B},全程零查询,仅全部攻击完成后统计ASR;对抗扰动δ\boldsymbol{\delta}δ满足∥δ∥∞≤ϵ\|\boldsymbol{\delta}\|_{\infty}\le\epsilon∥δ∥∞≤ϵ,SSIM(x,x+δ)≥τ(\boldsymbol{x},\boldsymbol{x}+\boldsymbol{\delta})\ge\tau(x,x+δ)≥τ保证人眼不可感知;代理集成目标损失:Lsurr(x,t)=−∑r=1Rαrlogpfr(real∣x)\mathcal{L}_{\text{surr}}(\boldsymbol{x},t)=-\sum_{r=1}^{R}\alpha_{r}\log p_{f_r}(\text{real}\mid\boldsymbol{x})Lsurr(x,t)=−∑r=1Rαrlogpfr(real∣x),αr=1/R\alpha_r=1/Rαr=1/R均等权重。3.2 严格无查询威胁模型攻击者完全未知盲目标网络结构、权重、梯度,优化、调参、扰动融合全过程禁止调用目标检测器;仅完成全部迭代后,用生成的对抗样本批量测试逃逸成功率。区别于ARM基线:ARM混合分数包含目标预测项pbbp_{\text{bb}}pbb,属于弱黑盒,ARM++彻底移除该依赖,贴合真实线上攻击场景。3.3 五大互补攻击基元完整数学定义3.1 CW稠密ℓ2\ell_2ℓ