2026年6月28日,HAUST-HNU大模型与安全联合研究团队第44期组会在线召开。本次组会主题是基于意图隐藏与转移的大模型越狱攻击研究和音频深度伪造检测方法。会议由河南师范大学荆军昌副教授主持。
河南科技大学2025级硕士研究生魏欣丽于会议中汇报了题为《Exploring Jailbreak Attacks on LLMs through Intent Concealment and Diversion》的研究,该研究针对当前大语言模型越狱攻击方法查询效率低、跨模型泛化性差的两大痛点,提出了基于意图隐藏与分散的黑盒越狱攻击框架ICE。研究还针对现有评估数据集仅覆盖问答场景的不足,构建了双场景评估基准BiSceneEval。
ICE框架包含两大核心模块:层次化拆分模块,通过依存句法分析与层级提升将恶意查询分解为带层级标签的语义片段,利用认知过载绕过安全护栏;语义扩展模块,综合运用DistilBERT、WordNet及LLM毒性分析生成扩展词汇集合。两模块经推理掩码转换为“占位符is(内容)”格式并随机排序,**终嵌入环境模板形成伪装成信息重组任务的攻击提示。
在11个主流模型上的实验结果表明,ICE在GPT-3.5上实现了99.2%的关键词匹配成功率和98.3%的GPT评估成功率,攻击成功率显著优于现有SOTA方法;单次查询与8.71秒的平均时间开销证明了其极高的效率。案例研究直观验证了ICE相比PAIR(完全拒绝)、ReNeLLM(输出模糊)的显著优越性。此外,BiSceneEval基线实验验证了数据集的有效难度,双场景评估进一步证明了ICE在问答与文本生成场景下的全面威胁。该工作揭示了当前指令调优大模型在处理结构化推理任务时存在认知过载的安全漏洞,呼吁构建融合静态安全基础与实时语义分解的混合防御架构。

河南师范大学2025级硕士研究生胡天赐于会议中汇报了题为《HyperPotter: Spell the Charm of High-Order Interactions in Audio Deepfake Detection》的研究。该研究针对当前音频深度伪造检测方法仅依赖局部时频特征或两两关系、忽视多特征成分间高阶交互作用的根本性局限,提出了基于超图建模的高阶关系捕获框架HyperPotter。研究围绕两大核心挑战展开:一是生成语音中的伪造痕迹往往分布在多个声学维度上,其判别性模式只有在多特征联合分析时才会显现,而现有方法难以捕捉这种协同性的高阶信息;二是高阶交互建模面临关系结构构建效率低、初始化质量差的问题,**了模型在大规模、多样化伪造场景下的泛化能力。为此,HyperPotter设计了两大核心模块:一是关系伪影放大模块,通过融合结构自相似性与特征级自相似性,构建注意力驱动的关系增强机制,从超边连接中强化具有判别性的协同伪造线索;二是类别感知原型引导的超边初始化模块,引入可长期存储与动态更新的原型库,通过相似性门控、类别感知原型选择与外部质心注入三步策略,为FCM聚类提供高质量初始质心,同时采用软对齐与槽对齐两阶段策略及指数移动平均更新机制,确保跨批次特征的稳定对齐与高效收敛。在ASVspoof2019 LA训练集上训练后,在包含In-the-Wild、ASVspoof2021 DF、FoR、ADD2022 Track3等13个跨数据集上的大量实验验证表明,HyperPotter在EER指标上平均相对提升22.15%,在4个**挑战性的跨域数据集上相较SOTA方法平均提升13.96%,显著优于Wav2Vec2-AASIST等11种主流基线方法。消融实验、超边基数分布分析、数据集级与样本级关系聚类可视化,以及原型库PCA分析进一步证明了关系伪影放大模块、原型引导初始化机制及高阶关系建模各自的关键贡献,充分揭示了协同性高阶交互建模在提升音频深度伪造检测跨场景泛化能力方面的重要作用,为构建高鲁棒、高泛化的音频伪造检测系统提供了新的技术路径。

交流讨论阶段,与会师生积极借鉴其意图分散与认知过载、双场景分层评估和分层特征解耦、跨模态一致性约束的思路,反思自身研究中是否存在攻击方法单维度优化而忽视跨模型泛化性及特征利用粗放或忽略细粒度关联的问题,为后续课题研究提供了新的思考方向。