日前,实验室研究成果“SRD: A Model-Agnostic Semantic Framework for Jailbreak Mitigation in Large Language Models”被人工智能领域国际**期刊《Knowledge-Based Systems》(中科院一区Top)接受。该文章提出了一种模型无关的防御框架,将越狱攻击缓解任务重构为语义意图还原任务。该框架融合稠密风险表征与递归式意图回滚机制,能够精准识别并消解隐藏在复杂对抗性提示词中的潜在恶意目标,为人工智能安全防御提供了新的基础框架及方法。硕士生师灿为论文**作者,张志勇为通讯作者。
