新闻中心
新闻中心

当前位置:首页 / 新闻中心 / 实验室动态 / 正文

实验室在人工智能安全领域取得新进展

2026-06-29

       日前,实验室研究成果“SRD: A Model-Agnostic Semantic Framework for Jailbreak Mitigation in Large Language Models”被人工智能领域国际**期刊《Knowledge-Based Systems》(中科院一区Top)接受。该文章提出了一种模型无关的防御框架,将越狱攻击缓解任务重构为语义意图还原任务。该框架融合稠密风险表征与递归式意图回滚机制,能够精准识别并消解隐藏在复杂对抗性提示词中的潜在恶意目标,为人工智能安全防御提供了新的基础框架及方法。硕士生师灿为论文**作者,张志勇为通讯作者。

图片1.png

微信扫码分享