新闻中心
新闻中心

当前位置:首页 / 新闻中心 / 实验室动态 / 正文

DeepCensor赋能工业AI安全治理,夯实“人工智能+制造”安全底座

2026-08-17

图片1.png

一、引言

       多模态大模型安全检测系统(DeepCensor)是河南科技大学张志勇教授研究团队联合新华三集团,依托河南省网络空间安全应用国际联合实验室和河南省智能制造大数据发展创新实验室,针对新一代人工智能与多模态大模型面临的数据投毒、对抗攻击、模型窃取、后门攻击、提示注入、越狱攻击等安全问题,以及AIGC衍生的深度伪造内容安全与风险挑战,构建了涵盖大模型本体安全与生成式内容安全的多模态安全体系架构。自主研发了多模态大模型安全检测系统(DeepCensor),集成无差别数据投毒检测、思维链迁移对抗攻击检测、无数据模型窃取识别、动态视觉后门检测、提示注入攻防博弈、中文越狱检测、深度伪造图像、视频检测及溯源等核心功能,具有检测识别准确率高、底层架构兼容性强、广泛适配多类大模型等显著优势。

图片2.png

       关键核心技术成果发表在IEEE TDSC、PR、ACM TOPS、Cybersecurity等国际**学术期刊,获得20余项授权发明专利,登记30余件计算机软件著作权,主持或参与制定6项人工智能领域国家标准(GB/T 45654-2025、GB/T 42450-2023)和团体标准。该系统V1、V2.0和V3.0版本已完成计算机软件著作权登记,并通过河南省电子信息产品质量检验技术研究院(河南省软件测评中心)的第三方鉴定测试,具备较强的工程适配性与成果转化前景。相关成果已在国内人工智能与大数据领域头部企业推广应用,破解了企业垂类大模型产品安全与治理难题,具有显著的经济效益和社会效益。DeepCensor成功入选2026中国网络安全产业联盟网络安全新技术新产品新服务(网安三新)榜单,荣获2025中国网络安全产业联盟网络安全优秀创新成果大赛优胜奖、2025“华为杯”第七届中国研究生人工智能创新大赛全国总决赛一等奖、2025“华秦杯”第四届网络安全创新大赛揭榜挑战赛二等奖等。该产品在第二十七届中国国际高新技术成果交易会参展并入选全国产教融合与科教融汇典型案例。

图片3.png

二、六大功能服务

       DeepCensorV3.5 版本重点迭代升级六大功能服务:(1)黑盒对抗样本攻击检测;(2)多模态定向数据投毒攻击检测;(3)隐形后门攻击检测;(4)跨模态提示注入检测与防御;(5)图提示注入攻击检测;(6)大模型越狱检测与防御。

1、功能服务一:黑盒对抗样本攻击检测

       面向基于 BERT、ALBERT、RoBERTa 等经典模型构建的工业智能模型,DeepCensor V3.5提供黑盒对抗样本攻击检测能力,可应用于工业事故分类、设备故障诊断、安全生产文本分析等场景。系统无需获取目标模型内部参数和梯度信息,通过定位影响模型预测结果的高风险 Token,对关键内容实施掩码重构与语义扰动,并分析重构前后的预测结果、标签一致性和模型稳定性变化,自动识别潜在对抗样本,输出正常/异常判定、攻击成功率及综合风险等级。通过批量数据集评测与单样本精细分析,企业可快速发现工业模型的输入脆弱点和潜在攻击风险,获得风险样本定位、模型鲁棒性评估及安全加固建议,为工业智能模型的上线验证、运行监测和安全防护提供依据。

图片6.png

黑盒对抗样本攻击检测界面

图片7.png

黑盒对抗样本攻击检测模块历史记录管理界面

2、功能服务二:多模态定向数据投毒攻击检测

       面向工业图文数据集及基于 CLIP 基座模型构建的工业多模态智能模型,DeepCensor V3.5 提供多模态定向数据投毒攻击检测能力,可应用于工业视觉质检、设备状态识别、智能巡检等典型场景。系统采用跨模态定向攻击评测方法,通过设置源类别、目标类别、投毒预算和投毒比例,模拟训练数据受到定向污染后的模型行为,并结合ASR@1/5/10、平均**小排名及文本/图像检索性能等指标,量化分析 CLIP 模型在数据投毒攻击下的安全风险与任务效用变化,自动生成风险等级和评测结论。企业可据此发现工业图文训练数据中的定向投毒风险和跨模态关联脆弱点,并获得异常数据清洗、训练数据审计、可信数据源追溯及模型重新训练等安全建议,为工业多模态模型的训练安全、上线评估和模型供应链安全提供支撑。

图片8.png

多模态定向数据投毒攻击检测界面

图片9.png

多模态定向数据投毒攻击检测查看检索效用界面

图片10.png

多模态定向数据投毒攻击检测数据集评测结论界面

3、功能服务三:隐形后门攻击检测

       面向工业图像数据集及基于BLIP、BLIP-2、ViT-GPT2等预置图像描述基座模型构建的工业智能模型,DeepCensor V3.5 提供隐形后门攻击检测能力,可用于工业缺陷识别、智能巡检、设备状态描述等应用场景。系统通过配置攻击目标与触发条件,构造受控后门样本并开展模型微调测试,对比后门注入前后的模型输出,并结合 ASR、BLEU-4、CIDEr 等指标,综合评估后门攻击成功率及模型正常任务能力变化,判断模型是否存在“正常情况下表现稳定、特定触发条件下产生异常响应”的潜在后门风险。当前版本支持预置模型与适配数据集开展检测。针对企业基于上述基座模型训练的自有工业模型,可结合企业提供的预训练/训练数据集及实际业务任务进行数据接口重新适配,形成定制化检测服务,并提供后门风险定位、异常数据清洗、可信数据源追溯及模型重新训练等安全加固建议。

图片11.png

隐形后门攻击检测检测过程界面

图片12.png

隐形后门攻击检测历史记录管理界面

4、功能服务四:跨模态提示注入检测与防御

       面向工业多模态大模型以及通过OpenAI/Ollama兼容接口接入的企业智能模型,DeepCensor V3.5可部署为大模型输入侧安全防御网关,对进入模型的真实业务请求进行实时监测、风险识别和在线拦截,并支持文本、图片 OCR、音频 ASR 等跨模态输入。系统通过规则图推理、语义判官与Stackelberg均值场博弈防御策略,识别直接提示注入、间接提示注入、系统指令覆盖、越狱规避及敏感数据外传等风险,并依据风险等级自动执行放行、安全改写、软拦截或直接拦截,同时记录风险得分、命中策略、防御动作及实际转发内容,实现全过程安全审计与流量溯源。在兼容接口条件下,企业可通过安全网关快速接入现有模型服务,降低原有业务系统改造成本,实现模型调用流量的实时安全防护;同时可通过裸模型ASR与过网关ASR对比量化防御效果,为工业大模型持续运行建立输入侧在线安全屏障。

图片13.png

提示注入攻击检测总览界面

图片14.png

提示注入攻击检测资产中心界面

图片15.png

提示注入攻击检测沙箱界面

图片16.png

提示注入攻击检测防御网关界面

图片17.png

提示注入攻击检测博弈策略界面

5、功能服务五:图提示注入攻击检测

       面向工业过程数据、设备关系网络、工业知识图谱等构建的图数据,以及基于GCN、GAT、TransformerConv等图神经网络训练的工业智能模型,DeepCensor V3.5重点评估模型在训练、微调及图提示工程应用过程中面临的图提示注入安全风险。系统通过模拟在图提示中注入恶意节点、恶意边或触发子图,测试攻击者是否能够借助被污染的图提示,诱导模型将指定设备状态、故障类型或目标节点错误预测为预设类别,并综合Clean ACC、攻击成功率(ASR)、预测翻转率和置信度变化等指标,量化分析图模型受到提示注入攻击后的安全性与稳定性。企业可据此发现图提示构造、图数据处理及模型训练环节中的潜在攻击入口和安全脆弱点,获得提示数据审查、异常节点/子图排查以及模型安全加固建议,为工业知识图谱、设备关系模型等图智能应用的上线前安全评测和可信部署提供依据。

图片18.png

图模型安全检测与评估界面

图片19.png

图模型安全检测与评估查看历史记录界面

6、功能服务六:大模型越狱检测与防御

       面向工业大模型、企业私有化大模型,以及基于Qwen、Vicuna等基座模型构建的行业智能模型,DeepCensor V3.5提供大模型越狱检测与防御能力,重点构建部署于模型推理输出与业务交付之间的输出侧安全防线,与跨模态提示注入的输入侧安全防御形成互补。系统对目标模型生成响应开展安全分析,通过有害意图反推、语义有害性检测和安全响应二次生成,识别因角色伪装、安全**绕过、社会工程诱导等越狱攻击产生的不安全内容,并在响应进入业务交付链路前实施风险识别、阻断或安全改写,降低模型安全机制被绕过后产生风险输出的可能性。除单次检测与安全评测外,DeepCensor V3.5还可根据企业实际业务需求,定制封装为大模型越狱防御网关,对模型输出流量进行实时监测、风险识别和在线拦截,与跨模态提示注入检测与防御功能共同形成“输入侧防提示注入、输出侧防越狱风险”的双向安全防护体系,为工业大模型安全上线与持续运行提供保障。

图片20.png

越狱攻击检测创建测评界面

图片21.png

大模型越狱防御界面

三、结束语

       随着大语言模型、多模态大模型和图神经网络等人工智能技术加速进入工业生产、智能制造、设备运维和安全管理等核心业务场景,人工智能面临的安全风险也正由单一模型攻击,逐步向训练数据污染、模型后门、输入攻击、提示注入、图提示攻击以及生成内容越狱等全生命周期风险演进。多模态大模型安全检测系统(DeepCensor)V3.5 完成新一轮版本升级并取得软件著作权。DeepCensor V3.5 面向企业人工智能应用中的实际安全需求,在原有模型安全检测能力基础上,进一步强化安全检测、风险评估与主动防御能力,覆盖从训练数据、模型本体到模型输入与输出的关键安全环节,为工业人工智能模型上线前评测和运行期防护提供一体化技术支撑。

微信扫码分享