算法论文8
人大与阿里:LoD 0.25秒识破未见攻击
量子位
AI 摘要
中国人民大学与阿里巴巴集团:提出LoD检测方法,不依赖攻击样本和规则,从LVLM内部激活学安全模式。在多种模型和攻击测试中表现优,单输入检测快至0.25秒,代码已开源。
阅读原文 · 量子位
0.25秒识破未见攻击,这套检测方法没看过任何越狱样本 | EMNLP'26
大视觉语言模型带来隐蔽攻击面,现有检测器难平衡。中国人民大学与阿里巴巴集团联合提出Learning to Detect(LoD),不依赖攻击样本和手工规则,从模型内部激活学安全模式,实验效果好且代码开源。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
算法论文8
TransPrune:视觉Token推理加速60%
近年来大视觉语言模型虽推动多模态智能发展,但推理成本高昂。山东大学和MBZUAI团队提出TransPrune,从演化视角衡量视觉Token重要性,保持性能无损同时降低60%推理成本。
AI科技评论
算法论文8
G - Safeguard守护多智能体安全
随着基于LLM的多智能体系统崛起,其安全隐患凸显。中国科学技术大学等机构提出G - Safeguard安全防护框架,它基于图神经网络,通过构建多智能体话语图等方式,能有效抑制恶意信息传播,有强大防御和泛化能力。
PaperAgent
算法论文8
阿尔伯塔大学:FAME破解强化学习遗忘难题
阿尔伯塔大学强化学习团队提出FAME框架,解决持续强化学习“学新忘旧”问题。团队先定义基础概念,将知识整合写成优化问题,再受人类学习机制启发设计FAME,实验优势明显。研究还探讨持续学习的产业价值。
AI科技评论
算法论文8
EASE:给多模态RLVR装「视线校正器」
强化学习与可验证奖励提升视觉语言模型推理能力,但存在答案奖励只知对错、不知证据区域问题。哈工大等团队提出EASE,把标注证据区转为目标分布,监督空间注意力,推理无额外标注,实验成绩优异。
机器之心