攻击检测」共找到 344 篇相关文章

算法论文8

看似无害的提问,也能偷走RAG系统的记忆——IKEA:隐蔽高效的数据提取攻击新范式

研究聚焦RAG系统,提出全新黑盒攻击方法IKEA。它不依赖异常指令,通过自然查询提取私有信息。经多数据集测试,其效率和成功率高,还证实提取知识实用,揭示RAG系统潜在脆弱性。

机器之心
新闻资讯7

OpenAI总裁出钱办了个“新闻网站”:AI扮记者做采访,专门攻击AI监管派

2026年4月调查显示,Acutus“独立新闻网站”97%文章含AI内容,攻击对象为AI监管派,资金源于OpenAI总裁。其用AI生成稿件,审稿草率,还与政治公关公司客户名单重合,是OpenAI舆论运作一环。

DeepTech深科技
算法论文8

ICML 2025 Oral!北大和腾讯优图破解AI生成图像检测泛化难题:正交子空间分解

OpenAI推出GPT - 4o图像生成功能,AI生图安全挑战凸显,区分生成与真实图像成难题。北大与腾讯优图研究人员用正交子空间分解解决AI生图检测泛化难题,论文被ICML 2025接收。

机器之心
新闻资讯8

账号与身份防线全面失守:黑灰产 Agent 化攻击下,如何用“第一性原理”重建防线?

11月13日,Anthropic报告称黑客利用AI Agent化能力达新高度,攻击模式转变使传统风控防线失效。数美科技CTO梁堃指出防御要下沉至‘第一性原理’,详解‘反欺诈三定律’,还提出‘不确定性标签’等方案。

AI前线
算法论文8

12毫秒暴露自动驾驶致命缺陷,北航新研究实现场景感知的动态物理对抗攻击|TPAMI2025

近日部分L3级自动驾驶车型获批上路,但自动驾驶感知系统存在缺陷。北航等机构提出DynamicPAE框架,实现场景感知的动态物理对抗攻击,解决多维度挑战,在多场景表现优异,被TPAMI2025录用。

量子位
算法论文8

ICCV 2025 | 跨越视觉与语言边界,打开人机交互感知的新篇章:北大团队提出INP-CC模型重塑开放词汇HOI检测

北大团队提出 INP - CC 模型重塑开放词汇 HOI 检测。它提出交互感知提示生成和概念校准两项创新,结合输入图片特性构造提示集合,引入‘困难负样本采样’策略,在两大数据集上表现超 SOTA。

机器之心
开源动态8

你的AI“体检”了吗?开源AI红队测试平台,一键自查三大风险

AI圈一边是顶尖模型发布,一边是大模型被“越狱”输出有害内容。腾讯朱雀实验室开源A.I.G平台,能模拟真实攻击对AI产品全方位风险扫描,有大模型体检、基础设施漏洞扫描、MCP Server风险检测三大核心能力。

腾讯技术工程
算法论文8

大模型幻觉检测新方法:实时高亮不确定内容

来自苏黎世联邦理工学院等机构团队,开发流式幻觉检测器,能在生成过程中即时标记幻觉实体。核心是识别具体“实体”是否虚构,实验表现出色,团队已将数据集和代码开源,有局限但应用前景好。

AI工程化
开源动态8

猛涨25k star!一键检测你的电脑能跑哪些大模型!

最近 Github 出现工具 `LLMFit`,用 Rust 编写,能自动检测硬件配置,判断大模型能否流畅运行,推荐最优量化版本和运行模式。有一键硬件检测等特性,安装使用方便,降低本地部署门槛。

开源先锋
新闻资讯7

绕过Azure AI 护栏的方法及案例

本文指出Azure AI有安全漏洞,攻击者可利用漏洞绕过内容安全机制。介绍了重现步骤,阐述字符注入与对抗性机器学习规避两种攻击技巧,展示攻击效果,还提及微软已部署缓解措施并给出安全建议。

AI与安全