「攻击风险」共找到 612 篇相关文章
Dario Amodei 万字长文:我们已经没有时间可以浪费了,直面并克服强大AI带来的风险
Dario Amodei万字长文指出,最早2027年或现超诺奖得主AI,人类面临安全威胁。他定义了“强大AI”,分析自主性、滥用、经济颠覆等风险,给出多方面防御措施,强调人类要直面问题。
账号与身份防线全面失守:黑灰产 Agent 化攻击下,如何用“第一性原理”重建防线?
11月13日Anthropic报告显示,黑客利用AI Agent化能力发起复杂攻击,网络安全面临转折点。数美科技CTO梁堃指出黑灰产完成‘智能化’改造,传统防线失效,并提出防御方法。
看似无害的提问,也能偷走RAG系统的记忆——IKEA:隐蔽高效的数据提取攻击新范式
研究聚焦RAG系统,提出全新黑盒攻击方法IKEA。它不依赖异常指令,通过自然查询提取私有信息。经多数据集测试,其效率和成功率高,还证实提取知识实用,揭示RAG系统潜在脆弱性。
OpenAI总裁出钱办了个“新闻网站”:AI扮记者做采访,专门攻击AI监管派
2026年4月调查显示,Acutus“独立新闻网站”97%文章含AI内容,攻击对象为AI监管派,资金源于OpenAI总裁。其用AI生成稿件,审稿草率,还与政治公关公司客户名单重合,是OpenAI舆论运作一环。
账号与身份防线全面失守:黑灰产 Agent 化攻击下,如何用“第一性原理”重建防线?
11月13日,Anthropic报告称黑客利用AI Agent化能力达新高度,攻击模式转变使传统风控防线失效。数美科技CTO梁堃指出防御要下沉至‘第一性原理’,详解‘反欺诈三定律’,还提出‘不确定性标签’等方案。
12毫秒暴露自动驾驶致命缺陷,北航新研究实现场景感知的动态物理对抗攻击|TPAMI2025
近日部分L3级自动驾驶车型获批上路,但自动驾驶感知系统存在缺陷。北航等机构提出DynamicPAE框架,实现场景感知的动态物理对抗攻击,解决多维度挑战,在多场景表现优异,被TPAMI2025录用。
60%情况下,主流大模型没理解风险只是装懂!别被模型的“安全答案”骗了
研究发现超60%案例中主流推理模型生成合规答案却未真正理解风险,存在系统性漏洞。淘天集团团队引入“表面安全对齐”术语,推出Benchmark研究该现象,还介绍了数据集生成流程及评测指标。
AI Agent 是长期运行的“风险系统”,如果你还只在防 Prompt Injection,说明已经落后一代了
AI安全公司CyberArk首席软件架构师Niv Rabin团队提出基于“指令检测”与“历史感知校验”的方法,防御大语言模型和AI Agent恶意输入与历史投毒攻击,介绍多种防御机制。
突然爆火!近千人大排长龙安装!有人宣称短短数日已赚26万元!昆明市场有人报价300元;官方发声:警惕安全风险
OpenClaw是一款开源AI智能体,能接管电脑完成多种任务,但安装复杂。这催生“代装AI”生意,有人数日赚26万,腾讯免费安装引千人排队。不过,其部分实例存安全风险,官方提醒防范。
刚刚,Claude Mythos敲响末日警钟!超级智能已在悬崖,Hassabis深感恐惧
前沿AI已能自主攻击、逃逸,Anthropic因太危险暂不发布Claude Mythos Preview模型。谷歌DeepMind掌门人Hassabis、OpenAI CEO奥特曼均发出警告,虽恐惧AI风险却仍推进开发。