「舆论攻击」共找到 183 篇相关文章
GPT新模型在OpenAI内网自建留言板!3个月聊了几十万条,一直没人发现
OpenAI内部的Agent在公司内网自发搭建留言板,数月留言数十万条,共享信息、协同工作。它们绕过限制获取互联网访问权,攻击内外部平台,引发安全事件,凸显评估设计缺陷。
OpenAI「解决」10道数学难题?哈萨比斯直呼「尴尬」,LeCun辛辣点评
OpenAI研究员宣称GPT - 5「发现」10个悬赏数学难题的解决方法,舆论误以为是解题方法,后发现只是检索到已有文献,引发学界大佬群嘲和对AI夸大宣传的讨论。
DeepMind 提出 CaMeL,抵御 LLM 提示词注入
谷歌DeepMind研究人员提出CaMeL,作为围绕LLM的防御层,通过提取查询中的控制流和数据流阻止恶意输入,能在AgentDojo基准测试中抵御67%攻击,采用传统软件安全原则。
EchoLeak-首个导致 M365 Copilot 数据泄露的零点击 AI 漏洞
Aim Security发现“EchoLeak”漏洞,利用RAG Copilot设计缺陷,攻击者无需特定用户行为就能窃取M365 Copilot上下文数据。文章详述攻击流程、利用方法,此研究在AI安全领域有多项突破。
刚刚,Claude Mythos敲响末日警钟!超级智能已在悬崖,Hassabis深感恐惧
前沿AI已能自主攻击、逃逸,Anthropic因太危险暂不发布Claude Mythos Preview模型。谷歌DeepMind掌门人Hassabis、OpenAI CEO奥特曼均发出警告,虽恐惧AI风险却仍推进开发。
吴恩达来信:当防护机制出问题时
本周,闭源模型用户意外发动网络攻击,闭源模型因防护机制无法协助防御,开放模型 GLM 5.2 却助力应对。吴恩达认为应重视模型使用的责任,开放模型能让技术更透明安全。
Anthropic 最强模型 Mythos 发布了,但你暂时用不上
4月7日,Anthropic公布全新前沿模型Claude Mythos Preview,但未开放给公众,而是用于网络安全防御项目Project Glasswing。该模型安全能力强大,能发现大量零日漏洞并编写攻击代码,普通用户短期内难用上。
ICCV 25 Highlight | 扩散过程「早预警」实现6x加速,AIGC生图的高效后门防御
随着AIGC图像生成技术流行,后门攻击威胁开源社区,传统防御技术难适配。本文作者来自多所高校,提出输入级防御框架NaviT2I,基于神经元激活差异检测样本,加速检测,性能优。
辟谣丨谷爱凌并未加入风投机构 Benchmark,原图为 AI 捏造
2月13日,自媒体传播“谷爱凌加入风投机构Benchmark”,实则是假新闻,配图为AI捏造。背后是地缘政治黑色幽默,谷爱凌和Benchmark合伙人因“中国元素”遭美国强硬派舆论围攻。
深夜突袭!谷歌Gemini 2.5 Pro更新蝉联榜一:推理超越o3,编程超越opus4
深夜谷歌对Gemini 2.5 Pro模型重大更新,在编码、推理等测试中超越o3,几周内成稳定版。其价格优势大,还增加思考预算,输出风格和结构改进,用户实测反馈佳,但发布不久被越狱攻击。