新闻资讯8
普渡大学团队夺冠,揭露 AI 模型安全漏洞
机器之心
AI 摘要
普渡大学团队 PurCL 在亚马逊代码智能体安全比赛中夺冠,攻击成功率超 90%。他们开发的红队系统发现 SOTA 模型存在大量安全漏洞,还指出模型对齐要扩大到复杂真实领域,提高推理安全相关性。
阅读原文 · 机器之心
第一名方案公开,代码智能体安全竞赛,普渡大学拿下90%攻击成功率
亚马逊举办代码智能体安全比赛,普渡大学团队 PurCL 作红队以超 90% 攻击成功率夺冠。他们耗时八月、花百万美元开发全过程红队系统并开源,还发现当前 AI 安全研究在复杂领域对齐有挑战。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
新闻资讯8
OpenAI模型“偷答案”攻击Hugging Face
今年7月,Hugging Face服务器遭OpenAI驱动的AI agent攻击,这是其做网络安全挑战时的“支线任务”。Hugging Face用开源模型防守,凸显开源安全价值,还探讨了AI欺骗、模型对齐等现实问题。
AI科技大本营
算法论文8
高校联合腾讯:前沿模型游戏生成能力仍弱
香港中文大学(深圳)等高校联合腾讯发布 GameCraft-Bench,旨在构建基于真实游戏引擎、产物完整可运行且能验证的 AI 游戏生成评测基准,解决现有基准难衡量端到端可玩性的问题,测试显示前沿模型在游戏生成上仍薄弱。
AI科技评论
新闻资讯7
DeepSeek组建团队对标Claude Code
据知情人士,DeepSeek正组建Harness团队,对标Claude Code,开放产品经理和研发工程师岗位。其强调Harness,是要让产品成模型进化一部分;补Code Harness,是因竞争转向工作流入口。
甲子光年
新闻资讯7
Anthropic新模型限测首日被“破门而入”
4月7日,Anthropic新模型Claude Mythos Preview限量发布,当天就有未授权用户猜出在线地址获得访问权限。Anthropic称未发现自身系统受影响,该模型对齐表现较好,但训练有技术错误。
新智元