算法论文7
思维链劫持攻击,推理模型安全新危机
机器之心
AI 摘要
Jianli Zhao团队:思维链劫持攻击在HarmBench上对多模型攻击成功率超90%,思维链推理虽提升准确性却引入安全漏洞,现有防御不足,有效防御待探索。
阅读原文 · 机器之心
AI越会思考,越容易被骗?「思维链劫持」攻击成功率超过90%
独立研究者Jianli Zhao等人新研究发现,思维链劫持攻击通过在有害请求前填充无害解谜推理序列,能对推理模型实现越狱攻击。在HarmBench基准上,对多模型攻击成功率超90%,揭示思维链推理存在新安全漏洞。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
算法论文8
论文揭秘大模型隐藏思维链提取漏洞
一篇前沿大模型安全漏洞论文引发热议,指出各大模型 API 设计缺陷,可提取隐藏思维链。同一模型家族安全能力不对称,攻击者可利用此漏洞,还介绍了攻击路径、实验及修复建议。
机器之心
开源动态7
Bijou64:告别LEB128安全陷阱
研究实验室Ink & Switch发布bijou64可变长度整数编码格式,由Brooklyn Zelenka开发。它消除规范性漏洞,在基准测试中超标准标量LEB128解码器。Hacker News社区对其有权衡讨论,实现已用Rust发布。
InfoQ
产品应用7
Claude Code推安全插件,边写代码边抓漏
Claude Code上线官方安全插件security - guidance,能在写代码时自动识别并修复安全漏洞。它分三层防线,覆盖多种漏洞类型,还支持自定义安全策略,安装方便,但只是辅助工具。
AGI Hunt
新闻资讯8
Claude Mythos单月狂扫423个安全漏洞
Mozilla深度复盘显示,Firefox团队用Claude Mythos Preview,单月修复423个安全漏洞,超此前15个月总和。它挖出271个漏洞,含180个高危,还找到沙箱逃逸漏洞。此外,Anthropic与OpenAI在AI安全能力竞赛中路线不同。
新智元