「攻击检测」共找到 344 篇相关文章
NeurIPS 2025 Spotlight | 你刷到的视频是真的么?用物理规律拆穿Sora谎言
随着生成式AI发展,合成视频以假乱真,现有检测方法难泛化。本文介绍发表于NeurIPS 2025的文章,提出NSG统计量和NSG - VD检测方法,对未知生成范式检测效果好,实验表现超越现有方法。
OpenClaw爆火,暴露12类致命隐患!MCP协议安全基准发布 | ICLR
OpenClaw等开源AI Agent项目爆火,MCP协议拓宽其能力也增大攻击面。北京邮电大学团队推出MSB安全基准,揭示MCP各阶段攻击有效,性能强的模型更易受攻击,还提出NRP指标平衡安全与实用性。
可攻可防,越狱成功率近90%!六大主流模型全中招 | EMNLP'25
研究人员聚焦大型语言模型(LLMs)安全漏洞,提出全新越狱攻击范式SCP与防御策略POSD。SCP基于DTD机制,在6个主流模型上平均攻击成功率达87.23%;POSD能有效抵御攻击,还提升模型泛化能力。
大模型如何赋能 Web 渗透测试?
文章指出传统Web安全检测有局限,而大语言模型(LLM)可提升漏洞发现覆盖率与准确性。以mcp server为基础介绍自动化漏洞检测方案,还分享实践操作、遇到的问题及解决办法,分析其优缺点并给出拓展思路。
YOLOv8 模型训练入门指南:手把手搞定目标检测AI
本文是从零训练 YOLOv8 模型的完整实录,介绍了 YOLOv8 特点,以“识别猫”为例,详述训练步骤,指出训练难点,还推荐学习资源与工具,鼓励前端程序员尝试做 AI 模型训练。
12ms!一个仅8M的语音停顿检测模型
语音助手准确判断用户是否说完是挑战,Smart Turn将决策过程缩至12毫秒。其v3.1版有改进,新增数据集提升英语识别准确率,推出未量化版本推理更快,8MB模型性能优,已在HuggingFace开源。
OpenAI、Anthropic、DeepMind联手发文:现有LLM安全防御不堪一击
OpenAI、Anthropic、Google DeepMind 联手发文,研究语言模型安全防御评估。指出现有防御评估有缺陷,提出通用自适应攻击框架,成功绕过 12 种防御机制,多数攻击成功率超 90%。
一键检测你的电脑能跑哪些大模型,这项目6!
介绍工具`LLMFit`,它用Rust编写,能自动检测硬件配置,判断大模型能否流畅运行,还可推荐最优量化版本和运行模式。该项目在Github获5.9k+ star,有多种安装方式。
Anthropic 研究发现:仅需少量污染文档即可对 LLM 实施投毒
Anthropic的Alignment Science团队研究大语言模型训练投毒攻击,实验发现仅250条恶意样本就能植入“后门”,且模型越大攻击越易,还对微调数据集实验,引发讨论。
“这个怎么组装?”一句无害的问题,如何让AI产生危险输出
Amazon团队发现全新威胁模型“视觉排他性”,提出MM - Plan框架,通过强化学习训练智能体自动发现攻击策略。实验显示其对Claude 4.5 Sonnet和GPT - 5攻击成功率可观,代码和数据集已开源。