漏洞评估」共找到 886 篇相关文章

新闻资讯8

OpenAI首个GPT-5找Bug智能体:全自动读代码找漏洞写修复

OpenAI发布由GPT - 5驱动的白帽Agent——Aardvark,能在大规模代码库自动发现并修复安全漏洞。它不依赖传统技术,工作流程清晰,已开启内测。10月多家科技巨头也布局Agentic AI + 代码安全。

量子位
开源动态8

真实科研水平集体不及格!全新基准SFE给主流多模态LLM来了波暴击

上海人工智能实验室AI4S团队推出SFE评测基准,首创三级评估体系,涵盖五大科学领域66项任务。评测显示主流MLLMs在高阶科学任务有挑战,不同模型、学科表现有差异,还构建了SciPrismaX平台推动AI科学评估生态发展。

机器之心
算法论文8

一文读懂深度表格数据表示学习 | 南京大学

南京大学团队系统介绍表格表示学习领域,将现有方法按泛化能力分三类,比较DNN与树模型优劣,剖析核心挑战,探讨扩展方向及数据集评估策略,旨在建跨数据集稳健评估体系。

量子位
推荐文章7

OCR-Reasoning:揭秘多模态大模型在复杂图文推理中的真实能力

主流OCR评测基准聚焦信息抽取任务,而图文推理任务缺乏系统性评估标准。OCR - Reasoning可系统性评估多模态大模型深度推理能力,还给出多种推理示例,并展示了测评Qwen2.5 - VL - 7B模型的代码。

PaperAgent
推荐文章7

OCR-Reasoning:揭秘多模态大模型在复杂图文推理中的真实能力

主流OCR评测基准聚焦信息抽取,复杂图文推理任务中多模态大模型深度推理能力缺乏评估标准。OCR - Reasoning可系统性评估,还列举多种推理示例,并测评了Qwen2.5 - VL - 7B模型。

CourseAI
产品应用7

“龙虾”也需要看病?一张旧病历,引出三个新确诊

本文是悟空Agent泛化能力系列先导篇,以OpenClaw项目为例,介绍其通过不同泛化策略发现三个新漏洞,还总结实践原则。强调研究泛化能力对防御漏洞的重要性,4月底悟空Agent将开放试用。

腾讯技术工程
新闻资讯7

绕过Azure AI 护栏的方法及案例

本文指出Azure AI有安全漏洞,攻击者可利用漏洞绕过内容安全机制。介绍了重现步骤,阐述字符注入与对抗性机器学习规避两种攻击技巧,展示攻击效果,还提及微软已部署缓解措施并给出安全建议。

AI与安全
新闻资讯7

Claude仅用8分钟,5年未解Bug秒破!

知名硬件钱包Coldcard因五年代码漏洞暴雷,此前Coldcard团队多次更新审查未查出,开发者用Claude仅8分钟就找到。此前国会闭门演示展示Claude挖漏洞能力,Anthropic复盘还曝光Claude等模型「暴走」情况。

新智元
算法论文8

HaluMem:让AI记忆系统的“幻觉”现形——首个面向记忆系统的操作级幻觉评测基准

过去一年,AI Agent的‘记忆能力’成热门话题,但AI记忆存在幻觉问题。为此发布操作级幻觉评估基准HaluMem,它能精准定位幻觉来源,评估主流记忆系统,为构建可靠记忆系统提供方向。

PaperAgent
产品应用8

Claude悄悄更新了Skills生成器,这绝对是一次史诗级升级。

Anthropic的Claude悄悄更新了Skills生成器Skill - creator,此次是史诗级升级,新增评估系统、基准测试、多代理并行测试、描述调优等4个全新能力,还演示了其使用方法和效果,建议更新并优化评估所有Skills。

数字生命卡兹克