漏洞修复」共找到 306 篇相关文章

算法论文8

推理正确率下降65.5%!斯坦福、MIT等用「不等式」拷问AI逻辑极限

大语言模型在数学证明常现推理漏洞,斯坦福等高校团队提出IneqMath基准评估其严谨性。用不等式证明题切入,拆解为子任务,构建评测体系,用LLM - as - Judge审查。结果显示模型推理正确率低,存在结构性缺陷。

新智元
开源动态8

一款永远不睡觉的 AI Agent 微框架:它会自己琢磨事儿,干完主动来找你汇报!

Laude Institute的AI Agent Audel在无指令下自动修复bug,背后是开源的AI Agent微框架Headlong。它与其他Agent不同,其Agent永远不睡觉,核心由9800行Bash脚本构成,安装简单,提出AI主体性问题。

开源星探
新闻资讯7

OpenAI公开4+10条保命指南,专防AI自动化攻击

OpenAI联合创始人兼总裁Greg Brockman在Blog中警告,前沿AI Agent能自主找漏洞并发动网络攻击,AI降低攻击门槛,防御端却未跟上。他分享OpenAI四项安全措施及防御者十项举措,呼吁行业共建安全生态。

量子位
推荐文章7

自构建智能体:一项 LangChain4j 实验

作者将LangChain4j文档交代码助手,让其参照构建智能体,设计多智能体系统编写、测试和调试代码。实验展示了LangChain4j优势,还对比监督者和工作流两种智能体实现模式,揭示速度与自主性权衡关系。

InfoQ
新闻资讯8

中国第一,直逼OpenAI!神秘「扫地僧」冲到全球前七

神秘中国AI「扫地僧」MopMonk以73.1%胜率杀入CyberGym全球前七,紧咬OpenAI。它用MiniMax M3为基座,靠结构化记忆、多Agent并行等策略提升漏洞挖掘执行力,示范开源基座极致利用之路。

新智元
算法论文8

代码Agent的苦涩教训!首次拆解上下文检索,直指自动化软件瓶颈

ContextBench首次从「过程」评测代码智能体,揭示当前模型多读少用、被关键词误导等深层问题。它基于真实问题修复任务,由专家标注「黄金上下文」,用多指标评估。研究显示,复杂架构未必效果好,模型重召回轻精确等。

新智元
新闻资讯7

智能体的记忆管理机制及其潜在风险 | 直播预约

大语言模型(LLM)智能体兴起,记忆机制是核心。本次报告将探讨记忆管理对其性能的影响及潜在风险,展示缓解关键挑战的策略,介绍新攻击范式,揭示安全漏洞,强调需重新审视与建模。

深度学习自然语言处理
产品应用8

终于,TRAE SOLO全量开放,我们用它复刻了PewDiePie的大模型智囊团

2025年AI Coding赛道上,TRAE是国产AI IDE代表作。7月其SOLO Beta版反响好,如今正式版全量推送。它定位为‘具备响应感知的编程智能体’,新增功能,还限时免费体验,实测显示开发能力强。

机器之心
产品应用8

获NVIDIA致谢:悟空Agent的实践、复盘与迭代

本文以悟空Agent获NVIDIA致谢为切入点,介绍多智能体架构闭环及实战挑战,如上下文断流、调度失衡。还阐述架构设计、迭代优化、数据飞轮体系,指出AI infra存在安全隐患,强调安全融入业务的重要性。

腾讯技术工程
算法论文8

大模型智能体不止能写代码,还能被训练成白帽黑客

Amazon AWS AI的Q Developer团队发布两项训练网络安全大模型的新方法Cyber - Zero和CTF - Dojo。前者不依赖真实环境生成训练数据,后者构建实战环境让模型学发现漏洞,二者结合为AI白帽黑客成长提供路径。

机器之心