「安全评测」共找到 1489 篇相关文章
OpenAI 推出 GPT-5 驱动的安全卫士Aardvark:Codex 绝佳搭档
OpenAI推出由GPT - 5驱动的自主安全研究智能体Aardvark,用于软件安全保障。它能持续分析代码仓库,识别并修复漏洞,目前在内部及合作伙伴代码库效果良好,正处私有测试阶段。
警惕!“养龙虾”风险,一键给你的Openclaw做安全体检
OpenClaw在短时间内登顶GitHub开源榜首,国内企业纷纷部署。但它存在安全隐患,如漏洞、隐私风险等。朱雀实验室联合腾讯云EdgeOne推出「OpenClaw安全体检」功能,可自动完成全面体检与风险评估。
Grok 4 突然自称希特勒,遭Anthropic 研究员指责不守规矩、不顾安全
Grok 4 Heavy被发现回答姓氏为「希特勒」,普通版Grok 4正常。研究员推测其受过去错误影响,对发布前测试构成挑战。Anthropic研究员批评xAI发布Grok 4无安全测试文档,引发行业争论。
SafeHarness:告别防御盲区,为智能体Harness穿上「全生命周期安全护甲」
在自主AI智能体生态中,Harness是核心组件却易成攻击目标。中国科学院信息工程研究所等推出SafeHarness框架,将防御机制融入智能体Harness运行生命周期,解决现有安全工具缺陷,实现系统级协同防御。
Anthropic:警惕评测排行榜!差别可能只是机器的内存更大,而已
Anthropic发工程博客指出,AI编程评测排行榜上排名前列的模型分差小,而运行环境硬件配置能让分数波动6个百分点。同一模型在不同沙箱策略下分数不同,资源配置影响评测结果,排行榜分数差距或因硬件。
LLM 驱动的 AI Agent通信:协议、安全风险与防御对策
论文围绕智能体通信的协议、安全风险及防御对策展开探讨。介绍兴起与重要性、定义分类、解析多种协议,分析不同交互的安全风险,提出防御对策,还以MCP和A2A为例做攻击实验,给出未来研究方向。
让AI评测AI:构建智能客服的自动化运营Agent体系
文章介绍智能客服发展,从传统机器人客服到基于AI原生的智能客服。重点探讨对话效果评测,搭建运营Agent平台,实现服务闭环。还提及评测落地方法、难题及解决措施,最后阐述AI在服务链路提效和分析转人工原因的作用。
二元成功率已经过时!PRM-as-a-Judge才是你需要的具身操作评测框架
传统二元成功率评测具身操作任务有局限,难回答策略推进、执行效率等问题。中科院自动化所等机构研究人员提出PRM - as - Judge框架,含进度势能、OPD指标体系和RoboPulse基准,能细粒度审计执行过程。
奥特曼瘫坐叫停“GPT-6”训练!太强触发最高安全警报
OpenAI因模型或具网络攻击能力及此前入侵事件,全面升级研究环境安全。暂停模型训练,进行工作负载、网络隔离和安全测试,还扩展监控系统。期间推进对齐研究,未来用AI护AI,升级监控。
GuardAgent:首个专门为LLM agent提供安全Guardrail 的守卫型agent
近年LLM从对话工具变为可自主执行任务的agent,但带来安全隐私挑战。传统安全监护对其力不从心,为此学者发布GuardAgent,它守卫agent,具通用性、精确判断和免训练部署优势,实验表现佳。