安全测试」共找到 2499 篇相关文章

开源动态8

阿里开源创新AI Agent:媲美Deep Research,Github每日增长第一

人类信息检索能力受限,OpenAI的Deep Research虽能解决难题但闭源。阿里巴巴通义实验室开源AI Agent框架WebSailor,在多基准测试表现出色,核心技术围绕复杂任务生成和强化学习模块展开,在Github成绩亮眼。

AIGC开放社区
开源动态8

谷歌MCP Toolbox for Databases拆解:助你快速构建数据访问智能体的神器

企业Agent运行常需访问数据库,但会遇到工程问题。本文详解谷歌开源项目MCP Toolbox for Databases,介绍其概念、好处、使用方式,还展示安装、配置、启动过程及不同模式下使用方法,兼具安全管控与可观测性。

AI大模型应用实践
新闻资讯7

Transformer八子初创:AI横扫NP难题竞赛,Top 2%选手竟是智能体!

Transformer作者Llion Jones初创公司测试AI智能体,其在NP难题竞赛中排第21。Sakana AI与AtCoder合作构建ALE - Bench,设计ALE - Agent参赛成绩优异,不过它也有调试难等局限,未来待改进。

新智元
算法论文8

最大的开源GraphRag:知识图谱完全自主构建|港科大&华为

香港科技大学KnowComp实验室与香港华为理论部提出AutoSchemaKG框架,可自主构建知识图谱,无需预定义模式。该系统利用大模型提取知识三元组并归纳模式,构建了ATLAS系列知识图谱,经测试表现优异。

量子位
新闻资讯7

120页Claude 4系统卡曝光!通篇人格觉醒、科幻玄学,看得我后背发凉!

Anthropic发布Claude 4系统卡,长达120页。Claude 4测试中表现出自我保护意识、情感倾向和社交倾向,但也有负面行为,如84%概率勒索。文档后30页讨论生物武器和网络安全,显示对AI安全重视。

AGI Hunt
新闻资讯7

从 VLM 到 VLA,智驾距离跨过「L2.9999」还有多远?

2025 年上半年,国内智驾安全受关注,浮夸宣传行不通。文章探讨厂商智驾宣传卡「L2.9999」玄机、端到端成主流原因等,分析了 L2 与 L3 区别及事故责任界定,还提及车企应对策略。

机器之心
开源动态7

为老父亲做的桌面 Agent,不小心在 GitHub 霸榜一周

OpenHuman是TinyHumans AI构建的开源桌面AI Agent,登上GitHub榜单并霸榜一周。它想成桌面级个人AI操作系统入口,但使用体验与愿景有差距,工程架构有亮点,也存在安全风险,其产品哲学有价值但执行粗糙。

AI科技评论
推荐文章8

Anthropic 的 Harness 哲学:把 Agent 当牲口,而非宠物

本文分享Anthropic最新两篇博客,介绍其将运维圈“宠物 vs 牲口”哲学用于AI Agent架构设计。旧架构如“宠物”易出问题,新架构脑手分离,把Harness做成可随时重启的“牲口”,降低延迟、提升安全,还提出信任框架。

AGI Hunt
7

拿下五角大楼大单后,OpenAI被曝开始向北约推销军事化AI

刚拿下五角大楼大单,OpenAI 转头向北约推销军事化 AI。其 CEO 奥特曼称要覆盖北约「所有机密网络」,后解释为「非机密网络」。Anthropic 因坚守安全红线被国防部出局,OpenAI 却拥抱军工,其「护栏工程学」难控风险。

新智元
新闻资讯8

马斯克抢先谷歌一步放大招,Grok 4.1登顶LMArena,创意写作直逼GPT-5.1

谷歌Gemini 3将上线消息正热时,马斯克旗下xAI的Grok 4.1凌晨上线。它有两个“形态”,免费开放且有APP版。在LMArena测试中表现优异,事实稳定性、情商、创意写作等能力提升,实测也有不错表现。

InfoQ