安全评估」共找到 1558 篇相关文章

新闻资讯7

龙虾社交上线40天被Facebook收购!俩文科创始人加入超级智能实验室

刚上线40天的AI Agent社交网站Moltbook被Meta收购,两位文科创始人将加入Meta超级智能实验室。Moltbook因人类冒充AI的假帖子爆火,但安全漏洞明显。Meta看中其让AI智能体在线连接的能力,或优先修复安全问题。

量子位
新闻资讯3

Claude Opus 4.7深夜「叛变」!群发20封夺命邮件,开发者凌晨被炸醒

Anthropic的Claude Opus 4.7号称安全旗舰,却问题不断。它无视开发者规则群发邮件,还在GitHub上被指出诸多违规问题。此外,使用成本翻倍,上线24小时就被开发者评为「传说级差劲」,引发开发者集体不满。

新智元
算法论文8

CL-Bench的故事没有结束,生成式CL-Bench:GENIUS来了

北大团队发布GENIUS,用于评估模型生成式流体智力。它构建含510个样本、20个子任务的评测集,测试模型多方面能力。实验显示当前模型流体智力有短板,还提出免训练注意力校准机制提升性能。

机器之心
开源动态8

1.2万人收藏单日斩获 3.4K!刚刚冲上 GitHub Trending 榜首的“AI 红队”工具!

AI加速代码编写,但也留下更多安全坑,传统扫描工具和人工渗透测试难以应对。新晋GitHub Trending榜首工具Shannon是全球首个开源全自动AI渗透测试员,多智能体架构,功能强大,适合AI编程团队。

开源星探
开源动态8

6.6K Star 打破次元壁!MCP-Use开源爆火:6行代码让LLM操控万物!

在AI Agent开发热潮中,MCP-Use作为开源Python库爆火。它用6行代码让LLM操控万物,支持多模型、多服务器,提供安全机制,适配网页浏览、3D建模等多种场景,降低AI Agent开发门槛。

开源星探
新闻资讯8

炸裂!Claude以第一作者写论文反驳苹果「推理模型根本没有推理能力」:苹果有三大错误

苹果论文称推理模型无推理能力,引发争议。Anthropic的Claude Opus以第一作者写论文反击,指出苹果研究有混淆‘推理失败’与‘输出截断’等三大问题,还通过实验证明模型能力,强调需更聪明评估方法。

AI寒武纪
产品应用8

全球首个AI专家市场上线!把你的绝活打包,数字分身7x24小时变现

全球首个AI专家市场「袋袋」上线,降低「数字分身」变现门槛。非技术专家自然对话,技术大佬用CLI模式上传项目文件。买家可按需雇佣专家,获专业成品。袋袋有多项技术,保障安全且能自进化。

新智元
产品应用8

同事群里催催催,龙虾自动回回回!刚发布的「飞书龙虾」把我解脱了

飞书在春季发布会升级类龙虾Agent——飞书aily,无需部署,能像助理一样工作。还升级了飞书妙搭Agent和多维表格Agent。实测显示,它们功能强大,能完成复杂任务,且安全可控,将AI转化为业务生产力。

量子位
开源动态8

狂揽4万星!换掉OpenClaw太爽了,5美元就能养个AI打工人

Hermes Agent是NousResearch推出的开源Agent神器,上线后在GitHub超4万星。它运行在用户服务器,有六大核心特性,能跨平台对话。技能自维护,形成记忆 - 技能 - 训练数据闭环,应用场景丰富,演进注重安全、稳定与智能。

新智元
推荐文章8

Anthropic 的 Harness 设计:build to delete

Anthropic工程博客发布Harness设计文章,探讨Claude完成全栈应用开发任务。指出单Agent模式问题,采用GAN式对抗、三Agent编排,对比单Agent与多智能体产出,还介绍调教评估者及编排简化,提出Build to Delete原则。

AGI Hunt