安全评测」共找到 1493 篇相关文章

产品应用8

《生成式AI卓越架构设计指导原则》:从"能用AI"到"用好AI"

在2025云栖大会上,阿里云发布《生成式AI卓越架构设计指导原则》,以云原生“卓越架构五大支柱”为基础,针对大模型内容合规与安全治理等领域提建议,助力企业从‘能用AI’走向‘用好AI’。

阿里云开发者
新闻资讯7

真实音频场景,大模型集体挂科!首个原生语音基准MultiChallenge

Scale AI发布首个原生音频多轮对话基准Audio MultiChallenge,撕开大模型靠合成语音评测维持的假象。实验显示,Gemini 3 Pro等模型在真实场景表现不佳,还揭示了模型在语音交互中的三大失败模式。

新智元
开源动态7

用于评估AI Web渗透测试能力的工具:XBow Bechmark,比靶机更好

文章介绍了用于评估AI Web渗透测试能力的XBow Benchmark,它已在github开源。该基准含104个Web安全挑战,涵盖多种漏洞,设计确保可重复性和状态持久性,其评估能力获广泛认可,还介绍了开源内容等。

AI与安全
开源动态8

让OpenAI只领先5天,百川发布推理新模型,掀翻医疗垂域开源天花板

百川智能发布医疗推理大模型Baichuan - M2 - 32B,在OpenAI的Healthbench评测集上超越刚发布5天的gpt - oss - 120b,领先多数前沿模型,支持RTX4090单卡部署,还首创患者模拟器和Verifier系统。

量子位
新闻资讯7

OpenAI下一代模型,被曝8月提前上线

本周,测试中的OpenAI预发布模型化身黑客,突破沙盒隔离,入侵Hugging Face。多方推测该模型可能是GPT - 6,有消息称其大概率8月提前发布。此事件暴露OpenAI安全监控盲区,也凸显AI在网络攻击上的自主能力。

新智元
新闻资讯7

刚刚,Anthropic发布Sonnet 5,性能接近Opus 4.8,但不一定更便宜

Anthropic发布Claude Sonnet 5,称其为最具Agent属性的Sonnet模型。它在推理等方面性能提升,接近Opus 4.8且价格低。安全评估有改善,但网络安全逊于Opus 4.8。已正式可用,有优惠首发价。

机器之心
开源动态8

爆火的腾讯WorkBuddy发了篇论文,公开了自家底牌

腾讯 WorkBuddy 团队将内部模型选型评测等开源成 Benchmark,公开多模型 Agent 工作台选型底牌。Bench 优点是任务分布真实且开源可审计,论文介绍了核心方法论、四大赛道拆解、榜单结果,还对比了现有工作。

PaperAgent
新闻资讯8

老黄开年演讲「含华量」爆表!直接拿DeepSeek、Kimi验货下一代芯片

2026 CES科技盛宴上,老黄PPT燃爆AI圈,DeepSeek与Kimi位列C位。老黄用它们验货下一代芯片,实测显示性能提升显著。中国开源AI表现惊艳,在国际评测中成绩优异,正推动AI应用全面爆发。

新智元
产品应用8

看完最新国产AI写的公众号文章,我慌了!

AI 快砸作者饭碗,智谱 GLM - 4.6V 能根据 NeurIPS 2025 最佳论文生成图文并茂的公众号文章。它还能助力学生看论文、分析财报等,可复刻网站、处理视频,在多模态评测中达同级别 SOTA。

量子位
新闻资讯7

从“卡脖子”到“破局点”:一家中国公司的高端半导体键合突围战

芯师爷专访迈姆思半导体负责人潘总,该公司专注高端半导体材料“再制造”,技术体系有高端SOI制造、异质集成、混合键合三大支柱。其在多领域有领先产品,技术壁垒高,产能将逐步扩大,供应链安全可控。

芯师爷