大模型测试」共找到 9649 篇相关文章

算法论文8

文言文秒杀所有模型!100%攻击成功,轻松突破安全防线

南洋理工等机构团队提出基于文言文语境的自动化黑盒测试框架CC - BOS,利用果蝇算法和8维策略空间,暴露主流语言模型安全盲区,实验显示对6款主流模型攻击成功率达100%。

AIGC开放社区
产品应用7

Hexstrike AI在多个工具及模型上的渗透测试表现

文章围绕Hexstrike AI在多个工具及模型上的渗透测试展开。介绍测试环境,用不同难度靶机测试。分析Claude desktop+Sonnet 4.5、AIaW+Deepseek、Cursor+多个模型等组合表现,指出LLM辅助渗透测试任重道远。

AI与安全
产品应用8

模型“跑”在手机里:vivo蓝心端侧部署创新揭秘,性能功耗双优!

在AICon2025上海站,vivo AI研究院工程师章苏迟分享蓝心模型端侧部署方案。介绍端侧模型优势及应用场景,阐述内存、性能、功耗等指标优化方法,还提及多业务场景应对策略与安全合规措施。

InfoQ
开源动态8

央企牵头!这个AI开源社区要让模型跑遍「中国芯」

6月30日百度文心模型4.5系列开源并登陆魔乐社区,该社区发起‘模型推理适配协作计划’,想让模型跑遍中国芯。其升级工具中心和协作空间,联动产业力量,解决模型在国产芯适配难题,推动生态发展。

机器之心
新闻资讯7

模型终于通关《宝可梦蓝》!网友:Gemini 2.5 Pro酷爆了

Gemini 2.5 Pro在直播中通关《宝可梦蓝》,谷歌CEO官宣。文中介绍其通关过程、玩游戏基本步骤,还探讨宝可梦对模型的挑战,谷歌将继续探索,网友提议用通关宝可梦测试模型

量子位
算法论文8

迈向无缝共生:模型GUI Agent的「屏幕图灵测试」与拟人化之路

多模态模型使GUI Agent能模拟用户执行任务,但也引发与平台的利益冲突。论文提出“屏幕图灵测试”和AHB基准评估拟人化能力,探讨拟人化策略及权衡,为Agent在数字世界共生提供指南。

AI科技评论
新闻资讯8

刚刚,智源全新「悟界」系列模型炸场!AI第一次真正「看见」宏观-微观双宇宙

6月6日第七届智源会,智源研究院推出全新「悟界」系列模型,含原生多模态世界模型Emu3、脑科学多模态通用基础模型见微Brainμ等,反映其对模型发展的研判,推动AI向物理世界迈进。

机器之心
产品应用7

高考数学全卷重赛!一道题难倒所有模型,新选手Gemini夺冠,豆包DeepSeek并列第二

因网友质疑上次测评不严谨,此次用六款模型挑战含解答题的全套高考数学题。结果Gemini 2.5 Pro夺冠,Doubao和DeepSeek R1并列第二。解答题是失分重灾区,图像题难倒多模态模型

机器之心
新闻资讯8

马斯克悄然发布Grok 4.1,霸榜模型竞技场所有排行榜

马斯克发布Grok 4.1,同时霸榜模型竞技场第一和第二。它在思考与非思考模式表现出色,还在新专家榜和职业榜霸榜。此外,它在情商测试表现佳,还加强快速回复、改善幻觉问题,已向所有用户开放。

量子位
开源动态8

不会拍照有招了!北彭宇新团队开源首个美学指导模型Venus,帮你拍好照|CVPR 2026

彭宇新教授团队针对现有模型在摄影指导上的不足,定义美学指导任务,构建数据集AesGuide,提出美学指导模型Venus。相关论文被CVPR 2026接收并已开源,Venus在多项评测中优于现有方法。

量子位