AI测试集」共找到 10760 篇相关文章

算法论文8

ICCV 2025 | ECD:高质量合成图表数据,提升开源MLLM图表理解能力

科研等领域图表是信息核心载体,先进开源MLLMs在高难度图表理解测试准确率低。本文提出ECD数据,规模大、质量高、风格多样,还设计合成流水线与评测基准ECDBench,为开源MLLM提供支持。

机器之心
新闻资讯7

从性能到实战,怎样才算是靠谱的 Agent 产品?

红杉中国团队提出AI基准测试工具Xbench,其双轨测评体系不再单纯执着于测评问题难度,重点量化AI系统在真实场景的效用价值,还构建长青评估机制,以确保评估结果的时效性和相关性。

机器之心
新闻资讯7

时代2025 AI百人榜出炉:任正非、梁文锋、王兴兴、彭军、薛澜等入选,华人影响力爆棚

《时代》周刊发布2025年度AI领域最具影响力100人名单,众多华人入选,如任正非、梁文锋等。文中介绍部分入选者贡献,像任正非推动华为在AI多领域布局,梁文锋带领DeepSeek崛起。

机器之心
新闻资讯7

全国首部“高质量数据验收”标准,现公开征起草单位和专家!

国家数据局等明确支持数据流通服务机构与人工智能企业合作,凸显数据到模型训练与产业应用环节的重要性。现有数据质量标准在产业场景有缺口,全国首部《人工智能训练数据交付与质量验收规范》团体标准应运而生,现征起草单位和专家。

AI大模型应用实践
算法论文8

如何判断AI视频真假?综述动态、可溯源、可解释的检测体系 | ACL26

AI视频生成技术发展迅速,现有检测方法难满足需求。最新综述提出「事实保真度验证」目标,梳理出视觉与语言双视角的四层检测框架,还分析了检测方法演进、评测指标和数据,为AI视频检测提供落地地图。

新智元
算法论文8

如何改变AI研究范式?谷歌DeepResearch新方法TTD-DR原理与实现 | 原理篇

谷歌提出新的DeepResearch方法TTD - DR,它模拟人类研究范式,将Agent起草的初稿视为‘含噪声输出’,经多轮检索 - 改进使初稿成高质量终稿,还引入自进化机制,测试显示其在复杂任务上领先。

AI大模型应用实践
产品应用7

14.9g颠覆行业,AI眼镜终于实现无感日常佩戴|甲子光年

AI硬件浪潮中,AI眼镜被视为有潜力替代手机的形态。心眸科技发布的AI眼镜Moonix,重14.9克,回归眼镜本质,以“记录”为核心,具备主动式AI能力,能实现“记录 - 理解 - 分享”闭环。

甲子光年
新闻资讯7

我潜伏进了"年入百万"的AI自习室,发现了一些灰色的秘密。

作者潜伏进AI自习室,发现其生意火热。AI学习机功能普通,价格却高,主要卖点是内置课程。AI督学职责是托管和销售。AI自习室盈利宣传有水分,实则钻政策空子赚教育焦虑的钱。

数字生命卡兹克
产品应用8

救命!和漫画角色聊上头了,AI陪伴的新答案有了

快看漫画2.0版本推出AI陪伴互动漫画,将AI嵌入漫画角色,玩家以第一视角改写故事。它解决了AI陪伴产品痛点,靠共同经历和叙事上下文存续关系,还成多家AI技术,内测数据显示有商业潜力。

量子位
开源动态8

王炸!模型越接越乱,2.9 万 Star OmniRoute 把 290+ 个 AI 供应商压成一个入口

现在接入AI工具麻烦,换模型要改配置,额度、接口等也有问题。OmniRoute是开源AI Gateway,将多家模型供应商统一到一个入口,支持290+ providers等,可解决接入混乱问题。

小华同学ai