评测集」共找到 1085 篇相关文章

新闻资讯7

全国首部“高质量数据验收”标准,现公开征起草单位和专家!

国家数据局等明确支持数据流通服务机构与人工智能企业合作,凸显数据到模型训练与产业应用环节的重要性。现有数据质量标准在产业场景有缺口,全国首部《人工智能训练数据交付与质量验收规范》团体标准应运而生,现征起草单位和专家。

AI大模型应用实践
开源动态8

单次训练横扫9个基准,遥感检测最大数据与基础模型框架问世

北京航空航天大学团队发布面向通用遥感目标检测的大规模数据与基础模型框架 LEVIRDet,构建了 LEVIRDet - 159 数据,提出 LEVIRDetNet 模型。前者为训练泛化能力强的模型提供新数据基础,后者在多基准测试中表现出色。

机器之心
算法论文8

给文档质量"打分":DIQA-5000 数据与融合版面语义的 DocIQ 质量评估模型

文档图像质量评估(DIQA)是评判‘增强算法有没有把图变好’的关键工具。过去研究多围绕自然图像,缺文档专用数据。本文提出DIQA - 5000数据和DocIQ模型,补齐缺口。

机器学习AI算法工程
新闻资讯8

全球首个真实世界具身多模态数据,它石智航交卷,比特斯拉还早6个月

它石智航发布全球首个大规模真实世界具身VLTA多模态数据WIYH,将于2025年12月开放。该数据突破大,特点鲜明,优势明显,其发布填补数据空白,奠定以人为本范式。

量子位
新闻资讯7

靠AI破解癌症,初创公司融下3000万刀!新目标:建10亿单细胞数据

福布斯介绍,初创公司Tahoe Therapeutics融资3000万美元构建活细胞AI模型,估值达1.2亿美元。该公司已研发出针对一种主要癌症亚型的候选药物,还开源数据,与其他公司合作开发AI agent。

量子位
开源动态8

中山大学&华为联合提出 Issue Resolution 数据构建神器SWE-Factory:每条只要$0.024

中山大学和华为联合提出低成本开源方案 SWE-Factory,可自动收代码打造高质量代码评估数据。它能解决传统构建流程繁琐、依赖人工的问题,实现全流程自动化,还构建了 SweSetupBench 数据,表现出色。

深度学习自然语言处理
新闻资讯8

更全面的具身智能真机评测来了!CVPR 2026 ManipArena挑战赛邀你打榜

具身智能产业发展迅速,但缺统一、高标准真机评测体系,成发展痛点。中山大学等机构推出 ManipArena 挑战赛,提供科学评测框架,已测部分模型,揭示不同技术路线能力边界,为产业发展提供基础。

机器之心
开源动态8

YOLO12改进引入DINOv3少样本目标检测精度飙升,分享训练自定义数据代码

Meta 人工智能研究院的 DINOv3 是基于自监督学习的视觉大模型,解决诸多问题且无需微调,在多任务表现出色。将其引入 YOLO12 后,在不同规模数据上检测性能显著提升,还分享训练自定义数据代码。

机器学习AI算法工程
算法论文8

别再用单选评测骗自己了!Amazon新论文揭示了大模型在多选题中的3种系统性偏差

Amazon新论文揭示大模型做多选题有3种系统性偏差,如选择、数量、猜测偏差。还推出SATA - Bench评测,给出10个测量指标,提出Choice Funnel解码策略,能提升小模型多选题正确率。

深度学习自然语言处理
算法论文8

北大团队让AI学会考古!全球首个古希腊陶罐3D视觉问答数据发布,还配了专用模型

北大团队推出全球首个面向古希腊陶罐的3D视觉问答数据VaseVQA - 3D,配套专用视觉语言模型VaseVLM。传统模型面对文化遗产复杂对象有不足,新数据和模型让AI迈向‘文化考古Agent’,未来将拓展到更多领域。

量子位