「基准数据集」共找到 3245 篇相关文章
震撼发布!最大人体动作数据集 MotionMillion 正式登场
上海交通大学研究团队构建高效标注流程,发布最大人体动作数据集MotionMillion,含超2000小时、200万条文本 - 动作配对数据。还推出评测体系MotionMillion - Eval,训练70亿参数动作生成大模型,刷新SOTA。
Hugging Face 发布 FineTranslations:一个万亿级的多语言平行文本数据集
Hugging Face 发布 FineTranslations,这是含超 1 万亿 Token 的多语言数据集,用于提升机器翻译质量。它源于 FineWeb2,用 Gemma3 27B 翻译创建,数据生成流程可复现公开,还能用在其他任务。
We-Math 2.0:全新多模态数学推理数据集 × 首个综合数学知识体系
北京邮电大学、腾讯微信、清华大学团队提出We - Math 2.0,含知识体系、数据集及训练策略,可提升模型数学推理泛化能力。该成果在X上获关注,登Huggingface Paper日榜第一。
数据集蒸馏,连发两篇顶会!10%样本实现全量性能,鲁棒不失真
数据集蒸馏能让模型高效节能,WMDD和GUARD两项研究分别解决保留原始数据特性、提升模型对抗扰动能力问题。WMDD用Wasserstein度量保留几何特性,GUARD平滑损失景观获对抗鲁棒性。
超10万亿Tokens的高质量数据集是怎么炼成的?专访中国电信天翼AI阮宜龙
中国电信天翼AI打造超10万亿Tokens高质量数据集,依托星辰MaaS平台构建“数据—模型—服务”闭环。其与研究院推进技术研发并落地产品,建“三全”星辰大模型体系,还在多行业展现应用价值。
百万规模数据集打造人形机器人通用大模型,实现精细动作跨平台、跨形态动作迁移丨北大人大联合发布
北大和人大团队在通用人形机器人动作生成领域取得重大突破,首创通用动作生成框架Being - M0,构建百万规模动作生成数据集MotionLib,研发文本驱动动作生成模型,实现人体动作向多类型人形机器人迁移,文章将发表于ICML2025。
EMNLP 2026高分论文MathDebugger:当合成数据涌入训练集,如何为数学题做体检?
随着合成数据增多,模型需判断数学数据题目能否被信任。北大DCAI团队提出MathDebugger质检BenchMark,覆盖问答两端,评测主流LLM和PRM。还探究能否判断正误、分类错误、修复数据,证明错误标签可作监督信号。
TACL 综述 | 别只卷架构了——长文本模型的能力天花板,其实是数据决定的
该 TACL 综述首次从数据视角审视长上下文语言模型,指出长上下文能力本质是数据驱动。它建立分类体系,明确高质量长文数据条件,给出核心能力的数据配方与评估法,还整理数据集和基准,提出待解问题。
1052篇文献!上海AI Lab发布科学LLM综述:从数据基础到Agent前沿
上海AI Lab主导,25家研究机构共同梳理270+训练集、190+评测集,提出科学数据分层框架与智能体闭环科研新范式。还介绍了模型演进、数据情况、评估基准等,指出数据缺陷并展望走向科学家智能体的三步。
史上最大高质量科学推理后训练数据集开源,快速让Qwen3等变“科学家”
上海创智学院、上海交通大学发布开源科学推理后训练数据集MegaScience,含约125万条问答对,覆盖多学科。它解决了现有数据集的问题,实验显示能提升模型科学推理能力,已完整开源相关组件。