「基准测试数据集」共找到 1347 篇相关文章
Meta发布Omnilingual ASR:支持1600+语言的开源语音识别系统
Meta发布全新自动语音识别系统Omnilingual ASR,支持超1600种语言,核心创新是零样本和少样本学习能力,降低小语种语音识别门槛。项目提供不同规模模型,安装调用简单,目前仅支持40秒内音频,数据集和项目均开源。
NeurIPS 2025 Spotlight | PhysX-3D:面向真实物理世界的3D资产生成范式
论文由南洋理工大学 - 商汤联合研究中心 S - Lab 及上海人工智能实验室合作完成,提出首个系统性标注的物理基础 3D 数据集 PhysXNet 及扩展版 PhysXNet - XL,还提出 3D 生成框架 PhysXGen,实现从图像到真实 3D 资产的生成。
众所周知视频不能P?北大施柏鑫团队、贝式计算CVPR研究:视频里轻松换衣服、加柯基
视频编辑难度高,传统流程繁琐,现有AI方法有局限。北大施柏鑫团队联合贝式计算等提出VIRES方法,能实现视频主体多种编辑操作,还标注VireSet数据集。其在多指标超现有SOTA模型,团队还探索全景级可控视频生成。
VLA不够了?触觉,将改写具身智能新格局
2026 年数据成具身智能竞赛焦点,IEEE 专访机器人学家王煜。他认为 VLA 架构难支撑机器人落地,触觉数据是关键。他与团队提出 VTLA 框架,创立戴盟机器人,发布数据集并开源部分数据,还阐释对具身智能多方面的思考。
3D-R1重塑三维视觉语言推理!让三维交互更智能
近年来,视觉 - 语言模型在2D图像理解有突破,但3D视觉语言模型面对复杂场景不足。为此上海大学团队提出3D - R1模型,它基于新数据集和策略构建,有强多任务三维理解能力,不过也存在进步空间。
让AI像人类一样认知真实世界!UCLA谷歌强强联手,长时记忆+3D空间理解超越基线16.5%
如何让AI在3D环境中像人类一样思考,是具身智能领域难题。UCLA与谷歌团队带来3DLLM - MEM模型与3DMEM - BENCH基准,让AI有构建、维护和利用长时记忆能力,实验超基线16.5%,但有依赖模拟器预设的局限。
807道灵魂拷问后,中国模型竟在「意义测试」中夺冠!
在美国新基准测试FAI - C中,中国开源模型Qwen3夺冠,DeepSeek的R1跻身前六,力压美国明星实验室顶级模型。该测试由前英特尔CEO帕特·基辛格所在公司Gloo推出,旨在让AI直面深层问题。
阿里Qwen 3.7 Max:35小时自主编程,Claude跟不上了?
阿里云峰会发布的Qwen 3.7 Max,在优化平头哥芯片推理内核任务中,35小时让推理速度快10倍。它在多基准表现出色,编程、推理、办公自动化全面开花,但闭源且实验室场景与现实有差距。
成本不到8千美元!新浪微博1.5B小模型超越近万亿参数模型
新浪微博开源的VibeThinker - 1.5B模型,仅15亿参数、训练成本不足8000美元,却在顶级数学竞赛基准击败近万亿参数模型。它采用频谱到信号原则,分两阶段训练,性能出色,成本低且数据无污染。
大语言模型离“数学证明高手”还有多远?斯坦福、伯克利、MIT 团队提出 IneqMath 评测标准
现在很多大语言模型常给出看似正确的结论,但推理过程却有问题。斯坦福、伯克利和MIT团队提出新思路,构建IneqMath数据集及‘AI数学裁判系统’,研究发现很多模型推理不严谨,还给出两个提升准确率的办法。