基准集」共找到 1340 篇相关文章

新闻资讯8

谷歌Gemini 3杀疯了!陶哲轩亲测:10分钟干翻百年数学难题

Gemini 3本周一发布后开启横扫基准测试之旅。在FrontierMath基准测试创纪录,Epoch能力指数超GPT - 5.1。陶哲轩用Gemini Deepthink十分钟解决埃尔德什问题关键证明,同时它还霸榜物理基准测试CritPt。

新智元
算法论文8

ECCV 2026 | 智能助手何时该主动开口?Vinci2让第一视角AI助手从「有问必答」走向「主动服务」

现有第一人称视频助手难以自主判断何时介入服务用户。大连理工大学等团队提出Vinci2,含评测基准EgoServe和智能体EgoMemo。它已被ECCV 2026接收,代码和标注均开源。

机器之心
算法论文8

具身智能迈入下半场,RoboMemArena全面评测机器人记忆系统

香港科技大学(广州)等多机构打造具身智能评测基准 RoboMemArena,突破传统局限,构建综合评测体系,配套真机测评。它提供多模态标注,任务长程多样,开源资源易用,PrediMem 在其上表现出色。

机器之心
开源动态8

哔哩哔哩献给二次元世界的礼物—AniSora,目前最强大的开源动漫视频生成模型

动画视频生成评估挑战大,现有模型处理动画视频力不从心。哔哩哔哩推出AniSora综合系统,支持一键生成多种动漫风格视频镜头,在角色和动作表现上出色,在多维度超越当前先进模型。

带你学AI
开源动态8

全球首次实测通过!CMU华人用AI设计的乐高「不翻车」

CMU研究人员提出LegoGPT,它微调Meta的LLaMA模型,结合47000个稳定结构数据,确保98.8%的乐高设计符合物理定律,可实际搭建。目前,数据、代码和模型均已开源。

新智元
开源动态8

103K「硬核」题,让大模型突破数学推理瓶颈

现有大语言模型在数学推理训练时面临数据瓶颈,腾讯AI Lab与上海交大团队推出DeepMath - 103K数据。它规模大、难度高、数据新颖、严格去污染,让DeepMath系列模型达SOTA,还能实现推理泛化。

机器之心
算法论文8

北航LiveRepoReflection: 扭转乾坤-仓库级代码反射

本文提出LiveRepoReflection基准,评估多文件仓库代码理解和生成能力,含1888个测试案例。创建RepoReflection - Instruct数据训练RepoReflectionCoder,评估40多个LLMs,结果显示其能有效测模型反思修复能力。

PaperAgent
开源动态8

具身智能“高考”难疯了!人类100分,最强模型12.8

原推出RoboTwin系列基准的团队带来RoboDojo,这是统一的仿真+真实世界机器人操作评测基准。它设42个仿真任务、18个真实任务,让30个主流策略竞技,结果显示机器人距通用操作差距大。

量子位
开源动态8

阿里搞了个全能解析器,文档、图片、音频、视频一锅端

阿里巴巴开源 Logics-Parsing-Omni,用一个模型统一处理文档、图片、音频、视频四种模态,输出结构化 JSON 数据。它采用三级渐进解析框架,两阶段训练策略,在自建基准上多项指标超越 Gemini - 3 - Pro。

CourseAI
开源动态8

刚刚,字节开源Seed-OSS-36B模型,512k上下文

深夜,字节跳动Seed团队开源Seed-OSS系列模型,含三个版本。其用12万亿tokens训练,在多基准测试表现出色。有灵活推理预算控制等特性,原生支持512K上下文窗口,基准测试成绩佳。

机器之心