基准榜单」共找到 1481 篇相关文章

推荐文章8

人类研发时代结束?XYZ最强Search Agent横扫七大,300个Agent跑通AI4AI全栈闭环

近日,XYZAI Lab发布两款Deep Search Agent,刷新多项评测SOTA成绩。其背后是新型AI4AI研发范式,让AI驱动研发闭环。XYZ团队用AI解决多方面问题,在Deep Search验证,未来有望拓展更多场景。

机器之心
算法论文7

AI能否「圣地巡礼」?多模态大模型全新评估基准VIR-Bench来了

来自日本高校和企业团队提出多模态大模型评估基准 VIR-Bench,用于评测 AI 对旅行视频中地理位置与时间顺序的理解。它将任务拆解,构建数据集,实验显示模型虽有改进但性能远未达标,指明了大模型进化方向。

机器之心
算法论文8

谢赛宁盛赞字节Seed新研究!Transformer搞定任意视图3D重建

字节Seed康炳易团队的最新研究成果Depth Anything 3(DA3),获谢赛宁盛赞。它架构简,能从多种输入中精准算出物体深度、还原相机位置,在新视觉几何基准上表现出色,核心秘诀是极简设计。

量子位
7

拿下五角大楼大后,OpenAI被曝开始向北约推销军事化AI

刚拿下五角大楼大,OpenAI 转头向北约推销军事化 AI。其 CEO 奥特曼称要覆盖北约「所有机密网络」,后解释为「非机密网络」。Anthropic 因坚守安全红线被国防部出局,OpenAI 却拥抱军工,其「护栏工程学」难控风险。

新智元
开源动态8

「0污染」LLM理解基准来了!20000道题14个学科全覆盖,来自微软

MMLU-CF是微软亚洲研究院推出的无污染多任务语言理解基准测试,含20000道题、覆盖14学科。通过去污染规则和闭源测试集防数据泄露,保证评估结果可靠,已在Huggingface开放。

新智元
算法论文8

从Debugger到Developer : 低代码时代新基准NoCode-bench,SWE-Bench作者力荐

浙江大学牵头联合多机构推出全新评估基准NoCode - bench,直面自然语言驱动功能添加任务,发现当前最佳LLM成功率仅两成。它构建严谨,任务挑战大,指明AI软件开发改进方向,且已开源。

机器之心
算法论文8

SIGGRAPH 2026 | 无需训练,一段目视频解锁任意运镜与「子弹时间」

来自UIUC、宾大与Netflix Eyeline Labs的研究团队提出FreeOrbit4D,无需训练模型,用目视频就能实现任意运镜和“子弹时间”。它通过“前景补全的4D重建”提供几何支架,在大角度视角变化下表现出色,还带来诸多应用。

机器之心
开源动态8

真实科研水平集体不及格!全新基准SFE给主流多模态LLM来了波暴击

上海人工智能实验室AI4S团队推出SFE评测基准,首创三级评估体系,涵盖五大科学领域66项任务。评测显示主流MLLMs在高阶科学任务有挑战,不同模型、学科表现有差异,还构建了SciPrismaX平台推动AI科学评估生态发展。

机器之心
开源动态8

字节开源GUI Agent登顶GitHub热,豆包手机核心技术突破26k Star

字节开源的豆包手机核心支撑GUI Agent模型UI - TARS登顶GitHub热,突破26k Star。它是多模态AI智能体,纯视觉驱动,部署简,历经多轮迭代,成为热门开源多模态Agent。

量子位
新闻资讯8

直面LeCun愿景,智在无界发布最强具身世界模型,20万小时人类视频屠6大

智在无界作为人类视频学习路线开创者,4月14日发布第三代旗舰模型Being - H0.7,用20万小时人类视频训练,提出新范式,在6项权威评测中综合排名全球第一,拓展了世界模型能力边界。

机器之心