视觉理解」共找到 1300 篇相关文章

算法论文8

全球顶尖AI做物理,被人类按地摩擦?不懂推理大翻车,本科生碾压

港大等机构用3000道物理题测试顶尖大模型,如GPT - 4o、Claude 3.7 Sonnet等,结果模型准确率远低于人类专家。研究推出PHYX基准测试,揭示模型依赖知识、公式和模式匹配,缺乏真正物理理解

新智元
算法论文8

AAAI 2026杰出论文奖 | ReconVLA:具身智能研究首次获得AI顶级会议最佳论文奖

具身智能常被视为‘系统工程驱动’研究方向,ReconVLA获AAAI杰出论文奖,是具身智能方向首次获AI顶级会议最佳论文。它解决VLA模型关键瓶颈,通过重建式隐式视觉定位机制,实验效果显著。

机器之心
产品应用8

豆包 Seed 2.0 来了:字节模型跨越鸿沟

春节前字节发布豆包大模型 2.0,其在 Text 领域进入榜单前十,视觉能力全球第四且成本低。它定位多模态 Agent 模型,有多种能力升级,文中用多个案例展示其强大,还强调字节重原生能力非简单蒸馏。

MacTalk
算法论文7

AI能否「圣地巡礼」?多模态大模型全新评估基准VIR-Bench来了

来自日本高校和企业团队提出多模态大模型评估基准 VIR-Bench,用于评测 AI 对旅行视频中地理位置与时间顺序的理解。它将任务拆解,构建数据集,实验显示模型虽有改进但性能远未达标,指明了大模型进化方向。

机器之心
新闻资讯8

【展讯】不止观看:澳门当代摄影展|三影堂北京

本次《不止观看:澳门当代摄影展》汇集孙彦等13位澳门艺术家的创作,他们突破传统影像边界,将澳门多元文化转化为视觉文本。展览作品探讨摄影与城市、文化、技术等关系,呈现从传统到AI的多元脉络。

三影堂摄影艺术中心
新闻资讯8

ImageNet作者苏昊被曝任教复旦

ImageNet作者之一苏昊被曝要去复旦任教。他是具身智能领域论文被引次数最高的华人学者,主导多个奠基级项目。他研究从语言到2D、3D视觉,再到机器人,还创办具身智能公司Hillbot。

量子位
开源动态8

腾讯混元发布并开源图像模型 2.1,支持原生 2K 生图

9月9日深夜,腾讯发布并开源混元生图模型“混元图像2.1”,支持原生2K高清生图,综合能力领先。它在多方面升级,有诸多亮点,评估显示效果优,还同步开源文本改写模型,能满足多样视觉需求。

InfoQ
推荐文章7

“多模态方法无法实现AGI”

文章指出一些人认为多模态方法能实现AGI,但作者觉得此策略会失败。真正的AGI要理解物理世界,而LLMs只是记忆规则。此外,规模最大化方法用于AGI有数据稀缺问题,多模态建模也存在诸多问题。

AI前线
算法论文8

V-RAE:把「看懂视频」的能力带入生成,重新思考视频模型的潜空间

近日,新加坡国立大学 Minghui Guo 与牛津大学 Shengqiong Wu、Hao Fei 在论文中提出视频表征自编码器 V-RAE。它以冻结的视觉基础模型为编码器压缩视频特征,还引入轻量级模块聚合信息。经实验验证,其在视频生成和预测上性能出色。

机器之心
算法论文8

画数独、烧蜡烛都不翻车了?浙大&阿里让AI先三思再下笔|ACL 2026

当下视觉生成中,开源模型在逻辑推理生成任务上频频翻车,与闭源模型有差距。浙大与阿里团队提出Unified Thinker,将思考与执行解耦,构建数据集、采用创新算法,实验显示其有效提升逻辑执行准确度。

量子位