纯视觉路线」共找到 1059 篇相关文章

算法论文8

ACL 2026|Doc-V*:读100页文档不如只翻对5页,80页场景「暴打」RAG 10个点

Doc-V*由小米和华中科技大学团队提出,是多页文档理解新范式,通过交互式视觉推理让模型有策略地读长文档。它在多页文档问答基准上比RAG变体提升49.7%,不依赖大模型或长上下文窗口。

机器之心
产品应用8

全球首个世界统一模型发布,机器人家庭成员来了!

自变量机器人发布全球首个世界统一模型架构的具身智能基础模型WALL - B,它打通视觉、听觉等模块,让机器人理解物理世界。还让机器人拥有多能力,通过真实家庭数据形成数据飞轮,助力其融入家庭。

量子位
算法论文8

告别「想完再做」卡顿!清华StreamingVLA让VLA边想边行动,提速2.4倍

视觉 - 语言 - 动作(VLA)模型“观测 - 生成 - 执行”串行模式致交互卡顿,清华与联想合作提出StreamingVLA框架,引入两项技术实现并行处理,在测试中显著提升效率和流畅度,为VLA模型部署提供新方案。

机器之心
新闻资讯8

Generalist最新长文定调:具身原生才是正道,中国玩家原力灵机已交卷

Generalist创始人Pete Florence团队释出GEN-1技术博客,否定世界模型与VLA之争,强调具身智能应回归目标,主张从零训练。中国原力灵机DM0也采用具身原生路线,在RoboChallenge评测中成绩优异。

量子位
算法论文8

学会“吃一堑长一智",性能飙升11%!XSKILL让AI积累经验和技能

XSKILL框架让AI像人一样积累经验和技能,将任务级技能与动作级经验统一到双流设计中,通过视觉接地提取和检索知识,在多个基准测试中显著提升性能,还展现出跨模型迁移性。

AIGC开放社区
新闻资讯7

成本下降 90%后,Figure 的下一步是机器人「自己造自己」?

近期,海外人形机器人公司 Figure 首席执行官 Brett Adcock 接受访谈,围绕「Figure 的核心技术与产品迭代」,就全栈端到端神经网络架构、数据壁垒与垂直整合等核心议题,阐述其通用人形机器人技术路线、产业逻辑与商业化实践。

机器之心
算法论文8

AI看图一本正经胡说八道?「一拉一推」让模型看得全又准|微软x清华

随着视觉 - 语言模型(VLM)推理能力增强,‘看错’问题凸显。现有方法有局限,微软亚洲研究院与清华提出BiPS,从训练阶段重塑模型‘看图方式’,通过‘一拉一推’机制让模型‘看全又准’,实验效果显著。

量子位
开源动态8

昆仑万维多模态视频生成开源,影音图文全统一

昆仑万维开源的SkyReels-V3,通过统一多模态上下文学习框架,实现参考图像生成视频、视频持续扩展及音频驱动虚拟数字人功能,在视觉质量与指令跟随性上逼近闭源顶尖水平,为开源社区提供强大研究基座。

AIGC开放社区
算法论文8

TPAMI | DC-SAM:打破SAM交互限制,基于循环一致性的图像与视频上下文分割方法

北京邮电大学联合南洋理工大学等机构发表论文,提出 DC - SAM 框架及 IC - VOS 基准。DC - SAM 含特征融合、正负双分支循环一致性提示生成等部分,实验在多基准测试获 SOTA 性能,为视觉大模型落地提供方案。

机器之心
推荐文章7

Agent时代,为什么多模态数据湖是必选项?

AI时代,数智化底层是基建深耕。企业要构建多模态数据湖,因其能处理多模态数据,唤醒沉睡数据,驱动业务,还提供工程确定性。火山引擎给出升级路线及选型指南,其多模态数据湖已在多行业落地。

机器之心