视觉叙事」共找到 725 篇相关文章

算法论文8

ACL 2026|Doc-V*:读100页文档不如只翻对5页,80页场景「暴打」RAG 10个点

Doc-V*由小米和华中科技大学团队提出,是多页文档理解新范式,通过交互式视觉推理让模型有策略地读长文档。它在多页文档问答基准上比RAG变体提升49.7%,不依赖大模型或长上下文窗口。

机器之心
产品应用8

全球首个世界统一模型发布,机器人家庭成员来了!

自变量机器人发布全球首个世界统一模型架构的具身智能基础模型WALL - B,它打通视觉、听觉等模块,让机器人理解物理世界。还让机器人拥有多能力,通过真实家庭数据形成数据飞轮,助力其融入家庭。

量子位
算法论文8

告别「想完再做」卡顿!清华StreamingVLA让VLA边想边行动,提速2.4倍

视觉 - 语言 - 动作(VLA)模型“观测 - 生成 - 执行”串行模式致交互卡顿,清华与联想合作提出StreamingVLA框架,引入两项技术实现并行处理,在测试中显著提升效率和流畅度,为VLA模型部署提供新方案。

机器之心
算法论文8

学会“吃一堑长一智",性能飙升11%!XSKILL让AI积累经验和技能

XSKILL框架让AI像人一样积累经验和技能,将任务级技能与动作级经验统一到双流设计中,通过视觉接地提取和检索知识,在多个基准测试中显著提升性能,还展现出跨模型迁移性。

AIGC开放社区
算法论文8

AI看图一本正经胡说八道?「一拉一推」让模型看得全又准|微软x清华

随着视觉 - 语言模型(VLM)推理能力增强,‘看错’问题凸显。现有方法有局限,微软亚洲研究院与清华提出BiPS,从训练阶段重塑模型‘看图方式’,通过‘一拉一推’机制让模型‘看全又准’,实验效果显著。

量子位
开源动态8

昆仑万维多模态视频生成开源,影音图文全统一

昆仑万维开源的SkyReels-V3,通过统一多模态上下文学习框架,实现参考图像生成视频、视频持续扩展及音频驱动虚拟数字人功能,在视觉质量与指令跟随性上逼近闭源顶尖水平,为开源社区提供强大研究基座。

AIGC开放社区
算法论文8

TPAMI | DC-SAM:打破SAM交互限制,基于循环一致性的图像与视频上下文分割方法

北京邮电大学联合南洋理工大学等机构发表论文,提出 DC - SAM 框架及 IC - VOS 基准。DC - SAM 含特征融合、正负双分支循环一致性提示生成等部分,实验在多基准测试获 SOTA 性能,为视觉大模型落地提供方案。

机器之心
产品应用8

拓宽百年奥运「赛场边界」,阿里云AI让人人皆可上场

阿里云作为2026年米兰冬奥会官方云服务合作伙伴,联合发起全球AIGC大赛,用万相大模型生成冬奥视频参赛。万相Wan2.6性能出色,在画质、叙事等方面表现成熟,让普通人也能在奥运体验中当主角。

机器之心
新闻资讯8

谷歌:全栈AI之王

随着Gemini 3模型与第七代TPU的发布,谷歌打破OpenAI与英伟达主导的市场叙事。其全栈AI战略从底层基础设施到用户产品全覆盖,TPU进化、软硬件契合,吸引大客户,C端产品成发展引擎。

新智元
开源动态8

突破具身智能任务规划边界,刷新具身大脑多榜单SOTA,中兴EmbodiedBrain模型让具身大脑学会「复杂规划」

当前主流大语言模型在具身任务场景面临瓶颈,中兴星云大脑团队推出具身视觉 - 语言基础模型 EmbodiedBrain,构建全流程创新框架,在架构、数据训练、评估体系等方面有突破,还将开源成果推动生态发展。

机器之心