全景视觉」共找到 711 篇相关文章

新闻资讯8

协和4+4的另一面:浙江范式用AI定义医疗未来!AI「智愈」时代来临

一场关于协和“4+4”的热议引发医疗未来之问,浙江从医院、企业、政府三重维度,以浙大二院、德适生物、安诊儿等为例,展示AI在医疗领域的应用,构建未来医疗图景,推动医疗从“治病”走向“智愈”。

新智元
算法论文8

夜间感知新突破!北航等提出红外主导的高效目标检测方案 | ECCV'26

在复杂视觉场景中,传统RGB - IR多模态检测方法在低照度等场景下因RGB退化影响检测效果。北航等团队提出的InfraNet,以红外为主,用质量感知机制控制RGB引导,在多数据集取得强竞争力结果。

新智元
算法论文8

从“一句成片”到“长轨推演”:探究多模态智能体在长视频编辑中的应用

近年来大语言模型在长篇视觉叙事中潜力卓越,但长视频剪辑仍难控制。中科大等团队开源工作从系统工程视角研究多模态智能体在长视频编辑中的机制,重构剪辑管线,找到症结并给出解决办法。

量子位
开源动态8

手机跑多模态也能快到飞起!面壁MiniCPM-V 4.6开源

面壁智能开源多模态模型MiniCPM-V 4.6,以低算力成本、超低首Token延迟打通三大主流手机操作系统。它算力瘦身性能强,是视觉语言多面手,还适配主流系统,降本增效,让AI能力从云端到指尖。

AIGC开放社区
算法论文8

ACL 2026|Doc-V*:读100页文档不如只翻对5页,80页场景「暴打」RAG 10个点

Doc-V*由小米和华中科技大学团队提出,是多页文档理解新范式,通过交互式视觉推理让模型有策略地读长文档。它在多页文档问答基准上比RAG变体提升49.7%,不依赖大模型或长上下文窗口。

机器之心
产品应用8

全球首个世界统一模型发布,机器人家庭成员来了!

自变量机器人发布全球首个世界统一模型架构的具身智能基础模型WALL - B,它打通视觉、听觉等模块,让机器人理解物理世界。还让机器人拥有多能力,通过真实家庭数据形成数据飞轮,助力其融入家庭。

量子位
算法论文8

告别「想完再做」卡顿!清华StreamingVLA让VLA边想边行动,提速2.4倍

视觉 - 语言 - 动作(VLA)模型“观测 - 生成 - 执行”串行模式致交互卡顿,清华与联想合作提出StreamingVLA框架,引入两项技术实现并行处理,在测试中显著提升效率和流畅度,为VLA模型部署提供新方案。

机器之心
算法论文8

学会“吃一堑长一智",性能飙升11%!XSKILL让AI积累经验和技能

XSKILL框架让AI像人一样积累经验和技能,将任务级技能与动作级经验统一到双流设计中,通过视觉接地提取和检索知识,在多个基准测试中显著提升性能,还展现出跨模型迁移性。

AIGC开放社区
算法论文8

AI看图一本正经胡说八道?「一拉一推」让模型看得全又准|微软x清华

随着视觉 - 语言模型(VLM)推理能力增强,‘看错’问题凸显。现有方法有局限,微软亚洲研究院与清华提出BiPS,从训练阶段重塑模型‘看图方式’,通过‘一拉一推’机制让模型‘看全又准’,实验效果显著。

量子位
开源动态8

昆仑万维多模态视频生成开源,影音图文全统一

昆仑万维开源的SkyReels-V3,通过统一多模态上下文学习框架,实现参考图像生成视频、视频持续扩展及音频驱动虚拟数字人功能,在视觉质量与指令跟随性上逼近闭源顶尖水平,为开源社区提供强大研究基座。

AIGC开放社区