多粒度理解」共找到 4690 篇相关文章

算法论文8

视频世界模型跑长序列不「崩」了!用光流约束+历史记忆+步训练,让动态场景稳如磐石

现有视频世界模型在长时间交互中易出现运动不合理与场景崩坏问题,核心原因是误差累积。MagicWorld提出面向长时稳定性的交互式建模框架,通过光流约束、历史缓存检索和步聚合训练,有效缓解误差累积。

量子位
开源动态8

银河通用X清华大学发布业内首款开源人形机器人全身遥操系统OpenWBT,支持机型、跨虚实,小时内可轻松部署

银河通用与清华大学合作发布全开源人形机器人全身遥操作系统OpenWBT,新手小时内可部署。该系统有极简部署、机型跨平台、兼顾虚实遥操三大亮点,背后技术解决了sim2real迁移难题。

机器之心
新闻资讯7

Meta发布40页报告,具身智能的下一步是「心智世界模型」:能听,能看,能理解,会共情

Meta发布40页报告,首次将对人心智状态的推断概念化为心智世界模型,与物理世界模型实现“双轨建模”。还指出要结合系统A和B让AI自主学习,心智世界模型在智能体协作潜力大。

量子位
算法论文8

3D重建的惊人进展:所世界名校联合发布论文,告诉你AI在3D世界的研究现状

所世界名校联合发布调查研究论文,回顾用于3D重建和视图合成的前馈技术并分类,研究关键任务及应用。前馈模型打破每场景优化魔咒,带来速度和泛化能力的提升,解锁新应用,但也面临挑战。

AIGC开放社区
开源动态8

【GitHub 10.9k star】DeepCode:把论文和需求文档“一键变代码”的智能体开发神器,真能干掉手写样板?

DeepCode 是香港大学开源的智能体开发平台,支持将论文、需求文档等转化为生产级代码。它能解决论文复现、原型开发等痛点,有项特色功能,在性能对比中领先,适用于类场景。

小华同学ai
产品应用8

Nature报道:谷歌新模型1秒读懂DNA变异!首次统一基因组全任务,性能碾压现有模型

谷歌DeepMind团队推出生物模型AlphaGenome,能从1兆碱基DNA序列中预测数千种功能基因组特征,评估变异效应。它统一任务,性能超现有模型,是生物领域里程碑,将助力理解疾病。

量子位
新闻资讯8

振臂一挥,大半个具身机器人圈都来了!智源研究院:别藏了,谁贡献数据,谁的大脑就更好用

2025智源具身智能Open Day上,智源研究院院长邀厂商共享数据,称谁家贡献,具身大脑在其机器人上更好用。智源无商业包袱,开源数据、统一评测,布局具身大小脑体系,欲做具身智能“安卓”。

量子位
开源动态8

图像、视频一模搞定!字节全能原生模态本地可部署

字节开源原生模态模型Lance,仅3B激活参数,40G显存就能跑,已登顶huggingface趋势榜。它能进行图像与视频的理解、生成、编辑等操作,在个基准测试中表现优异,项性能居首。

AIGC开放社区
算法论文8

高潮从第几秒开始?GaMMA 让模态大模型真正「听懂」音乐时间线

现有模态大模型难以理解音乐时间线。复旦大学与字节跳动团队提出 GaMMA,采用双编码器融合网络,经三阶段训练,还推出 MusicBench 评测基准。实验显示,GaMMA 在基准上表现优异,刷新 SOTA。

机器之心
产品应用7

AI版Chrome终于来了

Google正式推出Gemini in Chrome功能,将Gemini整合进Chrome浏览器。Chrome从‘内容展示器’变为‘内容理解器’,有标签页处理等功能,提升效率,还推动浏览器形态演进,未来或能替用户操作。

newtype AI