「多视角视频扩散框架」共找到 1329 篇相关文章
登顶全球权威榜单!浙大创业团队百卡打造开源实时世界模型,视频秒变可交互4D世界
全球科技界正豪赌「世界模型」,但主流模型多停留在「视觉生成」。中国影溯公司发布并开源世界模型 InSpatio - World,综合性能优异,以小博大登顶权威榜单,降低了物理世界数字化门槛,引发行业关注。
谷歌年度大招:所有AI模型全升级一遍!Gemini2.5大杯中杯霸榜前二,新版视频/图像模型亮相
谷歌在I/O大会放大招,升级所有AI模型,重做原有产品,推出诸多实验性新产品。如Gemini 2.5系列升级,具备新功能;还有异步代码助手Jules、新搜索模式等,多模态模型也全线升级。
姚班传奇陈立杰入职OpenAI!16岁保送清华,30岁拿下UC伯克利助理教授
最新消息称姚班大神陈立杰加盟OpenAI负责数学推理。他16岁保送清华,30岁成UC伯克利助理教授,长期从事理论计算机科学研究,近期聚焦扩散语言模型。
我们试图解决FOMO焦虑:《中国AI行业系列观察报告》(一)|甲子光年智库
AI发展迅速,新突破、应用和资讯不断涌现,营销话术也加剧人们的不确定感。甲子光年智库推出《中国AI行业系列观察报告》,梳理海量信息,提供冷静务实的第三方视角。
字节开源了一个了不得的模型!
字节跳动开源统一多模态基础模型BAGEL,一个模型能同时理解和生成文本、图像、视频。部署测试有亮点但效果不稳定,还分享该模型体验Demo、地址及安装使用教程。
本周5个yyds的Github开源项目,速速收藏!
文章介绍本周5个Github优质开源项目。有基于云服务的CloudPaste,排版强的Quarkdown,视频下载工具Media Downloader,双语翻译插件FluentRead,还有全能安卓助手LinkAndroid,各有特色功能。
别难为 ChatGPT 了!面对海量资料,NotebookLM + Gemini 的“外挂模式”才是降维打击
Google打通NotebookLM和Gemini后,二者协作效果出色。NotebookLM可拆解复杂信息,Gemini以其为参考数据源答案更精准。二者还能基于笔记本做网站、视频、图片等,各有优势、双向协作。
DiT突遭怒喷,谢赛宁淡定回应
扩散模型核心基石DiT遭网友质疑,称其数学和形式有误,甚至怀疑无Transformer。作者谢赛宁回应抨击标题党,强调科学精神与实证方法,还肯定Tread,推荐Lightning DiT版。
GAIR Paper 106|追踪视觉 Token 的演化轨迹,实现无损压缩与 60% 推理加速|CVPR 2026
近年来大视觉语言模型虽推动多模态智能发展,但推理成本高昂。山东大学和MBZUAI团队提出TransPrune,从演化视角衡量视觉Token重要性,保持性能无损同时降低60%推理成本。
π0引用的中国团队,又出手了:世界仿真器新作发布
Current Robotics团队发布交互式世界仿真器CurrentWorld - 0,创始人祝毅晨履历亮眼。该仿真器能跨本体、多视角、力 - 触觉预测,可用于评测机器人,还能让人类接管以探索不同动作结果。