多视角视频扩散框架」共找到 1329 篇相关文章

新闻资讯7

突发,美商务部叫停「AI扩散规则」藏杀机!英伟达市值再破3万亿

13日晚美商务部撤销《AI扩散规则》,该规则曾遭科技巨头和盟友反对。同时出台加强半导体出口管制新措施,精准打击中国AI发展。而英伟达因规则废止受益,市值再破3万亿。

新智元
产品应用8

比「小龙虾」更能打,中国AI视频大模型悄悄登顶全球第一

昆仑万维旗下 SkyReels-V4 Preview 版在权威评测平台超越 OpenAI、Google 等模型,登顶全球第一。它提升语义理解和逻辑能力,新增参考任务,还支持多语言短剧生成、视频编辑等,将在中关村论坛亮相。

机器之心
算法论文8

其实,扩散语言模型在最终解码之前很久,就已确定最终答案

随着扩散语言模型(DLM)发展,它成自回归(AR)模型有力替代。但实际推理慢于 AR 模型。研究者发现早期答案收敛现象,提出 Prophet 策略,实验显示其能在保持高质量生成时显著加速推理。

机器之心
算法论文8

dLLM的「Free Lunch」!浙大&蚂蚁利用中间结果显著提升扩散语言模型

近年来,扩散大语言模型(dLLM)成为文本生成新势力,生成效率高。但现有解码策略忽视中间迭代信息,研究团队观察到「先对后错」现象,提出 TCV 和 TCR 方法,显著提升模型在推理任务表现。

机器之心
推荐文章7

不是视频模型“学习”慢,而是LLM走捷径|18万引大牛Sergey Levine

UC伯克利大学副教授Sergey Levine提出,为何语言模型从预测下一词中学到很多,视频模型从预测下一帧却学得少。他指出LLM可“抄近路”模仿人类推理,像在“柏拉图洞穴”中,还探讨了AI走出困境的方法。

量子位
产品应用7

全球首个跨本体、跨视角、多模态物理世界模型,CurrentWorld-0 来了!

Current Robotics 发布跨本体、多模态物理世界模型 CurrentWorld-0,它从真实数据学规律,整合跨本体、多视角和力触预测,可评测机器人,解决动作可控性等问题,让评测成训练数据入口。

机器之心
算法论文8

732M模型超越7B!机器人操控新范式:从视频中「悟」物理

机器人操控有「数据困境」,传统方法需大量人工标注动作演示数据。中山大学王广润教授团队从视频生成模型「借」物理直觉,提出PAR和PhysGen,与英伟达DreamDojo核心思路一致,验证了新的技术路线。

新智元
算法论文8

一键开关灯!谷歌用扩散模型,将电影级光影控制玩到极致

Google推出LightLab项目,可从单张图像精准控制光影,解决传统光影控制难题。其通过特殊数据集微调扩散模型,让模型学会控制光照,还介绍了方法、后处理流程等,实验显示表现优,有多种应用。

机器之心
算法论文8

小红书RecSys 2025最佳论文提名背后:破解视频时长预测难题

小红书推荐算法团队论文《Multi-Granularity Distribution Modeling for Video Watch Time Prediction via Exponential-Gaussian Mixture Network》在 RecSys 2025 获最佳论文提名。该文剖析视频时长预测难题,提出 EGMN 模型,线下线上验证效果佳。

机器之心
开源动态8

创智刘鹏飞、Sand.ai曹越,两大AI青年学者团队联手,开源音视频基座模型

开源多模态生成领域获架构级底层突破。上海创智学院与 Sand.ai 联合研发的 daVinci - MagiHuman 正式开源,打破开源界音视频联合同步生成三重局限。它采用单流 Transformer 架构,能力强、推理效率高。

机器之心