「4D视频生成」共找到 3942 篇相关文章
港大联合字节跳动提出JoVA: 一种基于联合自注意力的视频-音频联合生成模型
香港大学联合字节跳动提出视频 - 音频联合生成框架 JoVA,支持音视频 Token 跨模态交互,引入嘴部区域特定损失解决口型同步问题。实验显示,它用约 190 万条数据就达先进水平。
机器人看视频学操作!伯克利首次打通互联网视频到灵巧手真机部署链路
UC Berkeley团队提出端到端流程,跑通从网络视频生成真实灵巧手实机执行轨迹链路。解决了单目RGB视频手-物交互重建、带噪声参考轨迹动作重定向及遥操作规模化难题。还给出数据筛选要点。
ICML25 | 让耳朵「看见」方向!仅依靠360°全景视频,就能生成3D空间音频
空间音频技术成提升沉浸式体验关键,但现有技术未充分利用360°全景视频空间信息。OmniAudio研究可直接从360°视频生成空间音频,相关代码和数据集已开源,虽有局限但前景好。
CVPR2025视频生成统一评估架构,上交x斯坦福联合提出让MLLM像人类一样打分
Video-Bench视频评估框架由上海交通大学、斯坦福大学等团队提出,能让MLLM像人一样评估视频。它构建双维度评估框架,引入链式查询和少样本评分技术,突破现有评估方法限制,更全面智能地评分。
马斯克20亿送Grok 4上火星!20万GPU造宇宙大脑,一句话生成3D黑洞
发布72小时,Grok 4爆红硅谷,2分钟可部署游戏,一句话直出完整动画。xAI成立两周年,马斯克SpaceX将投20亿,或把模型送上火星。Grok 4算力强,多项基准测试刷新SOTA。
一个全新的世界模型,终于让AI视频进入了“无限流”时代。
AI视频公司PixVerse推出实时世界生成模型PixVerse R1,用户可输入Prompt修改视频进程,无干涉时视频会自行延续。该模型为世界模型补上实时视频生成方向,实测体验乐趣十足。
4 天 6.8K Star,这个 AI 漫剧项目火了:waoowaoo!
短剧/漫剧市场火爆,但普通人制作门槛高。waoowaoo是solo开发者作品,4天6.8K Star。它能从小说文本一键生成视频,涵盖AI剧本分析、角色场景生成等功能,部署简单,技术栈主流。
Runway深夜炸场:一口气发布5大更新,首个通用世界模型来了
主攻AI视频与多媒体生成技术的独角兽Runway发布5大更新,包括旗舰视频生成模型Gen - 4.5、首个通用世界模型GWM - 1等,展示了其在通用世界模型上的野心,刷新了视频生成指标。
41个榜单SOTA!智谱最新开源GLM-4.5V实测:看图猜地址、视频秒变代码
智谱基于GLM - 4.5打造的开源多模态视觉推理模型GLM - 4.5V,在42个公开榜单中41项夺得SOTA。其功能丰富,玩法升级,还为企业与开发者提供高性价比方案,是100B参数级SOTA标杆。
通用LLM压缩算法,居然藏视频编码里!2.5bit实现4bit性能,硬件无缝支持
LLM.265研究发现,视频编码器是高效的大模型张量编码器,现成视频编解码硬件压缩AI模型数据效率高。它灵活控制码率、可压缩多种张量,还能利用GPU硬件加速。实验显示其压缩效果显著。