「4D视频生成框架」共找到 3871 篇相关文章
Codex+hyperframe做视频,让剪辑师们慌了?
开源项目Hyperframes刷屏,它是基于HTML的视频渲染框架,不用视频大模型,用普通语言模型就能生成可控视频。它与Remotion有区别,选了对AI友好的路,还介绍了安装、使用方法和适用场景。
全新开源视频换装框架MagicTryOn
现有视频虚拟试穿(VVT)方法在时空一致性和服装内容保留方面有挑战,浙大提出全新开源视频换装框架MagicTryOn,利用全自注意力机制统一时空建模,设计服装保留策略,还引入掩码感知损失。
AI视频生成平台
酷模Cumob AI是基于Next.js构建的AI内容生成平台,集成多AI服务提供商API,有漫画生成等工作流,具备并发处理、资源管理等优化,支持多种部署,有诸多功能特性与亮点。
众所周知视频不能P?北大施柏鑫团队、贝式计算CVPR研究:视频里轻松换衣服、加柯基
视频编辑难度高,传统流程繁琐,现有AI方法有局限。北大施柏鑫团队联合贝式计算等提出VIRES方法,能实现视频主体多种编辑操作,还标注VireSet数据集。其在多指标超现有SOTA模型,团队还探索全景级可控视频生成。
推理速度飙升5倍,苹果提出全新Multi-Token生成框架!
自回归语言模型逐词生成文本拖慢推理速度、限制并行能力。Apple提出全新框架,挖掘其对未来词元“先验知识”,通过多项技术并行预测多词元,微调预训练模型可显著提速且不损输出质量。
视频生成 vs 空间表征,世界模型该走哪条路?
随着生成模型和潜在表征技术发展,业界探讨世界模型技术路线。是像素级视频预测模拟未来场景可靠,还是潜在空间抽象表征高效?Goole DeepMind的Genie 3发布,再次引发讨论,分歧也从理论走向应用。
HeyGen开源HyperFrames框架:Remotion劲敌,用HTML写视频的时代来了
HeyGen开源HyperFrames框架,解决视频制作专业工具学习成本高、简单工具缺灵活性的矛盾。它基于HTML,与Remotion设计哲学不同,渲染快、输出体积轻,有诸多特性和应用场景,安装简单。
SeeDance 2.5:AI 一次能出 30 秒视频,被重新定价的是这几层人
7 月初,字节在火山引擎 FORCE 大会上放出 SeeDance 2.5,它能一次性生成 30 秒完整成片。文章详述其能力,提出视频生成的不可能三角判断框架,还分析它会重新定价产业链上多个环节,改写产出随机性。
刚刚,创智+模思发布开源版Sora2,电影级音视频同步生成,打破闭源技术垄断
今天上午,上海创智学院 OpenMOSS 团队与模思智能发布端到端音视频生成模型 MOVA,它是中国首个高性能开源音视频模型,能实现音画同出,全栈开源打破闭源技术垄断。
PolyVivid实现多主体视频定制,身份一致性超越现有模型
现有视频生成模型在多主体定制中难保持身份一致与自然交互,上交和腾讯提出PolyVivid框架解决此问题。它在多方面优于现有方法,还介绍技术原理、演示效果,证明其在多领域有实用价值。