「图像与视频合成」共找到 1503 篇相关文章
机器人看视频学操作!伯克利首次打通互联网视频到灵巧手真机部署链路
UC Berkeley团队提出端到端流程,跑通从网络视频生成真实灵巧手实机执行轨迹链路。解决了单目RGB视频手-物交互重建、带噪声参考轨迹动作重定向及遥操作规模化难题。还给出数据筛选要点。
EasyCache:无需训练的视频扩散模型推理加速——极简高效的视频生成提速方案
近年来,扩散模型在视频生成领域广泛应用,但推理慢、算力消耗高问题突出。EasyCache是无需训练的视频扩散模型推理加速方案,在多模型实验中实现大幅提速且视频质量几乎无损,为技术落地提供基础。
图像分层生成:新加坡国立大学和Lowart AI实现了图像可编辑的PSD文件输出
新加坡国立大学和Lowart AI发布OmniPSD,利用Diffusion Transformer架构解决分层图像生成与拆解难题,实现可编辑PSD文件输出。它能通过文本生成分层PSD文件,也能拆解单张平面图像,解决AI生成图像难编辑痛点。
断层碾压Seedance 2.0:神秘「欢乐马」空降榜首,视频AI变天了
周二晚间,代号「HappyHorse - 1.0」的神秘视频生成模型在 Artificial Analysis 平台空降榜首,不论文字生视频还是图像生视频都排第一,拉开 Seedance 2.0 很大差距,不过在「视频 + 音频」综合排名上屈居第二,引发诸多猜测。
物理引擎 + 视频生成!输入一张图,让AI演给你看真实物理世界
WonderPlay将物理仿真与视频生成结合,从单张图像生成动态3D场景。它引入混合生成模拟器,形成物理求解器与视频生成器闭环。与其他方法对比,WonderPlay在多种场景和材质下表现更优。
用“蒸汽机”生成视频,还能音视频一体化交付?
8月21日百度营销发布百度蒸汽机2.0,含多版本,有声版可音视频一体化交付。经测试,其生成视频细节佳、运动规律合理。它能解决影视业诸多痛点,成本低,还可免费使用。
人跑光了,AI视频炸了!马斯克狂发推:Grok Imagine三金封神
xAI的Grok Imagine在DesignArena视频排行榜上,拿下视频竞技场、图像转视频和视频编辑三项第一,远超谷歌Veo 3.1、Sora等对手。它进步迅猛,靠聪明设计取胜,还将推动AI从“蛮力计算”向“智能理解”转变。
开源 AI 视频平台
开源 AI 视频平台集成剪辑生成器、AI 短视频、YouTube 工作室三大工具,能将长视频转短视频,为业务生成营销视频,还具备免费 YouTube 工具包。支持多平台发布,自托管永久免费。
打破具身世界模型可执行性鸿沟 !港中深-跨维智能团队提出EVA框架,用强化学习让视频世界模型真正“动”起来
近期,利用视频生成模型为机器人构建“世界模型”成热门路线,但存在“可执行性鸿沟”。港中深 - 跨维智能团队提出 EVA 框架,用强化学习优化视频生成,实验显示其能提升视觉规划、仿真任务成功率及真实部署稳定性,还有数据合成潜力。
CVPR 2025 | SketchVideo让手绘动起来,视频生成进入线稿时代
中国科学院大学等团队提出基于线稿的可控视频生成和编辑方法SketchVideo,发表于CVPR 2025。它基于预训练模型添加线稿控制网络,解决现有视频生成模型可控性等问题,实现高质量视频生成与编辑。