可交互音视频」共找到 5044 篇相关文章

算法论文8

通向世界模型关键一步:EX-4D来了,实现单目视频到自由视角生成

去年Sora等模型革新视频生成领域,相机控的视频生成技术是构建世界模型核心。但从单视角生成极端视角视频是难题,PICO - MR团队提出EX - 4D,能从单目视频生成新视角视频,多方面表现出色。

机器之心
产品应用8

“参考生”之王回归:Vidu Q3持续进化,剧张力拉满|甲子光年

近期,AI视频公司生数科技的Vidu Q3正式上线参考生视频并全面升级。它能解决视频内容创作痛点,让爆款人设等稳定复现。在榜单上表现出色,经测试在多场景降本增效,提升了视频“剧张力”。

甲子光年
开源动态8

腾讯混元开源游戏AI生成新工具!RTX 4090就能制作3A级动态内容

腾讯开源游戏视频生成框架Hunyuan - GameCraft,基于混元视频生成搭建,操作简单,输入单张场景图、文字描述和动作指令就能生成高清动态游戏视频,解决传统工具瓶颈,性能优于主流模型。

量子位
新闻资讯8

斯坦福教授直播训练535B大模型,模型训练背后的「黑箱」正在被打开?

斯坦福教授Percy Liang宣布由Marin开放实验室启动训练Marin 535B - A23B模型,全程公开。过去大模型训练像“黑箱”,此次尝试让训练观察、讨论、协作,引发网友关注。

机器之心
算法论文7

InfiniteTalk:音频驱动的从口型到全身动作同步方法

近年来视频AIGC推动音频驱动人体动画变革,但传统视频配音局限口部。中国科学院大学提出稀疏帧视频配音范式,推出InfiniteTalk生成器,结合多种技术实现全身动作与音频同步,实验表现突出。

带你学AI
推荐文章8

品味 + 工程思维:AI 时代最难被替代的两件事

AI 时代,最难被替代的是做选择的品味和把结果做稳的工程思维。语法交 AI,但需有工程思维,它能让使用者把 AI 用好,避免错误和复杂度失控。文章介绍了培养工程思维的方法。

宝玉AI
开源动态8

9.8K Star!谷歌开源神器 OSV-Scanner,一条命令扫出所有依赖漏洞!

文章介绍谷歌开源的轻量级命令行工具 OSV - Scanner,它能扫描项目依赖中的已知安全漏洞,连接项目依赖与 OSV.dev 数据库。支持多语言、多包管理器,有多种功能,离线使用,还能提供修复建议和许证扫描。

开源星探
新闻资讯8

Runway深夜炸场:一口气发布5大更新,首个通用世界模型来了

主攻AI视频与多媒体生成技术的独角兽Runway发布5大更新,包括旗舰视频生成模型Gen - 4.5、首个通用世界模型GWM - 1等,展示了其在通用世界模型上的野心,刷新了视频生成指标。

机器之心
算法论文8

CMAME | 香港理工大学周原野、周恺等:面向清晰几何边界工程优化的拉格朗日拓扑物理信息神经网络

近年来物理信息神经网络引入拓扑优化领域,但结果边界弥散。本文提出“拉格朗日拓扑物理信息神经网络”框架,将显式变形基础几何体嵌入微分物理求解器,提升了优化结果的制造性与精度。

力学与人工智能
开源动态8

AutoDev CLI:打造 AI 生成的 AI Agent 质量保障与验证架构

文章介绍AutoDev CLI,它基于AutoDev MPP架构构建,旨在解决上一代AutoDev智能体测试难题。阐述其起步、迭代、演进、集成过程,实现从AI生成代码到验证、生成测试系统的转变,带来验证、演化、移植的优势。

phodal