视频克隆」共找到 1027 篇相关文章

算法论文8

732M模型超越7B!机器人操控新范式:从视频中「悟」物理

机器人操控有「数据困境」,传统方法需大量人工标注动作演示数据。中山大学王广润教授团队从视频生成模型「借」物理直觉,提出PAR和PhysGen,与英伟达DreamDojo核心思路一致,验证了新的技术路线。

新智元
开源动态8

面向长时语音与声音克隆的全模态开源万能聊天机器人MGM-Omni

文章介绍了全模态开源聊天机器人MGM - Omni,它基于MiniGemini,支持多模态输入输出,具备长语音理解、生成、流式生成、零样本语音克隆等特性,还给出安装、使用方法,展示评估结果。

GitHubStore
算法论文8

小红书RecSys 2025最佳论文提名背后:破解视频时长预测难题

小红书推荐算法团队论文《Multi-Granularity Distribution Modeling for Video Watch Time Prediction via Exponential-Gaussian Mixture Network》在 RecSys 2025 获最佳论文提名。该文剖析视频时长预测难题,提出 EGMN 模型,线下线上验证效果佳。

机器之心
开源动态8

创智刘鹏飞、Sand.ai曹越,两大AI青年学者团队联手,开源音视频基座模型

开源多模态生成领域获架构级底层突破。上海创智学院与 Sand.ai 联合研发的 daVinci - MagiHuman 正式开源,打破开源界音视频联合同步生成三重局限。它采用单流 Transformer 架构,能力强、推理效率高。

机器之心
新闻资讯7

AI狂造人类失踪案,百万网友疯狂上头!爆款视频脑洞太离谱,原地笑疯

最近,网上爆火各种AI炮制的“人类失踪”视频,播放量极高,网友看得上头。这些故事虽假,但悬念迭起引人入胜,不过也引发对虚假内容泛滥、真假难辨的担忧。

新智元
产品应用8

首个实时端侧部署世界模型,20万小时人类视频,BeingBeyond实现「两级跃迁」

4月14日,BeingBeyond发布具身世界模型Being - H0.7,将人类视频规模扩至20万小时,采用隐式推理范式,6项权威评测综合第一。还率先实现端侧实时部署,打通数据闭环,推动模型通用与专家能力跃迁。

AI科技评论
算法论文8

让AI生成视频「又长又快」:Rolling Forcing实现分钟级实时生成

南洋理工大学与腾讯ARC实验室联合研究,由博士生刘坤昊等完成,提出Rolling Forcing方法,通过滚动窗口联合降噪等创新设计,突破实时长视频生成瓶颈,实现分钟级实时生成,还支持交互控制,但仍有优化方向。

机器之心
新闻资讯8

xAI 全员大会实录:递归自我改进、5000 万视频/天、月球上的质量驱动器

本文是 xAI 全员大会实录,覆盖公司核心业务,如重组为四大方向、编程模型递归自我改进、Imagine 视频生成使用量等,还提及 X App 增长、太空愿景等,也指出公司存在高层流失、项目落地不明等问题。

宝玉AI
开源动态8

正式开源!motion-anything:免费版 Figma Motion + 无水印动效视频工坊来了

Open Design团队开源motion-anything,这是一款开源动效引擎,让动效活在真实网页上,可随时编辑。自带庞大动效生态,支持多种触发和动法,有视频工坊且无水印导出,还解决了动效领域四大痛点。

开源星探
产品应用8

阿里 Qwen3-TTS 两大更新直接封神!支持跨物种音色克隆,3 秒复刻!

阿里通义上线 Qwen3-TTS 两大核心能力,VoiceDesign 支持全文本控制音色特征,VoiceClone 能 3 秒音频跨语言、跨物种克隆音色。更新指标亮眼,如 0.1 秒级生成速度等,还可上手体验。

开源星探