多角色对话视频生成」共找到 1701 篇相关文章

算法论文8

Light-X来了!全球首个「镜头×光照」双控4D视频生成框架,单目视频秒变电影级

新加坡南洋理工大学等科研机构联合推出Light - X,全球首个「镜头×光照」双控4D视频生成框架。它解耦相机与光照,在扩散模型中融合,还构建Light - Syn数据管线,实验显示其效果显著优于现有方法。

机器之心
产品应用8

99%的AI产品都没有真正的护城河,初创产品需要做好「细分场景+生态协同」 | 对话AI播客工具Podwise

量子位智库对话Podwise创始团队,探讨AI播客工具发展。团队分享Podwise目标用户、场景、优势,如转录准、能识别声纹等。还谈及产品开发、付费、用户增长等策略,强调做好细分场景与生态协同。

量子位
算法论文8

视频世界模型跑长序列不「崩」了!用光流约束+历史记忆+多步训练,让动态场景稳如磐石

现有视频世界模型在长时间交互中易出现运动不合理与场景崩坏问题,核心原因是误差累积。MagicWorld提出面向长时稳定性的交互式建模框架,通过光流约束、历史缓存检索和多步聚合训练,有效缓解误差累积。

量子位
算法论文8

训练数据爆减至1/1200!清华&生数发布国产视频具身基座模型,高效泛化复杂物理操作达SOTA水平

清华大学与生数科技联合研发Vidar模型,首次让通用视频大模型长出‘手脚’,实现从虚拟到真实世界物理执行的跨越。它降低数据门槛,突破跨本体泛化困境,为服务机器人应用奠定基础。

量子位
新闻资讯8

AMD 苏妈对话李开复:AI 转型只能由 CEO 驱动、未来“DRI”(直接负责人)将是企业核心|直击现场

2026 AMD AI 开发者日上海站,AMD 苏姿丰阐述 AI 愿景及中国战略。她与李开复对话,李开复认为 AI 跨越编程临界点,多智能体架构是突破,AI 转型需 CEO 驱动,未来 DRI 将成企业核心。

InfoQ
算法论文8

AI生成视频总不符合物理规律?匹兹堡大学团队新作PhyT2V:不重训练模型也能让物理真实度狂飙2.3倍!

匹兹堡大学团队提出 PhyT2V 框架,论文已被 CVPR 2025 接收。该框架不依赖重训练或大量外部数据,通过链式推理与迭代修正机制,增强主流 T2V 模型物理场景泛化与生成能力,应用前景广。

机器之心
开源动态8

微软又上大分!刚刚开源一款 0.5B 轻量级实时 TTS 模型,还能边想边说!

2025 年大家致力于解决 AI「嘴巴」问题,追求实时流式对话。微软刚开源轻量级 TTS 模型 VibeVoice-Realtime - 0.5B,参数虽小但能边输入边朗读,有诸多特点和广泛应用场景。

开源星探
新闻资讯7

腾讯回应 OpenClaw 之父 Peter 的“抄袭”指责;突发!字节AI视频模型Seedance 2.0发布紧急叫停;Mac mini因“养虾热”断货 | Q资讯

本周AI圈热点不断:腾讯回应OpenClaw之父“抄袭”指责;字节AI视频模型Seedance 2.0发布叫停;Meta或裁员20%;美团王兴谈海外战略与AI冲击;“养虾热”致Mac mini断货;DeepSeek V4和腾讯新混元模型4月将发布。

InfoQ
新闻资讯7

华纳兄弟起诉Midjourney

Theverge消息,华纳兄弟起诉文生图平台Midjourney,称其AI工具生成大量侵犯版权的角色图像和视频,如蝙蝠侠、超人等。诉状列举侵权行为,提供对比案例,华纳希望获禁令并索赔。

AIGC开放社区
8

光年之外居然做了能用Skills的AI浏览器:超实用实用案例+现成脚本

光年之外团队推出 Tabbit 浏览器,填补国内空白,有对话、妙招等 5 大核心功能。文章用5个案例展示其便捷性,如一键成稿、旅行规划等,还能解决收藏难题、增强网页功能,适配国内网站。

歸藏的AI工具箱