「多人对话视频生成」共找到 1525 篇相关文章
对话 Elys 创始人:他的 10 个产品洞察,和他想创造的下一代社交网络
极客公园与 Elys 创始人 Tristan 深度对话,分享 10 个产品洞察。他认为 context 价值大,做新 AI 产品要找好形态,记忆系统本质是推荐系统,还阐述了对 AI 社交等看法,目标是创造低熵社交网络。
【独家】对话汤元科技任冬淳:物理AI的瓶颈,在于训练体系|甲子光年
对话汤元科技任冬淳,探讨物理AI瓶颈。他认为物理AI瓶颈在训练体系,要满足数据结构质量、训练验证闭环、数据规模效率三要求。汤元构建训练底座,为具身智能和智驾提供服务,具身智能是未来重心。
1.9K Star 微软开源TTS王炸!90分钟超长语音合成,4人对话自然切换!
在文本转语音(TTS)领域,生成长篇、多说话人的高质量音频一直是技术挑战。微软最新开源的VibeVoice TTS模型,可一次生成90分钟连续语音,支持4个不同说话人,还具备高效处理长序列等亮点特性。
独家对话希捷科技Jason Feist:AI时代,企业正在“删除删除键”|甲子光年
本文是「甲子光年」对希捷科技云存储业务高级副总裁杰森·费斯特的独家对话。费斯特指出,AI 基础设施正从计算、内存转向存储,企业倾向长期保存数据,高容量硬盘重要性凸显。他还探讨了存储系统变化、技术创新等问题。
ICCV 2025 | 小红书AIGC团队提出图像和视频换脸新算法DynamicFace
小红书AIGC团队提出图像和视频换脸新算法DynamicFace。该算法创新性融合扩散模型与3D人脸先验,解耦身份与运动信息,设计双流注入架构和时序一致性模块,实验证明其在身份保真与运动还原上优势明显。
大事不好!机器人学会预测未来了
蚂蚁灵波连续四天开源,此次推出全球首个用于通用机器人控制的因果视频 - 动作世界模型LingBot - VA。它能脑补未来,有记忆不丢失、高效泛化等亮点,架构设计独特,实验效果出色,推动通用机器人走向视频时代。
豆包19亿次互动背后的技术真相:春晚级体验是如何炼成的?
2026 年春晚 AI 元素亮眼,豆包 AI 互动达 19 亿次。火山引擎作为独家 AI 云合作伙伴,用智能视频云等技术打造节目效果,解决视频画质、空间逻辑、机器人互动延迟等难题,还保障全民互动和实时字幕。
Gemini 3 Pro加持!这款开源神器 Clipsketch AI,帮你自动抓帧、画图、写爆文!
自媒体内卷,‘视频转图文’是流量入口,简单截图难满足需求。clipsketch - ai 开源项目用 Gemini 3 Pro 和 Nano Banana Pro 模型,实现视频理解、AI 绘画和写作自动化,解决创作者素材整理、版权等痛点。
上线一年用户破百万,这个AI健康管理产品只靠一只海獭? | 对话OtterLife
AI健康管理产品众多,多数陷入同质化或功能堆砌困局。OtterLife将虚拟海獭融入健康习惯养成,上线一年用户破百万。量子位智库对话其负责人相城,探讨产品特色、市场、设计等多方面问题。
深度解析世界模型:新范式的路线之争,实时交互与物理仿真
文章认为2026年多模态技术将有大发展,世界模型轮廓渐清。文中对比语言、视频生成模型,指出世界模型优势,分析实时视频与3D结构化两条路线,介绍不同公司产品并以四象限框架分类。