「多人对话视频生成」共找到 1525 篇相关文章
OmniAvatar震撼开源!阿里夸克开源全新音频驱动角色模型
音频驱动人体动画技术有局限,阿里夸克团队推出OmniAvatar模型。它用逐像素多层次音频嵌入和LoRA训练法,解决唇动同步等问题,适用于多领域,但也存在颜色偏移等不足。
80亿美元押注Agent!全球第一CRM收购Informatica
昨晚,全球第一CRM平台Salesforce宣布以80亿美元全资收购Informatica,增强其数据基础,利于部署AI Agent。Salesforce高管认为二者结合能打造全面数据平台。Salesforce早布局Agent,其自研平台Agentforce应用效果显著。
糟糕,大佬45年前论文,被判AI生成
随着AIGC增多,AI内容检测需求迫切,但表现远不及预期。如作家Adam Kay、教授Devi Sridhar等多人的作品被误判,原因或是AI用人类内容训练,使判断边界模糊。
告别Sora!从巅峰到黯然离场不到一年半,团队将转向物理AI
2026年3月24日,OpenAI宣布关闭视频生成应用Sora。Sora曾惊艳全球,但因合规麻烦、行业阻击、算力成本高、商业回报低等问题走向关停。团队将转向物理AI,聚焦世界模拟研究。
豆包 Seed 2.0 来了:字节模型跨越鸿沟
春节前字节发布豆包大模型 2.0,其在 Text 领域进入榜单前十,视觉能力全球第四且成本低。它定位多模态 Agent 模型,有多种能力升级,文中用多个案例展示其强大,还强调字节重原生能力非简单蒸馏。
六联智能聚力AI谱新篇!
2026年2月1日,六联智能18周年感恩盛典在深圳启幕,展示其从IDH代工转型全栈式AI服务商历程。企业锚定目标,与英特尔协同打造全栈解决方案,还明确战略,各方达成AI产业发展共识。
Sora2“复活”已故名人,家属强烈反对
Sora 2走红后肖像权问题成焦点,有人用其“复活”迈克尔·杰克逊、罗宾·威廉姆斯等已故名人。罗宾女儿等家属强烈不满,OpenAI称公众人物及其家属应控制形象使用,美影协要求其解决侵权问题。
2025 年 InfoQ 趋势报告:AI、ML 和数据工程
InfoQ AI ML 趋势报告基于编辑团队与嘉宾播客,总结 AI、ML 技术发展趋势。涵盖 AI 代理、多模态语言模型等创新领域,也提及早期采用者、早期多数、晚期多数类别的技术,还对 2025 年相关领域发展作出预测。
LeCun团队开源首个代码世界模型:能生成代码还能自测自修!传统编程模型一夜成古典
Meta FAIR推出全球首个代码世界模型CWM,它能生成代码、理解语义,还‘懂得’代码执行,能模拟运行过程。在多个代码与推理任务表现出色,开源代码、训练细节等,不过目前仅支持Python。
餐巾纸上的产品哲学:为什么NoteBookLM是AI圈的一股清流
文章介绍NoteBookLM,其设计师在餐巾纸上画原型。它用三栏结构解决用户痛点,克制不堆砌功能,不胡编乱造回答。其成功源于清醒的产品哲学,做减法创新,有定力拒绝诱惑。