「音视频实时交互模型」共找到 1736 篇相关文章
指导Harness的越多,收益反而越差
Thinking Machines Lab的《Interaction Models》指出,当下产品形态中,指导harness越多收益越差。问题在协作带宽,提出把“会交互”练进模型本体,介绍了从零训练的interaction model及架构,还指出现有交互评测不足。
10 天 3000 元,一人造出全球 AI 爆款!好莱坞导演抢人、游戏版引爆期待,合作细节首次披露
中国 29 岁中专毕业的 AI 视频创作者 Mx - Shell 用 10 天、3000 元成本做出 AI 短片《丧尸清道夫》爆火,海外 CEO 邀合作。其游戏版正制作,Yoroll 创始人谈 AI 视频游戏赛道玩法、商业化及行业变革。
龙虾开始自己拍电影了:我在 LibTV 里看着它从一句话做到成片
作者试用 AI 视频产品 LibTV,仅给 Claude Code 发一句话“「黑神话哪吒」视频制作”,约 10 分钟就得到视频初稿。LibTV 能搭好 0 到 60 的地基,留下可继续创作的画布,成本低还能多尝试,最后仍需人把关。
谢赛宁、李飞飞、LeCun联手提出多模态LLM新范式,「空间超感知」登场
纽约大学助理教授谢赛宁与李飞飞、Yann LeCun 合作提出「Cambrian - S」,迈出视频空间超感知探索第一步。该研究引入 VSI - Super 基准,还提出预测性感知范式,在空间认知任务上有提升,相关论文值得视频多模态研究者参考。
刚刚,好莱坞特效师展示AI生成的中文科幻大片,成本只有330元
AI领域发展迅速,视频生成能力提升。百度全球首发中文音视频一体化模型百度蒸汽机2.0,实现人物口型等毫秒级同步,多版本升级且价格有竞争力。实测效果好,技术上解决难题,还开创应用驱动研发范式。
NeurIPS 2025 | 面向具身场景的生成式渲染器TC-Light来了,代码已开源
TC-Light 是中科院自动化所张兆翔教授团队研发的生成式渲染器,能对长视频序列重渲染,减少 Sim2Real Gap 及实现数据增强。它克服了时序一致性和计算开销挑战,性能优于现有技术,论文与代码已开源。
一个模型统一4D世界生成与重建,港科大One4D框架来了
港科大研究团队提出 One4D 框架,可统一 4D 生成与重建,构造同步输出多模态的视频扩散模型,支持多种任务形态。其有 DLC、UMC 等亮点,用合成与真实数据混合策略训练,实验表现佳。
Sora被拉下神坛:PixVerse这款AI视频工具用最低价拿下全球质量第一
所有人以为Sora是AI视频生成天花板,但现在质量排名第一的是PixVerse,它登顶Product Hunt日榜第一。其质量评分超Sora 168分,价格还低20%,且在多方面升级。大众仍认为Sora最强有认知、品牌、信息等因素。
具身智能体不再失忆!智源新记忆系统让机器人秒变熟人,支持终身记忆
智源研究院等联合提出全新终身记忆系统RoboBrain-Memory,是全球首个为全双工、全模态模型设计的系统。它能解决具身智能体交互问题,实现类人长期个性化交互,在多方面表现优异,有广泛应用前景。
准确率腰斩!大模型视觉能力一出日常生活就「失灵」
EgoCross项目团队聚焦跨域第一视角视频问答评测,揭示现有MLLM在多场景泛化瓶颈。团队提出跨域第一视角视频问答基准EgoCross,经测试揭示模型短板,验证改进方法潜力,研究入选AAAI 2026且数据集等已开源。