多模态视频推荐」共找到 2088 篇相关文章

算法论文8

视频生成不再「断片」:OneStory给模型装上「选择性记忆」,跨镜头讲故事人物场景始终如一丨CVPR'26

多镜头视频生成挑战大,现有方法有局限。Meta与哥本哈根大学研究者提出OneStory,为多镜头视频生成建立跨镜头记忆机制,可生成连贯长视频,在复杂叙事中保持一致。

量子位
产品应用8

又是中国团队!一条链接出片,电商AI视频迎来「DeepSeek时刻」

电商AI视频此前生成效果不佳,难以用于投放。营赛AI发布的inSai Hilight是“下一代营销视频解决方案”,在权威评测中表现出色,能保证商品和数字人一致性,靠知识图谱等技术实现高质量视频生成。

新智元
算法论文8

UIUC提出隐式监督新范式:无需标注/RM即可全面提升多模态Reasoning的感知能力

大型多模态模型在复杂多模态推理中面临挑战,67%错误源于视觉感知缺陷。为此,UIUC提出PAPO,通过隐式感知损失提升模型感知能力,无需额外标注,在多模态基准上表现优异,还解决了KL黑客问题。

深度学习自然语言处理
产品应用7

图生视频新玩法刷爆外网:图上画两笔就能动起来,终于告别文本提示

Higgsfield AI 是专注 AI 视频生成的初创公司,近期发布 Draw-to-Video 和 Product-to-Video 功能,前者画图形元素就能生成视频,后者可拖拽生成广告视频。它还常上新功能、集成热门模型,官网功能模板丰富。

机器之心
新闻资讯8

定义RAG新基准?谷歌发布 Gemini Embedding 2:首个原生多模态嵌入模型,延迟骤降70%

谷歌昨夜推出首个基于 Gemini 架构的原生多模态嵌入模型 Gemini Embedding 2,通过 Gemini API 和 Vertex AI 向开发者公开预览。它可将多类型数据映射到统一嵌入空间,多项基测排名第一,还获早期合作伙伴高度评价。

InfoQ
产品应用8

AI视频进入蒸汽机时代

百度蒸汽机 2.0 迎来重磅升级,推出行业首个通用 AI 长视频生成功能,突破时长限制,引入交互式需求表达功能。它解决了传统视频生成痛点,在多个维度优化创新,还带来商业应用新可能。

机器之心
推荐文章7

多模态方法无法实现AGI”

文章指出一些人认为多模态方法能实现AGI,但作者觉得此策略会失败。真正的AGI要理解物理世界,而LLMs只是记忆规则。此外,规模最大化方法用于AGI有数据稀缺问题,多模态建模也存在诸多问题。

AI前线
算法论文8

突破多模态奖励瓶颈!中科院清华快手联合提出R1-Reward,用强化学习赋予模型长期推理能力

多模态奖励模型(MRMs)对提升多模态大语言模型表现至关重要,强化学习理论上可引入长期推理能力,但现有RL算法用于训练MRM会不稳定。中科院、清华等团队推出R1 - Reward模型,在多模态奖励模型benchmark上有显著提升。

量子位
算法论文8

告别高昂重制成本!港科大广州、快手可灵发布立体视频转换单步推理新方案

随着 3D 设备发展,人们对 3D 立体视频需求增加,但高昂制作成本成阻碍。快手可灵与港科大广州团队联合提出 StereoPilot 模型,能快速将 2D 视频转为高质量 3D 视频,还构建了 UniStereo 数据集。

机器之心
产品应用7

77万人围观的吉卜力风「游戏」视频,我们用3个国产AI整出来了(含提示词)

Reddit上吉卜力风格游戏视频爆火,a16z合伙人Justine Moore转发获超77万浏览量。文章介绍用国产AI复刻视频的流程,包括用即梦3.0文生图,对比即梦3.0 Pro、可灵2.1大师版、Hailuo 02视频生成效果,还探讨AI对游戏产业的影响。

机器之心