多模态生成模型」共找到 8795 篇相关文章

算法论文8

高潮从第几秒开始?GaMMA 让多模态模型真正「听懂」音乐时间线

现有多模态模型难以理解音乐时间线。复旦大学与字节跳动团队提出 GaMMA,采用双编码器融合网络,经三阶段训练,还推出 MusicBench 评测基准。实验显示,GaMMA 在多基准上表现优异,刷新 SOTA。

机器之心
算法论文8

ICLR 2026 | CineTrans: 首个转场可控的多镜头视频生成模型,打破闭源技术壁垒

随着视频生成模型发展,影视级长视频需多镜头序列及自然转场,这成新挑战。上海人工智能实验室团队提出 CineTrans 模型,基于掩码机制实现自动化转场,还构建 Cine250K 数据集,实验效果超基线。

机器之心
算法论文8

数据邪修大法好:仅用文本数据就能预训练多模态模型

多模态模型研发中,行业认为无图文对就无多模态能力。但ReVision研究表明,预训练阶段昂贵配对关系非必需,利用非配对数据统计信息修正文本表征,能实现跨模态互换,降低成本。

量子位
开源动态8

首个多模态工业信号基座模型FISHER,权重已开源,来自清华&上交等

清华、上交等团队联合发布首个多模态工业信号基座模型 FISHER,用搭积木法对异质工业信号统一建模。技术报告和权重已开源,还提出 RMIS 基准评估性能,实验显示其泛化能力强。

机器之心
开源动态8

国产王炸!上海AI Lab开源Lumina-DiMOO,开创多模态理解与生成新范式

上海人工智能实验室等多机构推出多模态生成与理解统一模型Lumina - DiMOO,采用全离散扩散架构。它解决传统多模态架构问题,有全离散扩散建模等四大创新,性能在多基准测试中领先,应用前景广。

AIGC开放社区
产品应用7

6个Agent组团Vibe Gaming:自己生成、试玩、修Bug

过去大模型生成的游戏虽代码能跑,但常陷入“可玩性黑洞”。Spellcaster让多个专用Agent协同处理,形成“生成—运行—检查—修复”循环。目前能快速生成多种游戏原型,未来将用世界模型直接生成画面。

量子位
算法论文8

V-RAE:把「看懂视频」的能力带入生成,重新思考视频模型的潜空间

近日,新加坡国立大学 Minghui Guo 与牛津大学 Shengqiong Wu、Hao Fei 在论文中提出视频表征自编码器 V-RAE。它以冻结的视觉基础模型为编码器压缩视频特征,还引入轻量级模块聚合信息。经实验验证,其在视频生成和预测上性能出色。

机器之心
开源动态8

如何选择最佳多模态模型压缩方案?哈工大、度小满开源EFFIVLM-BENCH基准测试框架

金融科技智能化转型中,LVLM部署受算力瓶颈制约。哈工大与度小满联合开源EFFIVLM - BENCH基准测试框架,能为多模态模型压缩方案出具‘体检报告’,还揭示LVLM加速复杂性,推动技术发展。

机器之心
算法论文8

视频扩散模型新突破!清华腾讯联合实现高保真3D生成,告别多视图依赖

清华大学联合腾讯提出Scene Splatter,基于视频扩散模型,从动量视角引导其生成满足三维一致性的视频片段,提升三维场景生成效果,解决了传统方法在单张图片重建三维场景的难题。

量子位
产品应用8

业界首个高质量原生3D组件生成模型来了!来自腾讯混元团队

腾讯混元3D团队推出业界首个高质量原生3D组件生成模型Hunyuan3D - Part。现有3D生成算法有局限,该模型提出新范式,含P3 - SAM和X - Part,在多数据集评估中超越现有工作,还给出体验地址和论文地址。

量子位