多模态扩散Transformer」共找到 1349 篇相关文章

开源动态8

最强开源VLM“华山论剑”丨多模态专场直播

近期Intern - S1等多模态大模型开源,引发热烈讨论。本周四OpenMMLab等发起AI Insight多模态专场,邀请模型核心研发者分享,涵盖模型设计思路、实践经验等,还有圆桌对谈。

OpenMMLab
开源动态8

商汤SenseNova U1深度拆解,原生统一架构终结缝合时代

文章深度拆解商汤科技开源的新一代模型「日日新 SenseNova U1」,介绍其基于 NEO - Unify 原生统一架构,在数据、训练与推理深度协同,多维度测试成绩亮眼,代表多模态从拼接走向原生建模新方向。

机器之心
算法论文8

刚刚,何恺明团队新作,「嵌入式语言流」ELF来了

何恺明团队提出ELF模型,将扩散过程置于连续向量空间,只在最后翻译成词。它用一个网络实现去噪和解码,引入自条件机制。实验显示,ELF用不到其他方法十分之一数据,生成质量全面领先。

机器之心
推荐文章8

商汤林达华万字长文回答AGI:4层破壁,3大挑战

在WAIC 2025上,商汤发布国内首个实现“图文交错思维”的商业级大模型日日新6.5。商汤科技联合创始人林达华发文,剖析多模态通用智能实践,解答AI领域关键问题,提供通往AGI的参考。

量子位
算法论文7

HOIDiNi:一句话驱动虚拟人高精度操作物体

特拉维夫大学提出HOIDiNi,这是文本驱动的扩散框架,用于生成人体 - 物体交互动作。它引入扩散噪声优化,能兼顾真实感与物理正确性。不过它泛化能力待拓展、生成速度慢,未来需提升效率等。

带你学AI
算法论文8

Communications Engineering | 西湖大学&女王大学:面向阵风气动建模的表面压力时空动力学关联研究

西湖大学联合女王大学团队提出 Graph Transformer 框架用于阵风气动建模,融合图神经网络与注意力机制,从表面压力信号学时空关联,实现气动力准确预测,为AI在复杂气动建模提供新思路。

力学与人工智能
推荐文章7

统一框架下的具身多模态推理:自变量机器人让AI放下海德格尔的锤子

当前先进机器人无法像人类自如用工具,现有多模态系统有局限。自变量机器人提出端到端统一架构,以统一表示学习和多任务多模态生成解锁具身多模态推理能力,实现范式转换。

机器之心
新闻资讯7

独家|前DeepSeek核心研究员魏浩然出任百度文心多模态算法负责人

9月3日消息,原DeepSeek核心研究员魏浩然带队转入百度,任文心大模型多模态算法负责人。此前他在多模态与端到端OCR底层重构有突出成绩,这是百度布局青年顶尖研发人才的又一动作。

AI前线
算法论文8

OpenVision 2:大道至简的生成式预训练视觉编码器

多模态大模型浪潮中,视觉模块是关键。此前OpenVision训练管线复杂,成本高。研究者提出OpenVision 2,移除文本编码器与对比学习,引入随机丢弃视觉token技巧,性能佳且效率高,挑战了对比学习范式。

机器之心
推荐文章7

【综述】MRAG5项关键技术(一):解析、索引

文章围绕多模态检索增强生成(MRAG)的关键技术展开。介绍多模态文档的三种类型,阐述文档解析与索引的方法,包括基于提取和基于表示的方法,还指出基于提取方法存在的局限性。

CourseAI