模态鸿沟」共找到 251 篇相关文章

开源动态8

打破数据质量鸿沟!清华腾讯Bee项目发布1500万高质量数据集,刷新MLLM全栈开源SOTA

全开源多模态大模型性能被闭源和半开源模型“卡脖子”,根源在于数据质量。清华与腾讯混元团队推出Bee项目,有三大核心贡献,产出的Bee - 8B模型表现领先,证明保证数据质量比堆量更有效。

量子位
产品应用8

创业一年后,李飞飞推出首款可商用世界模型 Marble,任意模态都可生成 3D 世界

李飞飞创业公司 World Labs 推出可商用世界模型 Marble,支持多模态输入,生成的 3D 世界更丰富细致。李飞飞认为空间智能是 AI 下一个前沿,当前 AI 在这方面能力不足,而 Marble 正推动其发展。

Founder Park
开源动态8

Qwen开源版Banana来了!原生支持ControlNet

Qwen推出新图像编辑模型Qwen - Image - Edit - 2509,支持多图融合、增强单图一致性,原生支持ControlNet。还开源端到端全模态模型Qwen3 - omni,性能优异,功能丰富。

量子位
开源动态8

中科院甩出多模态“核弹”!类GPT-4o多模态模型开源!支持语言-视觉-语音任意组合交互!

中国科学院计算技术研究所(ICTNLP)开源类GPT - 4o多模态模型Stream - Omni,支持文本、视觉和语音任意组合交互,核心是高效模态对齐技术,少量多模态数据即可训练,有多种使用场景。

开源星探
算法论文8

迎接「万物皆可RAG」时代:最新综述展示50多种多模态组合的巨大待探索空间

大模型常采用RAG技术,多模态崛起使RAG向MM - RAG发展。目前MM - RAG研究初级,华中科技大学等研究者发布综述,覆盖所有模态组合,剖析工作流,提供构建系统的一站式指南。

机器之心
开源动态8

卡帕西没做完的,开源社区48小时搞定了!完全体知识库,token省70倍

Karpathy分享的个人知识库爆火,48小时后开源社区推出Graphify工具。它零配置、全模态、本地跑,能自动构建知识图谱,省71.5倍token,还全平台适配,降低了上手门槛。

量子位
算法论文8

突破具身智能“专家困境”!北大新方法让宇树G1靠单一框架掌握跳舞和侧手翻

北京大学与BeingBeyond团队联合研发的BumbleBee系统,用创新的‘分治 - 精炼 - 融合’三级架构,实现人形机器人在多样化动作中的稳定控制,破解传统控制策略的‘专家困境’与‘现实鸿沟’。

量子位
产品应用7

当AI迈入Harness时代:以MiniMax为样本看智能体云端新基建

2026年初,随OpenClaw爆火,AI步入Harness时代,MiniMax成变革焦点,推出MaxClaw和MaxHermes。但本地单机框架用于企业级生产有鸿沟,MiniMax借助阿里云云原生方案重塑Agent运行底座。

机器之心
产品应用8

超越OpenAI、拿下全球双料第一,“AI吴彦祖”背后大模型SOTA了!

国产大模型MiniMax发布Speech - 02,拿下两项全球权威语音基准测评第一,是榜单前十唯一国产玩家。它超拟人、个性化、多样,技术创新,且在多行业落地,全模态布局领先。

量子位
算法论文8

原来Veo 3早有苗头!人大联合值得买科技在CVPR 2025提出全新「图像到有声视频」生成框架

中国人民大学与值得买科技团队在CVPR 2025提出JointDiT框架,可从静态图像生成同步音视频。此研究定义图像到有声视频生成新任务,解决音视频融合难题,实验显示其效果优,还将拓展至四模态建模。

机器之心