多模态融合」共找到 1364 篇相关文章

开源动态8

分割一切、3D重建一切还不够,Meta开源SAM Audio分割一切声音

Meta 深夜放出音频分割模型 SAM Audio,可通过多模态提示分离任意声音。其核心 PE - AV 推动性能领先,还发布评测模型、基准等,整合进新平台,虽有局限但为音频 AI 带来新可能。

机器之心
开源动态8

从VLA到RoboOmni,全模态具身新范式让机器人察言观色、听懂话外音

复旦大学等联合推出全模态端到端操作大模型RoboOmni,统一多模态,实现动作与语音协同控制。它重新定义机器人交互范式,让机器人具备“察言观色”能力,还构建了OmniAction数据集,实验表现全面领先。

机器之心
算法论文8

内存直降50%,token需求少56%!用视觉方式处理长文本

在NeurIPS 2025论文中,南京理工大学等校研究团队提出VIST框架,为大语言模型长文本高效推理提供视觉解决方案。它模仿人类阅读机制,让模型具备选择性阅读能力,减少Token需求和内存使用。

新智元
算法论文8

阿里新研究:统一了VLA和世界模型

阿里达摩院等提出WorldVLA框架,融合视觉语言动作模型与世界模型。它用三套分词器编码,解决传统自回归模型问题,经联合训练,实验显示其性能优,两模型还能相互助力。

量子位
推荐文章7

中国产业叙事:中际旭创

本文讲述中际旭创发展历程。它原是电机绕组设备厂,2017年收购苏州旭创跨界光通信。借AI算力浪潮,2023年首发1.6T光模块,2024年营收、利润大增,成全球光模块市场榜首企业,还分析了光模块技术趋势。

芯师爷
算法论文8

均值至上假繁荣!北大新作专挑难题,逼出AI模型真本事

当强化学习成大模型后训练核心工具,主流方法陷入「均值优化陷阱」,推理能力停滞。北大团队提出RiskPO,将风险规避理念融入优化目标,用MVaR+捆绑策略双管齐下,三大任务表现优异。

新智元
开源动态8

告别AI“乱画图表”!港中文团队发布首个结构化图像生成编辑系统

现有AI生图工具在结构化图像生成上问题多,理解与生成能力有鸿沟。港中文等校联合团队提出首个综合性方案,涵盖数据集构建、模型优化、评估基准三大模块,助多模态模型画准图,推动其发展。

量子位
新闻资讯7

突发!Meta刚从OpenAI挖走了清华校友宋飏

刚刚,OpenAI前高层研究员宋飏加盟Meta Superintelligence Labs任研究负责人,向赵晟佳汇报。此次人事流动或透露出Meta在AI竞赛中释放的三重信号,如MSL人才拼图更完整等。

新智元
算法论文8

苹果传统强项再发力,视觉领域三种模态终于统一

苹果在大模型领域常受挫,但计算机视觉研究是其强项。其研究团队提出 ATOKEN,这是首个能在主要视觉模态统一处理的分词器,兼顾重建质量与语义理解,成果朝通用视觉表征迈进一步。

机器之心
新闻资讯7

史诗级和解:英特尔获老对手英伟达超350亿投资,股价创38年最大单日涨幅

英伟达将投资英特尔50亿美元,双方联合开发定制CPU和GPU集成产品。合作旨在融合AI加速与通用CPU,覆盖多市场。曾有纠纷的二者此次合作,或助英特尔借AI突围。

AI前线