多模态融合」共找到 1363 篇相关文章

产品应用8

英伟达为机器人推出懂推理的“大脑”!升级版Cosmos世界模型来了

在SIGGRAPH大会上,英伟达推出全新升级的Cosmos世界模型,重点升级规划能力与生成速度。还升级配套软硬件,如Omniverse库等。英伟达全力布局机器人领域,认为图形与AI融合将变革该领域。

量子位
7

硬件只是入场券:AI可穿戴的百万销量背后,软件与场景才是终极战场

InfoQ《极客有约》X AICon 直播探讨 AI 硬件进阶。Plaud、Rokid 等企业代表认为,AI 硬件成功关键在于早布局、结合需求与设计。软硬件一体是核心,可在传统硬件难胜任场景脱颖而出,多模态交互有挑战也有应用。

AI前线
开源动态8

手机也能跑,腾讯混元一口气开源4款小模型

腾讯混元团队开源4款小模型,最大7B。可在低功耗场景运行,支持微调。是融合推理模型,有快、慢思考模式,在多领域表现出色,亮点是agent和长文能力,已落地多元业务场景。

机器之心
新闻资讯8

全国首部!AI 大模型私有化部署标准起草单位 / 个人征集启动!

国内首部AI大模型私有化部署标准《人工智能大模型私有化部署技术实施与评价指南》立项,正征集起草单位和起草人。该标准全流程覆盖、多方面融合、三方协作,能解决企业部署痛点,构建安全可信生态。

AI大模型应用实践
算法论文8

「Thinking with Images」推理速度太慢?「Zooming without Zooming」 让AI不调用工具也能「明察秋毫」!

上海交通大学与蚂蚁集团联合团队发布多模态大模型成果“Zooming without Zooming”。该研究提出R2I方法,将“缩放”转为训练目标,使模型单次前向传播实现细粒度感知,团队开源的ZwZ模型家族达开源SOTA性能。

AI科技评论
推荐文章7

深度解析世界模型:新范式的路线之争,实时交互与物理仿真

文章认为2026年多模态技术将有大发展,世界模型轮廓渐清。文中对比语言、视频生成模型,指出世界模型优势,分析实时视频与3D结构化两条路线,介绍不同公司产品并以四象限框架分类。

海外独角兽
产品应用8

创业一年后,李飞飞推出首款可商用世界模型 Marble,任意模态都可生成 3D 世界

李飞飞创业公司 World Labs 推出可商用世界模型 Marble,支持多模态输入,生成的 3D 世界更丰富细致。李飞飞认为空间智能是 AI 下一个前沿,当前 AI 在这方面能力不足,而 Marble 正推动其发展。

Founder Park
算法论文8

ICCV 2025 | 基于时序增强关系敏感知识迁移的弱监督动态场景图生成

北大王选所团队发表论文 TRKT,针对弱监督动态场景图生成任务目标检测质量瓶颈,提出时序增强关系敏感知识迁移方法,含关系敏感知识挖掘和双流融合模块,实验证明能提升场景图生成质量。

机器之心
开源动态8

WAIC 2025大黑马,一个「谢耳朵AI」如何用分子式超越Grok-4

当Grok - 4讲冷笑话时,中国科学家用书生Intern - S1破解癌症药物靶点密码。7月26日上海AI实验室发布并开源Intern - S1,多模态能力全球开源第一,相关平台也上线,有望重构科研生产力。

机器之心
算法论文7

Gemini 2.5 Pro 是怎么炼成的?-- gemini 2.5 技术报告阅读笔记与思考

文章是 Gemini 2.5 技术报告阅读笔记。介绍其成功点有多模态、LongContext、思考能力;还阐述模型结构、训练和数据情况,以及代码、事实性、长上下文等特定能力的提升,最后提到基于其构建的智能体。

chaofa用代码打点酱油