「多模态数据融合」共找到 3523 篇相关文章
黄仁勋GTC开场:「AI-XR Scientist」来了!
英伟达CEO黄仁勋在GTC大会展示LabOS,这是全球首个融合AI与XR的协研科学家平台。它将多模态感知等技术融合,构建端到端闭环,还通过三大生物医学案例展示功能,开启人机协同科研新纪元。
ICML 2026 巡礼:注意力效率革命的九个切面
7月7日,ICML 2026进入正会第一天。雷峰网精选首日上午9篇论文,涵盖持续学习、多模态融合等方向,如MePo让预训练模型学会持续学习,HAF解决模态不平衡下的融合问题,展现AI研究前沿趋势。
读万卷书,大模型就能「看」懂视觉世界?Meta揭秘LLM视觉先验的起源
Meta超级智能实验室与牛津团队新论文发现,只见过文本的大语言模型(LLM)能学到可迁移到视觉任务的先验能力。研究通过超100组受控实验、耗费50万GPU小时,揭开LLM视觉先验来源,还给出预训练数据配方。
腾讯云与 Gartner 联合发布“Data+AI”白皮书,各行业领军企业分享最佳实践
6月27日,腾讯云联合Gartner发布《Data+AI,下一代数智平台建设指南》白皮书。指出GenAI时代数据变化大,腾讯云打造原生一体化Data+AI平台DIaaS,多位技术大咖分享其赋能企业数智化转型实践。
告别昂贵人工标注,英伟达全自动视频理解助力小模型逆袭顶级大模型
麻省理工、英伟达等推出FoundationMotion,它是全自动数据生成流水线,能解决运动数据稀缺难题。通过自动标注生成问答数据,让小模型经微调后在运动理解上超越顶尖闭源模型,还介绍了其数据生成、问答设计等环节。
推理即排序:ReasonRank反常识的2.7倍效率跃迁,新SOTA比快更快
论文提出新型排序模型ReasonRank,将深度推理能力融入排序流程,突破数据瓶颈,采用创新训练框架,效率比主流点对点排序模型快2.7倍,还介绍方法论、技术突破、实验验证等内容,指出局限与未来方向。
ICML2025 | 揭示MLLM的图文联动推理能力
当前多模态大语言模型(MLLMs)在图文深度融合推理能力上面临挑战,现有评测基准无法真正检验该能力。EMMA基准应运而生,它从四大领域精选题目,采用双重过滤机制和细粒度标注体系,评测发现MLLMs存在多模态推理危机。
一家低调的工业AI公司,用TPT跨越生成式AI鸿沟|甲子光年
麻省理工学院报告指出约95%生成式AI企业试点无实质回报,存在生成式AI鸿沟。工业AI落地难,中控技术的TPT及TPT 2模型,在兰州石化榆林化工应用效果好,其优势源于数据和行业经验,也体现了破局决心。
Issue修复开源No.1!蚂蚁 | 提出代码图模型:CGM,结合GraphRAG架构,领先最强开源7.33%
为解决开源模型在仓库级代码理解上的能力瓶颈,蚂蚁全模态代码算法团队提出 CGM 架构,融合仓库结构与语义信息。CGM 首创图结构与语言模型融合的对齐框架,还搭配了 GraphRAG 框架,在多个代码任务中表现出色,且相关资源均已开源。
VLA不够了?触觉,将改写具身智能新格局
2026 年数据成具身智能竞赛焦点,IEEE 专访机器人学家王煜。他认为 VLA 架构难支撑机器人落地,触觉数据是关键。他与团队提出 VTLA 框架,创立戴盟机器人,发布数据集并开源部分数据,还阐释对具身智能多方面的思考。