「多模态学习」共找到 2198 篇相关文章
首次!世界模型、动作模型融合,全自回归模型WorldVLA来了
阿里巴巴达摩院提出全自回归模型 WorldVLA,首次融合世界模型与动作模型,统一文本、图片、动作理解和生成。它用独立编码器处理多模态数据,还提出策略解决误差累积问题,实验表现优异。
绝美无痕,比你还会P图的Agent!仅通过自然语言指令,灵活使用数百工具,超越GPT-4o达60%
JarvisArt提出多模态大模型驱动的智能Agent,通过理解自然语言指令,协调200+个Lightroom工具,实现媲美专业修图师的非破坏性编辑。其内容保真度超越GPT - 4o达60%,为AI艺术创作开辟新路径。
马斯克惊叹!DeepSeek和Kimi先后出手,捅破了Transformer的「潜规则」!
文章介绍了DeepSeek和Kimi在残差连接上的突破。DeepSeek让连接权重可学习,用数学约束保证稳定性;Kimi将注意力机制用于层间连接,解决了更根本的问题,性能提升显著。
春晚武BOT论文来了!王兴兴署名,同步开源其架构
宇树发布武BOT技术论文,王兴兴署名,同步开源OmniXtreme架构。该架构通过双阶段框架,打破学习和物理可执行性瓶颈,在高保真度与可扩展性间权衡,经测试在真实硬件上表现出色。
评论送书 | Al智能体与传统AI应用的区别?它如何工作?如何快速构建智能体?
文章对比AI智能体与传统AI应用,指出前者更像“乐高积木”,可融入生活工作。介绍其工作是“感知—推理—执行—学习”循环,还给出快速构建通用方法,如明确目标、选框架等。
图谱检索全面 or 效率?蚂蚁&浙大Deep GraphRAG:全都要
传统 RAG 遇复杂 Query 易失效,GraphRAG 带来新三难。蚂蚁与浙大提出 Deep GraphRAG,有层次化检索、Beam - Search 重排、DW - GRPO 强化学习三板斧,实验显示其性能优、延迟低。
深度之赌:从卧室到上帝机器
文章讲述现代AI秘史,从Jeff Dean本科研究神经网络失误,到Google Brain诞生;还有Hinton等深度学习先驱经历,如Hinton当实习生、AlexNet诞生等,也提及Google发展及未先发ChatGPT原因。
香港中科院发布聆音大模型,400万张图喂出个“AI超声神医”
中国科学院香港创新研究院发布超声大模型“聆音”,用超400万张图像的超声数据集,经自监督学习训练。它在多项诊断任务破纪录,临床效果佳,还将模型等开源,有望推动领域发展。
上海AI实验室发布 Intern Lumina U2:全离散扩散建模,让模型既能“看懂”也能“生成”
上海人工智能实验室发布新一代多模态统一模型 Intern Lumina U2,基于全离散扩散建模路线,支持多任务,适配两大硬件生态,在昇腾千卡级集群训练效率提升 1.85 倍,性能优异且将开放资源。
DeepSeek视觉原语论文:当所有人在堆图像分辨率时,它在堆「指代精度」!
4月30日DeepSeek发布多模态论文,核心是“视觉原语”,让模型边推理边输出坐标。它是七大coding agent玩家中最后接入视觉的,但补课方式反共识,不堆分辨率堆指代精度,效率高,拓扑推理成绩领先。