「多模态知识图谱」共找到 1409 篇相关文章
苹果传统强项再发力,视觉领域三种模态终于统一
苹果在大模型领域常受挫,但计算机视觉研究是其强项。其研究团队提出 ATOKEN,这是首个能在主要视觉模态统一处理的分词器,兼顾重建质量与语义理解,成果朝通用视觉表征迈进一步。
宇树科技开源UnifoLM-WMA-0机器人模型,离通用机器人又进一步
宇树科技开源UnifoLM-WMA-0模型,用神经物理网络让机器人理解力学规律。它支持两种模式,融合多模态信息,架构精妙。经测试性能强,已真机部署。开源降低门槛,有望推动行业发展。
三大核心创新公开,快手开源多模态Keye-VL 1.5拿下视频理解SOTA,8B力压GPT-4o!
快手开源多模态Keye-VL 1.5,为8B视频理解大模型,公开3大核心创新技术。靠Slow - Fast视频编码等,在20 + 基准屠榜。它能精确视频定位,实验显示通用、视频理解和数学推理表现佳。
开学了:入门AI,可以从这第一课开始
文章从生活小事引出AI相关知识,介绍了AI学习方法,包括掌握数学基础、编程能力,持续学习与实践。还提及AI现实挑战与机遇,回顾其发展历程,最后给学习者送上祝福与建议。
Figure人形机器人首秀灵巧手叠衣服!神经网络架构不变,只增加数据集就搞定
Figure人形机器人首秀用灵巧手叠衣服,在未改变神经网络架构、仅增加数据的情况下,让原本用于物流场景的它习得新技能,完成了端到端的操作,还实现自然多模态交互。
AI 编程冲击来袭,程序员怎么办?IDEA研究院张磊:底层系统能力才是护城河
在 AICon 大会上,IDEA 研究院张磊剖析多模态智能体发展难题,提出从“半结构化”场景切入的落地路径,分享工业界研究与产品平衡见解,还为年轻人在 AI 浪潮中发展给出建议。
自我进化Agent综述:通往超级智能的进化之路
当前大型语言模型面对新知识、动态环境时存在固定参数瓶颈,自进化智能体研究应运而生。本论文作为该领域首部系统性综述,提出革命性框架,解析自进化智能体技术脉络与未来挑战。
ICCV 2025|UV-CoT:无监督视觉推理新突破,偏好优化重塑图像级思维链
随着文本领域思维链推理机制成功应用,研究者将其引入视觉理解任务。现有模型有局限,本文提出UV - CoT新框架,设计无监督数据生成与偏好优化机制,提升模型能力,摆脱对人工标注依赖。
行业新突破:行为基础模型可实现高效的人形机器人全身控制
该综述聚焦行为基础模型(BFM)在人形机器人全身控制中的应用,梳理进展并分类算法,介绍应用与限制,还探讨未来研究机会与风险,有望引导该领域研究者和从业者。
ICML 2025 Oral!北大和腾讯优图破解AI生成图像检测泛化难题:正交子空间分解
OpenAI推出GPT - 4o图像生成功能,AI生图安全挑战凸显,区分生成与真实图像成难题。北大与腾讯优图研究人员用正交子空间分解解决AI生图检测泛化难题,论文被ICML 2025接收。