「具身视觉」共找到 1599 篇相关文章
清华-腾讯联手:音频 - 视觉多模态任务统一框架
Crab是人大、清华和腾讯合作论文提出的模型,目标是高效一统多模态场景理解任务。它解决了音频 - 视觉理解模型任务干扰、合作显式化不足等难点,通过构建数据集、设计结构和统一架构实现多任务合作。
Ropedia刘子纬:具身智能的Scaling Law,不是算力,是人类的经验
Ropedia刘子纬指出,当前物理AI面临差距,下一阶段需Scaling人类物理世界的经验。Ropedia构建真实世界经验引擎,形成经验飞轮,目标是打造能看见、记住、想象并行动的模型。
这家公司刚成立7个月,正在打磨通用具身智能的终极形态
超维动力(Kinetix AI)于2025年7月注册,9月研发,不足一年便举办独特发布会,让KAI人形机器人“自己发布自己”。其认为高拟人是训练强世界模型前提,构建了含本体、世界模型等的技术体系,但面临工程与成本挑战。
14万,家务机器人带回家!斯坦福华人博士具身创业首款产品亮相
斯坦福明星华人博士生创业机器人Memo亮相,售价2万美刀。它颜值高,能做家务,在无剪辑等的demo中有出色表现。其背后是ACT - 1模型,依赖技能捕捉手套数据训练,成本低且用户可教它新本领,预计2026年推出。
从VLA到RoboOmni,全模态具身新范式让机器人察言观色、听懂话外音
复旦大学等联合推出全模态端到端操作大模型RoboOmni,统一多模态,实现动作与语音协同控制。它重新定义机器人交互范式,让机器人具备“察言观色”能力,还构建了OmniAction数据集,实验表现全面领先。
人大-清华-腾讯发布:音频 - 视觉多模态任务统一框架
人大、清华和腾讯合作发布Crab论文,目标是实现多模态场景理解任务的高效一统。它针对音频 - 视觉理解模型难点提出解决方案,构建数据集、设计LoRA结构、统一架构,训练分预训练和指令调整两阶段。
盲人复明!马斯克Neuralink联创实现人工视觉里程碑
Nature刊登人工视觉研究PRIMA,其让70岁失明奶奶重获光明。该研究由Neuralink联创带队,视网膜植入物使80%患者视力显著改善。PRIMA能逆转恢复视力,与传统疗法不同,已申请监管批准。
具身智能的Skill时刻!英伟达开源机器人技能库,Jim Fan:范式变了
英伟达开源能让机器人持续成长的技能库ASPIRE,类似机器人版Coding Agent,会沉淀机器人操作经验。英伟达机器人主管Jim Fan称其代表全新持续学习范式,论文实验验证其效果好于此前方法。
伯牙智能创始人兼CEO刘欣:灵巧手重塑具身智能|甲子引力X
2024年4月28日,「AI共潮生—2025甲子引力X科技产业新风向」大会举办。伯牙智能CEO刘欣分享称,AI在物理世界赋能需灵巧手,其操作发展尚处初期,有软硬件挑战,还提出对数据及触觉传感能力的新思考。
Ultralytics & lightly-train:简化计算机视觉模型训练,无需标签
在计算机视觉领域,获取带标签数据成本高、耗时长。开源项目 lightly-train 用未标记图像和视频自监督预训练,减少标注成本与时间,可集成到现有训练管道,支持多种模型架构和应用场景。