「视觉机器人」共找到 1496 篇相关文章
协同加速,多机器人协作不再「慢半拍」!软硬一体化框架ReCA破解具身智能落地效率瓶颈
佐治亚理工学院等团队推出集成加速框架 ReCA,针对多机协作具身系统,从算法、系统、硬件跨层协同优化,经评估,实现 5 - 10 倍速度提升且成功率升 4.3%,为具身智能落地奠基。
ICLR 2026 Oral | 告别多步去噪!清华团队推出MVP,实现机器人动作单步极速生成
清华大学智能驾驶课题组 iDLab 与加州大学伯克利分校人工智能研究院 BAIR联合发表研究,提出 MVP 策略。它引入瞬时速度约束解决均值流学习问题,设计复合生成与选择机制,在多任务测试中表现出色。
最强多模态模型也拿不到30分?DeepImageSearch定义相册搜索新范式,开启个人视觉记忆的深度搜索时代
人大窦志成教授团队联合OPPO研究院提出DeepImageSearch图像检索新范式,将其从“逐张语义匹配”推向“语料库级上下文推理”。团队构建评测基准DISBench,用ImageSeeker框架评测主流模型,结果显示最强模型单次完美解决查询比例不超三成。
32倍加速,58秒搞定720p视频!字节发布离散自回归框架,统一视觉生成和长视频生成
字节发布InfinityStar框架,将5秒720p视频生成时间从30多分钟缩至58秒,还支持多样任务。它基于对视频本质思考设计时空金字塔模型,将时空分离,通过多项技术优化,性能表现出色,不过也存在一些技术局限。
机器人连续叠衣120分钟!仅用0.9B参数实现五大SOTA|清华AIR & 上海AI Lab开源
清华大学智能产业研究院与上海人工智能实验室联合发布通用跨本体具身基座模型X-VLA。它是首个实现120min无辅助自主叠衣的全开源模型,仅0.9B参数量就在五大权威仿真基准刷新纪录。
AI一眼认出95万物种,还能分辨雄雌老幼,2亿生物图像炼成“生命视觉”大模型
俄亥俄州立大学团队用2亿生物图像训练BioCLIP 2模型,取得最优物种识别性能。它在无相应监督信号的非物种任务中,准确率远超DINOv2,还涌现出物种间生态对齐、物种内差异分离等生物学理解。
狂涨 36.9K star!!看看人家的开源微信机器人多优雅,微信、飞书、钉钉支持,效率飙升!
开源君介绍超火的开源项目`chatgpt-on-wechat`(CoW),它结合大模型与社交、办公平台,可定制优化。能接入多平台,支持多模型,处理多模态消息,有丰富插件,还能记忆会话、定制知识库。给出安装步骤。
阿里达摩院开源具身大脑基模:3B激活参数性能超越72B,转身就忘事的机器人有救了
阿里达摩院开源RynnBrain具身大脑基础模型,全系列7个。它是业界首个有 时空记忆的模型,在20项具身Benchmark上超顶尖模型。具小而美优势,训练用自研架构提效,数据丰富,输入输出灵活。
5Y News|Kimi发布并开源 K2.5 模型,带来全新视觉理解、代码和Agent集群能力
2025年1月27日,月之暗面发布并开源Kimi K2.5模型,它是迄今最智能全能的模型,在多任务有出色表现。支持多模态输入,具备新能力,还推出Kimi Code工具,集群能力也开启Beta测试。
ICCV 2025 | 跨越视觉与语言边界,打开人机交互感知的新篇章:北大团队提出INP-CC模型重塑开放词汇HOI检测
北大团队提出 INP - CC 模型重塑开放词汇 HOI 检测。它提出交互感知提示生成和概念校准两项创新,结合输入图片特性构造提示集合,引入‘困难负样本采样’策略,在两大数据集上表现超 SOTA。