视觉机器人」共找到 1494 篇相关文章

新闻资讯7

CVPR 2026 Workshop征稿|第六届AdvML@CV:多模态大模型智能体安全

IEEE/CVF 计算机视觉与模式识别会议 CVPR 2026 6月3 - 7日在美国丹佛举办,期间6月3或4日将举办第六届对抗机器学习计算机视觉研讨会,聚焦视觉 - 语言智能体安全,现开启论文征稿并公布重要日期,给出投稿入口。

机器之心
新闻资讯8

梅卡曼德获豪华基石阵容认购:具身智能眼脑手第一股即将挂牌|甲子光年

8月24日,梅卡曼德启动港股招股,拟9月1日挂牌。其为机器人提供眼脑手组件,2025年全球市占率第一。业务增长快、海外收入过半,获豪华基石阵容认购,超八成募资将投向研发等。

甲子光年
新闻资讯8

感知、控制与数据:ICRA 2026 中国企业报告的三个交汇点

ICRA 2026期间,速腾聚创等六家中国企业分享机器人领域进展。他们关注感知底层基础、接触‘最后一毫米’问题、数据与模型关系,且技术路径和产品侧重有差异,具身智能注重工程落地和系统能力建设。

AI科技评论
算法论文8

“这个怎么组装?”一句无害的问题,如何让AI产生危险输出

Amazon团队发现全新威胁模型“视觉排他性”,提出MM - Plan框架,通过强化学习训练智能体自动发现攻击策略。实验显示其对Claude 4.5 Sonnet和GPT - 5攻击成功率可观,代码和数据集已开源。

深度学习自然语言处理
新闻资讯7

确认!DeepSeek多模态AI已经开测

DeepSeek研究员陈小康、陈德里确认其V4视觉模式开始灰度测试。更新后出现识图模式,具备真实图像理解能力。陈小康是多模态研究组负责人,陈德里负责语言模型等核心方向,V4可谓满血归来。

量子位
产品应用7

全球首个跨本体、跨视角、多模态物理世界模型,CurrentWorld-0 来了!

Current Robotics 发布跨本体、多模态物理世界模型 CurrentWorld-0,它从真实数据学规律,整合跨本体、多视角和力触预测,可评测机器人,解决动作可控性等问题,让评测成训练数据入口。

机器之心
新闻资讯8

成果三年两登Nature封面,这支清华团队想让AI换个方式看世界

清华大学类脑计算研究中心团队成果三年两登Nature封面。晰见科技承接天眸芯技术产业化,重新做AI的眼睛。天眸芯拆解视觉信息,构建互补通路,团队还研究算法融合信息,目前芯片进展良好。

DeepTech深科技
开源动态8

阿里Qwen悄悄放出6个开源权重,国庆卷疯了~

国庆期间,阿里通义千问悄悄放出6个开源模型权重,Qwen3-VL是通义千问系列最强大的视觉 - 语言模型。其30B版本多模态表现媲美GPT - 5 - Mini等,功能与架构均有升级。

PaperAgent
算法论文8

Loop-ViT:让AI学会「反复思考」,3.8M参数小模型追平人类平均水平

香港科技大学等团队提出 Loop - ViT,将循环 Transformer 引入视觉推理领域。该模型参数少但性能强,3.8M 小版本追平人类平均水平,揭示视觉推理任务中‘思考时间’比‘模型大小’更重要。

机器之心
算法论文8

与DeepSeek-OCR不谋而合,NeurIPS论文提出让LLM像人一样读长文本

NeurIPS 2025 论文提出 VIST 框架,为大语言模型长文本推理提供视觉方案,与 DeepSeek - OCR 理念不谋而合。它模仿人类阅读,有快 - 慢路径协作,在多任务表现优,还让模型‘用眼看文字’,优势明显。

机器之心