层级视觉识别」共找到 915 篇相关文章

算法论文8

打破具身世界模型可执行性鸿沟 !港中深-跨维智能团队提出EVA框架,用强化学习让视频世界模型真正“动”起来

近期,利用视频生成模型为机器人构建“世界模型”成热门路线,但存在“可执行性鸿沟”。港中深 - 跨维智能团队提出 EVA 框架,用强化学习优化视频生成,实验显示其能提升视觉规划、仿真任务成功率及真实部署稳定性,还有数据合成潜力。

机器之心
开源动态8

给机器人一个会预测未来的Critic,VLA强化学习直接起飞

OpenMOSS团队开源的World Critic Model(WCM),解决了视觉 - 语言 - 动作模型强化学习(VLA - RL)中批评家模型(Critic Model)仅依赖单帧观测打分的问题。WCM让Critic学习预测执行动作后的潜在状态,代码等全开源,验证效果显著。

机器之心
开源动态8

准确回答视频细节!11B模型挑战视频理解「证据级」任务,开源可商用

近日,复旦大学邱锡鹏教授领衔的OpenMOSS团队联合模思智能开源11B参数的多模态视觉理解模型MOSS-VL。它能准确回答视频里可被验证的细节、时间、过程和空间关系,有六项证据级能力,架构设计独特,采用Apache2.0开源许可。

量子位
新闻资讯8

11 年前的那张图,又火了

一张2015年关于AI的智能曲线图近日在X上刷屏,马斯克也进行了转发。该图作者Tim Urban将AI分为ANI、AGI、ASI三个层级,指出人类习惯线性思考,但AI进步是指数级的。如今AI发展加速,其能力边界不断扩张。

AGI Hunt
算法论文8

谷歌新研究:大模型“吵架”有利于提升推理质量

谷歌新研究发现高级推理模型自发进化出'思想社会',研究人员用LLM - as - judge方法识别出多个虚拟人格。还找到控制现象的'开关',实验表明教AI'吵架'更有效,其'社交技能'通用,给开发者带来新启示。

AI工程化
算法论文8

大模型外挂“三维物体知识库”来了,大幅增强机器人长程自主操作能力

现有视觉语言大模型(VLM)能让机器人理解指令,但在操作中缺三维空间知识。近日研究提出 RAM 框架,它像“三维物体知识库”,为 VLM 补充空间知识,经 14 项实验验证其操作能力,还探索了在铰接与柔性物体操作中的应用。

DeepTech深科技
推荐文章7

AI 取代不了放射科医生

人们曾认为AI图像识别技术会让放射科医生被淘汰,如杰弗里·辛顿预言应停止培训该类医生。但过去十年,放射科医生需求反而增加。文章以其为例,分析AI难取代的原因,如基准测试局限、医生工作复杂、AI落地困难等。

宝玉AI
产品应用8

银河通用WRC首发英伟达Thor,银河太空舱世界首创城市级机器人应用

全球首个城市级常态化运营的人形机器人示范区落地北京。银河通用具身大模型机器人Galbot依托大模型实现精准商品识别与取送,还展示了多场景应用能力。其银河太空舱开启‘十城百店’计划,推动具身智能服务普及。

新智元
算法论文8

LLM驱动的威胁情报提取框架,从非结构化到STIX的自动化:IntelEX

为应对网络攻击,需将非结构化网络威胁情报转化为结构化情报。IntelEX是自动化攻击级威胁情报提取工具,通过LLM上下文学习等增强,能识别攻击序列并提取结构化情报为STIX格式,还可转化成Sigma,在测试中表现优异。

AI与安全
算法论文8

密室逃脱成AI新考场,通关率不足50%,暴露空间推理短板丨清华ICCV25

清华大学团队受密室逃脱游戏启发,提出EscapeCraft:一个3D密室逃脱环境,用于评估多模态大模型在视觉环境中完成复杂任务推理的能力。该论文已入选ICCV 2025。研究评测了多个热门模型,发现它们在推理和探索行为方面存在诸多问题。

量子位