模长感知」共找到 953 篇相关文章

算法论文8

ICCV 2025 | 跨越视觉与语言边界,打开人机交互感知的新篇章:北大团队提出INP-CC型重塑开放词汇HOI检测

北大团队提出 INP - CC 型重塑开放词汇 HOI 检测。它提出交互感知提示生成和概念校准两项创新,结合输入图片特性构造提示集合,引入‘困难负样本采样’策略,在两大数据集上表现超 SOTA。

机器之心
算法论文8

T-PAMI|中国科大、合工大等提出CAPER++:让关节物体位姿感知真正迈向「又快又稳」

在具身智能发展下,关节物体位姿感知难题待解。中国科大、合工大等团队提出 CAPER++ 框架,从关节驱动视角建,将位姿学习拓展至 SE (3) 流形切空间,实现端到端推理,兼顾精度、鲁棒性与实时性。

机器之心
开源动态8

阿里开源14B电影级视频型!实测来了:免费可玩,单次生成时可达分钟级

昨夜阿里发布14B视频型Wan2.2 - S2V,仅需一张图片和一段音频,就能生成电影级数字人视频。该型发布即开源,可在通义万相官网免费体验,单次生成时可达分钟级。

量子位
算法论文8

让AI像人类一样认知真实世界!UCLA谷歌强强联手,时记忆+3D空间理解超越基线16.5%

如何让AI在3D环境中像人类一样思考,是具身智能领域难题。UCLA与谷歌团队带来3DLLM - MEM型与3DMEM - BENCH基准,让AI有构建、维护和利用时记忆能力,实验超基线16.5%,但有依赖拟器预设的局限。

量子位
算法论文8

联合理解生成的关键拼图?腾讯发布X-Omini:强化学习让离散自回归生成方法重焕生机,轻松渲染文本图像

图像生成领域,自回归与扩散型技术路线之争不断。腾讯混元团队发布X-Omni型,通过强化学习提升自回归图像生成质量,能渲染文本图像。该型已开源,还构建奖励系统评估生成质量。

机器之心
推荐文章8

从检测到通用感知:构建空间智能的基础

本文整理自张磊在AICon 2025北京的分享,分析语言与视觉原生型架构区别,介绍基于Transformer的物体检测算法及开集检测技术进展,如Grounding DINO和DINO - X,还探讨其在多领域的应用和潜力。

InfoQ
算法论文8

轻量高效,即插即用:Video-RAG为视频理解带来新范式

现有视觉语言型处理视频面临诸多难题,厦门大学等联合提出轻量高效、无需微调的 Video-RAG 框架,采用多态辅助文本检索增强生成,解决视频理解问题,适用于多场景。

机器之心
开源动态8

清华发布世界型评测新标尺:直击机器人感知与行动鸿沟

清华大学等机构推出 WorldArena 评测基准,用于测试 EWM 真实能力。它融合感知与功能评估,含十六项视频指标,结合主客观评价生成 EWMScore。测试揭示型在感知与行动上的差距,转型为实用型型是行业挑战。

AIGC开放社区
开源动态8

上下文快2.9倍,解码快6倍:Kimi 用线性注意力实现性能与效率双突破

月之暗面团队的Kimi Linear型,是混合线性注意力架构,核心是Kimi Delta Attention块。它解决线性注意力的记忆及遗忘问题,在多任务测试表现出色,还开源相关资源,推动高效上下文型研究。

AIGC开放社区
算法论文8

12毫秒暴露自动驾驶致命缺陷,北航新研究实现场景感知的动态物理对抗攻击|TPAMI2025

近日部分L3级自动驾驶车型获批上路,但自动驾驶感知系统存在缺陷。北航等机构提出DynamicPAE框架,实现场景感知的动态物理对抗攻击,解决多维度挑战,在多场景表现优异,被TPAMI2025录用。

量子位