「动物感知」共找到 337 篇相关文章
75页哈工大多模态推理大模型最新综述:感知、推理、思考与规划
哈工大提出75页多模态推理大模型综述,围绕四阶段发展路线图展开,即感知驱动的模块化推理、以语言为中心的短推理、以语言为中心的长推理、迈向原生多模态推理模型,还给出挑战性基准测试和实验案例见解。
Gemini CLI 新升级:深度集成 VS Code,终于不用在终端和编辑器之间反复横跳了
Google发布Gemini CLI重要更新,实现与VS Code深度集成,从架构层面解决AI编程助手的上下文感知问题。新版本有工作区上下文感知和原生差异对比界面两个核心功能,还给出部署要求。
最鲁棒的MLLM!港科大开源「退化感知推理新范式」 | AAAI'26
多模态大语言模型(MLLMs)在真实世界视觉退化下性能崩溃,制约产业落地。港科大等团队开源的Robust - R1被AAAI 2026接收为Oral,提出显式结构化推理新范式,实现质量与鲁棒性双重突破。
「被动感知」到「理解接触」!它石智航重磅发布OmniVTA视触觉世界模型
它石智航联合六大顶尖机构推出OmniVTA视触觉操作框架和OmniViTac大规模视触觉数据集。该框架核心是从被动感知到主动预测触觉,通过多模块协同让机器人有预测、理解和修正能力,实验表现优。
马斯克将用最强Grok 5,挑战LOL最强战队T1!
马斯克让Grok 5戴「纯视觉感知」与「拟人延迟」镣铐挑战LOL传奇战队T1。这是终极图灵测试,AI像人一样感知与推理。对决为特斯拉Optimus练兵,若AI看懂团战,就能理解现实世界。
夜间感知新突破!北航等提出红外主导的高效目标检测方案 | ECCV'26
在复杂视觉场景中,传统RGB - IR多模态检测方法在低照度等场景下因RGB退化影响检测效果。北航等团队提出的InfraNet,以红外为主,用质量感知机制控制RGB引导,在多数据集取得强竞争力结果。
备受Meta折磨,LeCun依旧猛发论文!新作:JEPAs不只学特征,还能精准感知数据密度
备受Meta审核规定“折磨”,LeCun仍发新论文。其团队发现自监督模型JEPAs学会了数据“密度”,打破学界以往认知。还提出JEPA - SCORE工具,经多组实验验证其效果。
清华天眸芯团队再登Nature系列期刊封面,类脑互补视觉范式重塑AI感知世界的方式
清华天眸芯团队继2024年《Nature》封面后,最新进展又登《Nature Sensors》封面。此次研究实现系统级算法软件生态飞跃,还开源工具链。成果在多场景有应用潜力,晰见科技推动其产业化。
突破视觉-语言-动作模型的瓶颈:QDepth-VLA让机器人拥有更精准的3D空间感知
视觉 - 语言 - 动作模型(VLA)在机器人操控领域潜力大,但应对长时序或精细操作任务时性能下降,根源是缺乏三维空间感知与推理能力。中国科学院自动化研究所与灵宝 CASBOT 提出 QDepth - VLA 模型,提升了机器人空间推理与操控精度。
阿里通义的视觉RAG革命!VRAG-RL:基于强化学习的视觉感知RAG框架,性能飙升30%
阿里巴巴通义实验室推出VRAG - RL,融合视觉感知、多模态推理与强化学习,已在GitHub开源。它破解传统RAG处理视觉数据难题,通过创新机制提升性能,在多数据集表现出色,还将向更拟人化和低幻觉方向发展。