视觉智能」共找到 3955 篇相关文章

新闻资讯8

MMLab@HKU 闪耀 CVPR 2025!与全球顶尖学者共话 AI 前沿

CVPR 2025 于 6 月 11 日至 15 日在美国纳什维尔举行,MMLab@HKU 携 24 篇高质量论文亮相。其还是三项国际竞赛的发起与主办方,主办六项前沿活动,研究成果展示了多领域进步。

AI科技评论
算法论文8

世界模型太慢?西交大提出Fast LeWorldModel:用「动作前缀并行预测」让动态估计加速4倍

视觉规划里世界模型‘想象’过程慢,西安交通大学研究团队提出Fast LeWorldModel,从根本改变预测方式,实验显示其提升了成功率,还大幅缩短规划时间。

机器之心
算法论文8

ICLR最佳论文:Transformer天生简洁

2026年ICLR最佳论文对Transformer做深度思维体检,指出其架构真正威力在于描述概念时比RNN等简洁指数级甚至双重指数级,但验证其内部逻辑计算成本高昂,为解释其能力开新窗。

AIGC开放社区
开源动态8

Transformer论文作者重造龙虾,Rust搓出钢铁版,告别OpenClaw裸奔漏洞

Transformer作者Illia Polosukhin重造安全版龙虾IronClaw。OpenClaw安全状况差,IronClaw用Rust重写,建立四层防御,还能防提示注入。其背后是NEAR更大构想,目标是用户掌控数据和资产。

量子位
新闻资讯8

智源发布 2026 十大 AI 技术趋势:世界模型成 AGI 共识方向

2026年1月8日,智源研究院发布《2026十大AI技术趋势》,指出AI演进核心从语言学习转向理解物理世界秩序。报告阐述了AI从数字迈向物理世界的三条驱动主线,并给出十大趋势,为行业提供布局锚点。

AI前线
算法论文8

多模态BUG修复新SOTA:慕尼黑工大GUIRepair登上SWE-bench Multimodal榜单第一

自动化修复软件缺陷是长期目标,多模态问题修复受关注。慕尼黑工业大学团队提出GUIRepair,融合APR与GUI Testing知识,登上SWE - bench Multimodal榜单第一,为多模态软件自动修复开辟新路。

机器之心
开源动态8

字节开源高效解析文档图像的新型多模态模型Dolphin,快速将复杂的文档图像转化为结构化数据。

字节开源新型多模态模型Dolphin,采用“先分析后解析”范式,能将复杂文档图像转化为结构化数据。它有卓越性能和多种特性,还提供安装、推理使用指南。

GitHubStore
新闻资讯8

NVIDIA 李柏依:机器人只会「看」还不够,它还得学会「听」| ECCV 2026

本文整理了NVIDIA Research科学家李柏依在ECCV 2026 Workshop的分享,针对机器人训练数据采集壁垒高的问题,介绍了两项解决多模态感知与灵巧操作数据难题的前沿研究。

AI科技评论
新闻资讯7

20岁了!劈柴哥发帖庆生:谷歌翻译换了4代AI,第一次有了「呼吸感」

4月28日,Google Translate满20岁,Pichai发帖纪念,回顾其技术发展,从统计模型到神经网络,再到Gemini原生语音模型,Translate不断进化,能保留语调和节奏,虽被大模型抢风头,但仍在持续进步。

新智元
开源动态8

本周 5 个超酷 GitHub 开源项目,实用到飞起!

本文介绍本周5个超酷GitHub开源项目。有显示苹果设备电池状态的AirBattery,开源卫星可视化平台keeptrack.space,本地图片压缩工具Pic - Smaller,跨平台端口助手Port - Killer,轻量级AI证件照工具HivisionIDPhotos。

开源先锋