视觉空间」共找到 1099 篇相关文章

新闻资讯7

伯牙智能创始人兼CEO刘欣:灵巧手重塑具身智能|甲子引力X

2024年4月28日,「AI共潮生—2025甲子引力X科技产业新风向」大会举办。伯牙智能CEO刘欣分享称,AI在物理世界赋能需灵巧手,其操作发展尚处初期,有软硬件挑战,还提出对数据及触觉传感能力的新思考。

甲子光年
新闻资讯8

Gemini 2.5 Pro强势更新并霸榜,Claude 3.7首次遭遇全方位碾压!

Google DeepMind推出的Gemini 2.5 Pro在LMArena各大排行榜全面登顶,实现文本、视觉、Web开发全方位霸榜,编码能力也大幅升级。虽有质疑,但短期内难有对手,还引发对Google I/O大会更多惊喜的期待。

AGI Hunt
新闻资讯7

宇树机器人上市前再破纪录

IPO前夕,宇树科技放出新一代人形机器人「超人」预告视频,其打破两项世界纪录:0.85米短腿原地起跳2米高,冲刺跑峰值速度超博尔特。该机器人仅研发三月多,后续提升空间大。8月19日宇树将上市。

量子位
开源动态8

Codex给V4-Flash装上眼睛,DeepSeek也会文档OCR

GitHub上的项目codex-vision-proxy让接进Codex的DeepSeek能看图,不用换模型或等官方,装本地代理即可。它还附带视觉工具包,在智能文档解析和OCR上潜力大,证明多模态能力可长在管道上。

CourseAI
推荐文章8

评论送书 | 想系统了解AI?先搞清楚这四件事

文章围绕系统了解AI需搞清楚的四件事展开,介绍了AI理论基础层的机器学习和深度学习,感知交互层的计算机视觉等,应用实践层的机器人学等,还提及伦理社会层的AI伦理和社会影响研究。

AIGC开放社区
算法论文8

无需训练,如何提升黑箱VLM?CARPRT用「类别感知」给出答案

近年来,视觉 - 语言模型(VLMs)改变图像理解范式,但零样本分类性能对 Prompt 敏感。墨尔本大学 TMLR 小组提出 CARPRT 方案,以“无训练、黑箱适配、类别专属权重”解决提示词语义适配不足问题,已被 ICLR 2026 接收。

机器之心
开源动态8

刚刚,李飞飞世界模型开源了个渲染神器

今天凌晨,李飞飞空间智能独角兽公司 World Labs 官宣推出「Spark 2.0」,将 3DGS 世界带入 Web,原本专业设备才能运行的 3D 场景,现在任何人可在浏览器访问,该渲染器开源,能流式加载 1 亿 + 的 3DGS 数据。

机器之心
算法论文8

ICLR 2026 | 机器人不够聪明?VLMgineer让大模型自己「发明工具」,从设计到使用全自动

宾夕法尼亚大学研究者提出 VLMgineer,一个全自动工具设计与使用框架,利用视觉语言模型和进化搜索,让机器人自主设计并使用工具。该工作已被 ICLR 2026 接收。实验显示,它在工具设计上优于人类提示和现有 Benchmark 工具。

机器之心
算法论文8

CVPR 2026|清华联合美团推出3DThinker,首个用3D意象思考的工作

当前多模态大模型在空间理解任务表现弱,缺乏对几何信息提取能力。清华联合美团推出3DThinker,无需3D标注和外部工具,让模型内蕴‘想象’三维场景,在多基准上提升效果,且具备一定可解释性。

机器之心
产品应用8

三星研究院发布手机端侧大模型MeKi:基于Memory的LLM扩展新范式,支持旗舰手机端侧部署

三星研究院发布端侧大模型架构MeKi,提出用存储空间扩展模型容量、提升LLM性能的新范式。它利用手机ROM缓解内存压力,实现容量与性能提升。实验显示其性能、效率表现优,为边缘部署LLM提供新思路。

AI科技评论