视觉理解模型」共找到 8223 篇相关文章

算法论文8

无需训练,如何提升黑箱VLM?CARPRT用「类别感知」给出答案

近年来,视觉 - 语言模型(VLMs)改变图像理解范式,但零样本分类性能对 Prompt 敏感。墨尔本大学 TMLR 小组提出 CARPRT 方案,以“无训练、黑箱适配、类别专属权重”解决提示词语义适配不足问题,已被 ICLR 2026 接收。

机器之心
算法论文8

Facet-0:NTU王子为团队让机器人在精密装配中「看得懂、插得准、出错能恢复」

新加坡南洋理工大学PINE Lab团队研发Facet - 0机器人基础模型,用于精密装配。它在五项计算机装配任务中平均成功率达82%,能让机器人理解接触状态、判断对错并改进。通过多阶段训练,降低人工干预率,提高失败恢复率。

机器之心
产品应用8

员工每天花1000美元也要用ClaudeCode!创始人:太贵了,大公司专属,但它比 Cursor 猛!

Claude Code处理大型代码库能力强,但价格贵,有用户称能力超Cursor。其创始人分享设计理念、使用方法等,还提到它基于Claude 4系列模型有新变化,可在GitHub等场景用,未来会拓展工具协同和小任务处理。

AI前线
产品应用7

从 Copilot 到 通用 Agent : 阿里在 AI Coding 上的应用和挑战

阿里巴巴代码平台负责人向邦宇在 QCon 大会分享阿里智能研发大模型应用与挑战。介绍探索成果,如代码补全、审查等功能;指出面临用户需求理解、领域知识整合等难题;还提及技术进步带来新机遇,促使从 Copilot 向 Agent 转变。

InfoQ
新闻资讯7

18岁天才少年,登上Nature封面!

DeepSeek-R1荣登Nature封面,成史上首个经严格同行评议大模型。18岁天才少年涂津豪以实习生身份参与,其从高中生到Nature作者的经历堪称传奇。他还改造Claude 3.5,开源项目获15k多星,还对AGI发表思考。

新智元
新闻资讯8

LeCun三顾茅庐,谢赛宁终于入伙!新公司获投10亿美元

图灵奖得主Yann LeCun创立的世界模型初创公司Advanced Machine Intelligence(AMI)宣布完成10.3亿美元种子轮融资,估值35亿美元。DiT作者谢赛宁加入任联合创始人兼CSO,CEO是Alex Lebrun。公司目标是打造理解现实世界的智能系统。

量子位
算法论文8

NeurIPS 2025 Spotlight | 选择性知识蒸馏精准过滤:推测解码加速器AdaSPEC来了

大型语言模型推理延迟高、开销大,推测解码可加速但依赖草稿与主模型一致性。佐治亚理工等团队提出 AdaSPEC 蒸馏法,过滤难学 token,提升草稿模型与目标模型对齐度,实验显示能提升接受率和推理速度。

机器之心
算法论文7

把 Gemini 和 GPT 放到《我的世界》当教练,谁能看懂机器人的微操?

国立清华与英伟达团队研究《VLM-AR3L》,把Gemini 2.0、GPT-4.1等拉进考场,评估视觉裁决能力。结果显示Gemini综合最稳,开源小模型特定场景反超。还提出VLM-AR3L框架破使用瓶颈,实战超人类手写奖励。

AI科技评论
推荐文章7

告别模板时代!妙多VP张昊然:生成式AI如何驱动UI设计的范式革命

在AICon2025上海站,妙多副总裁张昊然分享生成式AI在UI设计领域的影响。他回顾初代生成式UI的‘套模板’技术,讲述技术革新后回归代码生成界面,还探讨让AI理解设计系统、妙多AI 2.0理念及未来UI工具假设。

InfoQ
产品应用8

Meta「分割一切」进入3D时代!图像分割结果直出3D,有遮挡也能复原

Meta MSL实验室发布三维重建模型SAM 3D,其家族的两个新模型能将2D图像转为3D重建模型,性能优异。同时,此前投稿ICLR 2026的SAM 3也亮相,可克服传统模型局限,在多项任务中刷新SOTA。

量子位