通用视觉模型」共找到 8078 篇相关文章

算法论文8

全球首个人形机器人通用视觉感知系统,Humanoid Occupancy建立多模态环境理解新范式

北京人形机器人创新中心推出 Humanoid Occupancy 感知系统,创新性融合多模态传感器信息,构建通用感知框架。它以语义占用表征为核心,有全编码和适配融合优势,经实验验证性能优,推动机器人迈向通用感知时代。

机器之心
算法论文8

世界模型最新综述!中科院联合MBZ、NTU、Oxford系统梳理前沿进展

中科院联合多机构及顶尖学者合作,系统梳理世界模型建模范式、方法等,归纳为四大分支,还梳理其在多领域应用、基准数据集等,讨论走向通用智能面临的障碍。

机器之心
算法论文8

让代码接管世界演化,西湖大学发布Code视频世界模型

西湖大学研究团队提出 Code World Model,将‘世界如何演化’和‘世界如何被看见’拆成两个互补问题,由 Coding Agent 决定世界演化,代码执行规则,视频模型转化为视觉观察,有应用潜力。

机器之心
算法论文8

ICLR 2026 | 7B小模型干翻GPT-5?AdaResoner实现Agentic Vision的主动「视觉工具思考」

文章介绍了AdaResoner模型,它学会‘何时用工具’,在拼图推理上击败GPT - 5。Google为Gemini 3 Flash引入‘Agentic Vision’,与AdaResoner殊途同归。AdaResoner有独特训练方法,提升小模型性能。

机器之心
算法论文8

无VAE扩散模型! 清华&可灵团队「撞车」谢赛宁团队「RAE」

清华大学智能视觉团队和快手可灵团队联合推出《Latent Diffusion Model without Variational Autoencoder》,提出 SVG 框架,用预训练视觉特征编码器替代传统 VAE,解决了传统「VAE + Diffusion」范式的效率与通用性痛点。

机器之心
新闻资讯7

英伟达叫板DeepSeek?怒投260亿美元,要打造最强开源模型

英伟达已成为人工智能时代基础设施的一部分,2023年11月推出首个Nemotron模型进入通用模型领域。未来五年将投260亿美元构建开源模型,还发布了性能最强的开源模型Nemotron 3 Super。

机器之心
新闻资讯8

中国中文信息学会大模型与生成专委会2025大模型战略研讨会成功举办

2025年6月27日,中国中文信息学会大模型与生成专委会2025大模型战略研讨会在哈尔滨举办。会议探讨技术革命、交流成果、发布基金,多位专家作报告、参与思辨讨论,聚焦大模型多方面话题。

深度学习自然语言处理
推荐文章8

视觉生成的另一条路:Infinity 自回归架构的原理与实践

本文整理自字节跳动韩剑在AICon 2025北京站的分享,以Infinity为例介绍自回归视觉生成原理,对比其与扩散模型,展示Infinity升级方案成果,它在高分辨率文本到图像任务能与扩散模型竞争。

InfoQ
开源动态8

18K+标星!视觉AI驱动的浏览器自动化,告别XPath,无惧网页改版!

网页自动化常遇页面更新脚本报废等难题,而开源工具Skyvern不走传统XPath/DOM路子,用视觉+大语言模型理解网页,能自适应改版,功能丰富,安装运行简单。

开源星探
算法论文8

只用图像也能思考,强化学习造就推理模型新范式!复杂场景规划能力Max

现有 MLLM 依赖文本处理视觉信息,会造成信息丢失。剑桥、伦敦大学学院、谷歌团队提出视觉规划范式,以强化学习框架 VPRL 提升模型规划能力,实验显示其性能优于文本规划。

机器之心