点云视觉」共找到 1839 篇相关文章

新闻资讯7

老思维做 Agent,没戏!厂商们又想憋大招了

企业落地 Agent 经历快速演化,自主性 Agent 成新趋势。厂商起初推 AI Infra,现转以 Agent 应用为中心开启 Agent Infra 赛道竞争,虽已布局但新开发范式未成型,未来需产业链协作迭代。

InfoQ
产品应用8

拓宽百年奥运「赛场边界」,阿里AI让人人皆可上场

阿里作为2026年米兰冬奥会官方服务合作伙伴,联合发起全球AIGC大赛,用万相大模型生成冬奥视频参赛。万相Wan2.6性能出色,在画质、叙事等方面表现成熟,让普通人也能在奥运体验中当主角。

机器之心
算法论文8

Monet:赋予多模态大模型如人类一般的抽象视觉思考能力

文章介绍了Monet模型,它实现了训练MLLM直接在连续隐空间思考的方法,内化视觉思考能力。还阐述了多模态模型隐式推理训练的难,提出SFT+RL训练框架,构建数据集,经测试,Monet提升了视觉推理能力。

机器之心
新闻资讯8

OpenAI的开源,补全了亚马逊科技模型生态的最后拼图

8月5日OpenAI上线两款开源模型,亚马逊科技随即在旗下平台上线。此前微软借合作优势使Azure高速增长,如今OpenAI开源,亚马逊科技模型生态更丰富,其产品受客户好评,增长势头难挡。

InfoQ
开源动态8

紫东太初开源视觉神经增强方法,即插即用终结多模态幻觉 | ACL 2025

中科院自动化所等团队提出VHR方案,通过“视觉神经增强”机制放大模型视觉关键注意力头输出,降低幻觉现象。此前主流方法多作用于最终输出阶段,VHR深入干预内部机制,还介绍了SSL语义引导方法。

量子位
算法论文8

首次综述「边-协同计算」,分布式智能与模型优化的最新进展

边缘 - 协同计算整合边缘节端资源,解决传统计算问题。最新综述论文系统梳理其架构设计、模型优化等方面,提出统一框架,还指明未来研究方向,如大语言模型部署、6G整合等。

新智元
开源动态8

18K+标星!视觉AI驱动的浏览器自动化,告别XPath,无惧网页改版!

网页自动化常遇页面更新脚本报废等难题,而开源工具Skyvern不走传统XPath/DOM路子,用视觉+大语言模型理解网页,能自适应改版,功能丰富,安装运行简单。

开源星探
算法论文8

最新视觉大模型 DINOv3论文精读(逐段解析)

DINOv3是突破性自监督视觉基础模型,其创新围绕数据与模型协同扩展、Gram锚定技术、多阶段训练策略。它解决传统自监督学习难题,在多任务上无需微调达最优,为计算机视觉树立新标杆。

机器学习AI算法工程
新闻资讯7

GLM-5.3你来定!智谱唐杰全球征集意见,评论区清一色:视觉

清华教授、智谱唐杰在𝕏征集GLM下个版本意见,浏览量达40w+。此前他有求必应,网友热情参与。这次评论区多要视觉能力,因GLM-5.2是纯文本模型,而对手多为多模态。

量子位
产品应用8

手机“自动驾驶”时代来了,智谱还让手机拥有“替身”

作者参加智谱AutoGLM新版本闭门会并试用,该版本亮多,如成全球首个手机通用Agent,操作在设备运行,全平台覆盖等。手机Agent能力稳定高效,能处理多类任务,还可助老人等群体用手机。

歸藏的AI工具箱