「点云视觉」共找到 1842 篇相关文章
阿里云CIO首次系统复盘:大模型落地的RIDE方法论与RaaS实践突破
阿里云智能集团 CIO 蒋林泉分享大模型落地实践,介绍了阿里云在翻译、智能外呼等场景的应用案例,提出 RIDE 方法论,包括重组组织、识别机会、定义指标和推进执行,还分析了翻译和 Agent 模式的要点。
阿里开启 Token 战略,喊出云+AI 年收入破千亿口号,底气从哪来?
3月19日晚,阿里在财报电话会提出未来五年云与AI商业化年收入破1000亿美元目标。过去三月,阿里云Token消耗涨6倍,自研芯片交付47万片,还提价。其正从‘用户红利’转向‘Token经济’,有望‘量价齐升’。
生图效果媲美GPT-4o,一键搞定各类视觉生成任务丨港科广&字节全新框架
港科大(广州)和字节联合推出开源框架ComfyMind,它是通用视觉生成框架,能统一处理主流视觉生成任务。其性能超现有开源方法,媲美GPT - 4o - Image,还介绍了架构、接口等及性能评估情况。
刚刚,首个空间原生的具身视觉基模开源!机器人更会看我们的世界了
蚂蚁灵波发布并开源了面向机器人真实任务的空间原生视觉基模 LingBot-Vision 及空间感知模型 LingBot-Depth 2.0,能让机器人更精准地感知世界,解决透明反光材质、小目标和远距离目标等视觉难题。
阿里云通义点金发布DianJin-R1金融领域推理大模型,32B模型荣膺榜首
阿里云通义点金团队与苏州大学合作推出DianJin-R1金融领域推理大模型,介绍其开源数据集与模型、基于通义点金平台的数据合成,展示了其在性能测试中的优异表现,推动金融科技智能化进程。
上海AI Lab、浙大EagleLab等提出RRVF:利用「验证非对称性」,只输入图片学习视觉推理
上海AI Lab、浙大EagleLab等联合完成研究,提出RRVF框架,利用「验证非对称性」,仅输入图片学习视觉推理。它构建闭环系统,通过迭代推理、视觉反馈等步骤训练模型,实验显示效果佳,证明验证法则力量。
从视觉出发统一多模态!颜水成团队最新研究:不再把图像编解码器塞进LLM|ICLR'2026
NVIDIA研究员Jim Fan称AI正经历第二次预训练范式转移。颜水成团队Muddit模型从视觉先验出发,用离散扩散框架统一文生图、图生文和VQA,挑战多模态“语言中心论”,在多任务表现出色。
东方理工团队提出HiDrop:重构MLLM计算路径,压缩90%视觉Token实现2.2倍加速
东方理工大学沈晓宇团队提出HiDrop,基于MLLM不同层功能差异,设计出延迟注入、凹金字塔式剪枝和提前退出的视觉Token压缩策略。实验显示,它能压缩约90%视觉Token,保持98.3%性能,实现训练和预填充加速。
CVPR 2026 Workshop征稿|从感知到推理,ViSCALE 2.0 邀你重塑计算机视觉的 System 2
2026年6月,CVPR第二届计算机视觉推理扩展研讨会(ViSCALE 2026)将在美国回归。由顶尖机构学者联合举办,将汇聚顶尖学者探索视觉模型突破瓶颈之法。会议亮点多,还开启论文征稿,欢迎积极投稿。
是「福尔摩斯」,也是「列文虎克」,智谱把OpenAI藏着掖着的视觉推理能力开源了
智谱开源视觉推理模型 GLM-4.5V,还同步开源桌面助手应用。此模型视觉推理能力强,在图像识别、视频理解、前端复刻、图表处理等多方面表现出色,技术创新使其达开源 SOTA 水平,推动行业注重实用价值。