视觉大模型」共找到 9268 篇相关文章

算法论文8

LeCun有了新证据!模型思考与人类思考存在本质差别

Yann LeCun参与的研究用信息论揭示语言模型与人类在‘理解世界’上的本质差异。研究引入新量化框架,分析主流模型,发现AI与人类在‘理解’上有三核心差异,对当前AI发展趋势提出挑战。

AI工程化
开源动态8

超越纯视觉模型!不改VLM标准架构,实现像素级深度预测

Meta开源DepthLM,首证视觉语言模型不改架构就能媲美纯视觉模型的3D理解能力。通过视觉提示等创新策略,它精准完成像素级深度估计等任务,为多领域带来前景。

新智元
算法论文8

ICCV 2025 | 清华&腾讯混元X发现「视觉头」机制:仅5%注意力头负责多模态视觉理解

本文聚焦多模态模型,提出基于 OCR 任务量化注意力头视觉偏好的方法,发现仅不到 5%“视觉头”主导视觉理解。还提出 SparseMM 策略优化 KV - Cache 资源分配,经多基准评测,性能和效率表现优。

机器之心
算法论文8

伯克利联手“拷问”模型:最强Agent也才40分!新基准专治“不听话”的AI分析师

与伯克利团队推出IDA - Bench新基准,模拟真实数据分析场景,解决现有基准无法评估模型在动态交互中可靠性的问题。测试显示,顶尖模型成功率最高仅40%,不同模型还暴露多种问题。

量子位
算法论文8

ACL 2025 | 指令遵循不能仅靠常识?GuideBench 揭示模型如何“踩雷”领域指南规则

这篇ACL 2025主会论文聚焦提升智能体指南规则遵循能力。提出评估基准GuideBench,涵盖7类1272个任务。实验显示多数主流模型指令遵循能力不佳,尤其数学推理挑战,为模型迭代提供评估基准。

深度学习自然语言处理
开源动态8

企业级OpenClaw最强拍档来了!万亿参数的国产多模态模型,刚刚开源发布

YuanLab.ai团队开源源Yuan3.0 Ultra多模态基础模型,是万亿级开源多模态模型之一。它优化训练效率,在多任务表现突出,为企业Agent AI提供支撑,还提出新算法和训练策略,全面开源推动落地。

量子位
算法论文8

ICLR 2026|多模态模型真的理解情绪吗?MME-Emotion给出了系统答案

多模态模型迅速发展,但能否理解人类情绪存疑,且缺乏系统性评测框架。香港中文学和阿里通义实验室团队提出 MME - Emotion 评测基准,评测 20 个主流模型,发现模型情感智能不足,为后续研究提供参考。

机器之心
开源动态8

无损加速视觉语言模型推理!轻松剪掉视觉冗余Token|腾讯AI Lab

多图像、长视频让视觉语言模型推理成本暴涨,成算力瓶颈。腾讯AI Lab联合CMU提出VScan,通过两阶段视觉token筛选机制,在几乎不损性能的前提下实现推理加速,且已在GitHub开源。

量子位
产品应用8

Kubernetes环境中作业帮模型服务流量调度优化实践

随着语言模型应用渐广,Kubernetes 现有 Ingress 组件在模型服务流量管理上有局限。作业帮提出创新调度方案,整合成模型网关,具备五项核心功能,提升了资源效率、稳定性和易用性。

InfoQ
新闻资讯8

阿里刚投的AI明星,3D模型那种

通用人工智能公司VAST宣布完成5000万美元A轮融资,由阿里、恒旭资本联合领投。其自研3D基础模型领先,发布全新AI 3D模型家族。2025年重点研发世界模型,2026年将加速建设UGC互动内容平台。

量子位