视觉语言对齐模型」共找到 1764 篇相关文章

产品应用8

首款推理具身模型,谷歌DeepMind造!自主理解/规划/执行复杂任务,打破一机一训,还能互相0样本迁移技能

谷歌DeepMind发布新一代通用机器人基座模型Gemini Robotics 1.5系列,由GR 1.5和GR - ER 1.5组成,结合视觉语言与动作,实现“规划 + 执行”闭环,还提出Motion Transfer机制,能跨机器人迁移技能。

量子位
开源动态8

给几何图片写标题就能让AI更聪明,UIUC发布高质量可泛化几何数据集

随着多模态大语言模型在视觉问答等任务广泛应用,其几何推理能力成研究热点。现有方法泛化能力有限,UIUC团队提出Geo - Image - Textualization框架,发布GeoReasoning - 10K数据集,提升模型几何推理表现。

机器之心
算法论文8

5700问答对全面评估拷问AI空间感!最新空间智能评测基准来了丨浙大&成电&港中文

当前视觉语言大模型空间信息学习片段化,缺乏多维度空间推理能力。浙大、成电和港中文团队提出ViewSpatial - Bench基准体系,评估主流模型,揭示其缺陷,并开发MVSM优化跨视角空间理解。

量子位
产品应用8

132万字实时字幕!阿里语音模型支持影视飓风100小时直播

阿里升级实时语音识别大模型Fun-ASR-Realtime,首字延迟在百毫秒级别、识别准确率接近离线模型。在影视飓风100小时直播中表现出色,还支持16种方言和30种语言,离线模型Fun-ASR-Flash全球权威榜单排第一。

千问大模型
算法论文8

从最优传输角度训练奖励模型:让 RLHF 学会「忽略错误偏好」丨ICML 2026

浙江大学、小红书、北京大学等团队提出SelectiveRM,基于最优传输训练奖励模型。它重构训练目标,通过选择性分布对齐排除噪声偏好,解决了奖励模型训练中监督信号不可靠的问题,实验验证其有效且泛化能力好。

AI科技评论
开源动态8

张雪机车燃爆封神!国产2B语音模型重磅开源,全网听完都起鸡皮疙瘩

面壁智能联合多方开发的2B小模型VoxCPM 2于4月开源,支持30种语言与9大方言,能实现声音克隆、情绪控制、音色设计等功能。实测显示其能力出色,还提供全家桶级工具箱,采用独特技术路线。

新智元
新闻资讯8

AI破解500年《纽伦堡编年史》天书!仅用1小时,隐藏惊天真相被揭开

500年前《纽伦堡编年史》中的手写注释难倒人类学者,Gemini 3.0 Pro仅用1小时就给出解读,识别出注释与圣经年代学体系计算有关。它攻克视觉识别、解读缩写、还原历法转换表三大难题,展现惊人能力。

新智元
开源动态8

DeepSeek重磅开源3B OCR模型,一天处理20万页文档!一天内斩获6K标星!

DeepSeek开源3B OCR模型DeepSeek - OCR,参数量仅30亿,单张A100 - 40G一天能处理20万页文档,不到24小时获6K标星。它是视觉压缩引擎,解决大模型处理长文本算力爆炸问题,有诸多技术亮点。

开源星探
算法论文7

OpenAI新幻觉论文惹争议!GPT-5拉胯是测试基准有问题??

OpenAI新论文《语言模型为何会产生幻觉?》提出,模型有幻觉是因标准训练和评估流程倾向奖励“猜对”。GPT - 5不爱猜测,在榜单表现不佳,网友质疑论文是为GPT - 5挽尊,论文引发网友多方向讨论。

量子位
算法论文8

英伟达再出手!新型混合架构模型问世,两大创新实现53.6倍吞吐提速

英伟达研究者提出新混合架构语言模型 Jet - Nemotron,在达 SOTA 全注意力模型精度时效率卓越,2B 版性能超 Qwen3 等,H100 GPU 上生成吞吐量最高加速 53.6 倍,基于 PostNAS 和 JetBlock 两大创新。

机器之心