开源动态8
阿里VRAG - RL框架性能飙升30%
开源星探
AI 摘要
阿里通义实验室:推出VRAG - RL框架,解决传统RAG视觉处理难题。通过创新机制提升视觉语言模型性能,在多数据集表现佳,后续将向更拟人化和低幻觉方向发展。
阅读原文 · 开源星探
阿里通义的视觉RAG革命!VRAG-RL:基于强化学习的视觉感知RAG框架,性能飙升30%
阿里巴巴通义实验室推出VRAG - RL,融合视觉感知、多模态推理与强化学习,已在GitHub开源。它破解传统RAG处理视觉数据难题,通过创新机制提升性能,在多数据集表现出色,还将向更拟人化和低幻觉方向发展。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
算法论文8
阿尔伯塔大学:FAME破解强化学习遗忘难题
阿尔伯塔大学强化学习团队提出FAME框架,解决持续强化学习“学新忘旧”问题。团队先定义基础概念,将知识整合写成优化问题,再受人类学习机制启发设计FAME,实验优势明显。研究还探讨持续学习的产业价值。
AI科技评论
算法论文8
EASE:给多模态RLVR装「视线校正器」
强化学习与可验证奖励提升视觉语言模型推理能力,但存在答案奖励只知对错、不知证据区域问题。哈工大等团队提出EASE,把标注证据区转为目标分布,监督空间注意力,推理无额外标注,实验成绩优异。
机器之心
新闻资讯7
谷歌发布Gemini 3.8,小模型性价比称王
谷歌发布Gemini 3.8 Flash及专攻网络安全的3.8 Flash Cyber。前者性价比高,在多项测试逼近顶级模型;后者在网络安全测试屠榜。但谷歌也被指提前庆祝,且模型可能有‘刷榜’成分。
新智元
算法论文8
NTU团队研发Facet - 0助力精密装配
新加坡南洋理工大学PINE Lab团队研发Facet - 0机器人基础模型,用于精密装配。它在五项计算机装配任务中平均成功率达82%,能让机器人理解接触状态、判断对错并改进。通过多阶段训练,降低人工干预率,提高失败恢复率。
机器之心