算法论文8
视觉规划:图像推理新范式
机器之心
AI 摘要
剑桥等团队:现有 MLLM 处理视觉信息有局限,提出视觉规划范式及 VPRL 框架。实验表明,视觉规划在视觉任务中优势明显,强化学习能提升性能,且复杂度提升时保持稳健。
阅读原文 · 机器之心
只用图像也能思考,强化学习造就推理模型新范式!复杂场景规划能力Max
现有 MLLM 依赖文本处理视觉信息,会造成信息丢失。剑桥、伦敦大学学院、谷歌团队提出视觉规划范式,以强化学习框架 VPRL 提升模型规划能力,实验显示其性能优于文本规划。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
算法论文8
北大团队推MathDebugger,提升合成数据质量
随着合成数据增多,模型需判断数学数据题目能否被信任。北大DCAI团队提出MathDebugger质检BenchMark,覆盖问答两端,评测主流LLM和PRM。还探究能否判断正误、分类错误、修复数据,证明错误标签可作监督信号。
InfoQ
算法论文8
阿尔伯塔大学:FAME破解强化学习遗忘难题
阿尔伯塔大学强化学习团队提出FAME框架,解决持续强化学习“学新忘旧”问题。团队先定义基础概念,将知识整合写成优化问题,再受人类学习机制启发设计FAME,实验优势明显。研究还探讨持续学习的产业价值。
AI科技评论
新闻资讯7
Google发布Gemini 3.8双版本抢智能体入口
9月2日,Google发布Gemini 3.8 Flash和Gemini 3.8 Flash Cyber。前者用于编程等,已稳定上线;后者专用于发现修复漏洞,仅向特定方开放。二者共享基础能力,采用不同安全限制和部署环境。
AIGC开放社区
新闻资讯7
谷歌发布Gemini 3.8,小模型性价比称王
谷歌发布Gemini 3.8 Flash及专攻网络安全的3.8 Flash Cyber。前者性价比高,在多项测试逼近顶级模型;后者在网络安全测试屠榜。但谷歌也被指提前庆祝,且模型可能有‘刷榜’成分。
新智元