算法论文8
港中文团队:AdaTooler-V让模型学会合理用工具
量子位
AI 摘要
港中文MMLab等团队:当前类o3模型盲目用视觉工具,准确率未同步提升。为此推出AdaTooler-V模型,引入指标、算法和数据集,经多基准测试,该模型能合理用工具,性能优且成本低。
阅读原文 · 量子位
必须得让AI明白,有些不该碰的东西别碰(doge)
近期类o3模型在视觉推理任务表现优异,但陷入‘盲目用工具’状态。港中文MMLab等团队提出AdaTooler-V模型,具备自适应工具使用能力,还引入指标、算法,构建数据集,在多基准测评中优势明显。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
算法论文7
大模型看图能力差,与人类有近 9 倍鸿沟
本文介绍了专门测量「主动观察」能力的视觉推理基准 ActiveVision,评测显示无外部工具时,大模型与人类准确率有近 9 倍差距,用工具后虽提升但仍远不如人类,还说明了其出题与避免取巧的方式。
机器之心
新闻资讯7
陈博远揭秘OpenAI GPT Image 2幕后花絮
OpenAI研究科学家陈博远介绍GPT Image 2官网博客花絮,分享模型训练、测试情况,还展示亲手制作的官网图片,包括中文彩蛋、漫画、杂志页等,体现模型文字渲染、视觉推理等能力。
机器之心
算法论文8
Monet:赋予大模型抽象视觉思考能力
文章介绍了Monet模型,它实现了训练MLLM直接在连续隐空间思考的方法,内化视觉思考能力。还阐述了多模态模型隐式推理训练的难点,提出SFT+RL训练框架,构建数据集,经测试,Monet提升了视觉推理能力。
机器之心
算法论文8
上海交大DENG Lab:LatentUM革新统一模型
上海交通大学 DENG Lab 提出的 LatentUM,尝试让统一模型把生成的视觉内容纳入推理闭环。它在多项任务上超越基线,其核心思路是生成与语言共享语义空间的离散 visual semantic tokens,模型含三大关键设计。
机器之心