算法论文8
微软x清华:BiPS让AI看图又全又准
量子位
AI 摘要
微软亚洲研究院与清华提出BiPS,不在推理时临时提示,而是在训练阶段让模型学会带着问题看图。通过‘一拉一推’机制,用13K图表样本微调模型,在8个基准测试中性能显著提升。
阅读原文 · 量子位
AI看图一本正经胡说八道?「一拉一推」让模型看得全又准|微软x清华
随着视觉 - 语言模型(VLM)推理能力增强,‘看错’问题凸显。现有方法有局限,微软亚洲研究院与清华提出BiPS,从训练阶段重塑模型‘看图方式’,通过‘一拉一推’机制让模型‘看全又准’,实验效果显著。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
新闻资讯7
微软发布Agent Framework相关组件
2026年4月2日微软发布Agent Framework 1.0版本,Build 2026大会上相关组件进入稳定发布阶段,后Harness和Foundry Hosted Agents正式发布,解决构建和运行时问题,还介绍其功能、优势等。
InfoQ
开源动态8
微软开源 Skill 神器,让 AI 学会干活
近期微软开源桌面应用 `Skill Recorder`,1个多月揽3K star。它能录屏幕操作,借助 GitHub Copilot CLI 生成可复用 Skill 或 Automation,与 RPA 思路不同,有泛化能力,可按命令快速安装。
开源先锋
新闻资讯7
微软叫停Tokenmaxxing,严控AI使用成本
从今年7月起,微软为各业务部门设「AI Token预算目标」,将GPT - 5.6设为内部默认模型。此前Tokenmaxxing风靡硅谷,如今大厂纷纷收紧AI使用,微软是最后跟进者之一。
量子位
产品应用7
Anthropic发布Claude Opus 5,性能亮眼
Anthropic发布Claude Opus 5,这是款视觉 - 语言模型,运行成本低,多任务表现优于Claude Fable 5。它在多项测试中领先,解决了Fable 5的一些问题,但也有易产生幻觉等不足。
DeeplearningAI