算法论文8
MMSciBench揭示AI理科推理能力短板
深度学习自然语言处理
AI 摘要
耶鲁、复旦等推出MMSciBench评测AI科学推理能力,发现主流模型处理图文混合问题差,推理错误是主因,且英文推理或更有效,未来需提升多模态理解和逻辑推理能力。
阅读原文 · 深度学习自然语言处理
AI"学霸"也解不出高中题?耶鲁、复旦发布MMSciBench,揭示AI理科推理能力短板
耶鲁、复旦等推出MMSciBench评测基准,揭示主流模型复杂科学推理短板。它有高质量数据、多模态多题型测试和精细知识分类体系。测试发现模型图文融合及推理能力弱,英文推理或效果更好。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
推荐文章8
前英伟达工程师:AI 终局是后台 Agent
前英伟达工程师、Sail Research 创始人 Neil Movva 认为当前 AI 行业陷“延迟陷阱”,AI 终局应是后台 Agent。他执行“算力拾荒者战略”,想降低智能成本,还指出 Transformer 架构有缺陷,互联网数据被吃光等问题。
AI科技大本营
新闻资讯8
比尔·盖茨:AI已跨过临界点引担忧
比尔·盖茨在与《麻省理工科技评论》的采访中表示,AI在多方面已跨过临界点,但行业外缺乏讨论。他警告生物恐怖主义风险,提出‘人类保留岗位’、征税等政策设想,也看好AI在部分领域价值。
DeepTech深科技
产品应用7
HarmonyOS腕上健康应用:机遇与鸿沟并存
文章聚焦HarmonyOS穿戴应用,如「小卡健康」将健康记录入口移到手表,还介绍「开练」「凯格尔运动」应用。阐述了从接口到产品需解决权限、断连等问题,强调要为用户提供合适体验。
AI前线
新闻资讯7
AI公司挑战训练物理通用模型
近日,AI初创公司Accelerated Understanding亮相,由Anima Anandkumar夫妇创立。它未随主流,目标是训练模拟物理现象的通用AI模型。该模型处理数据规模大,公司想解决AI验证瓶颈,产品面向科研工程机构。
DeepTech深科技