开源动态8
SFE评测:主流多模态LLM科研水平不及格
机器之心
AI 摘要
上海人工智能实验室推出SFE评测基准,评估多模态大模型科学能力。评测发现闭源模型能力强,不同学科表现有别,模型推理能力提升,还构建SciPrismaX平台促进AI科学评估。
阅读原文 · 机器之心
真实科研水平集体不及格!全新基准SFE给主流多模态LLM来了波暴击
上海人工智能实验室AI4S团队推出SFE评测基准,首创三级评估体系,涵盖五大科学领域66项任务。评测显示主流MLLMs在高阶科学任务有挑战,不同模型、学科表现有差异,还构建了SciPrismaX平台推动AI科学评估生态发展。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
产品应用8
MinerU.Chem:解锁化学文献数据,助力 AI4S
上海人工智能实验室 OpenDataLab 团队发布 MinerU.Chem 技术报告及成果,升级化学文献智能解析能力。它能将化学文献图片转化为 AI 可用数据,解决化学知识机器难用问题,在评测中领先,还将助力 AI4S 发展。
OpenMMLab
新闻资讯7
AI大牛扎堆AI4S,7.5亿估值有风险?
OpenAI前CPO Kevin Weil创业,新公司定位是“为AI模型收集科学数据”的平台,估值达7.5亿美元。AI4S赛道成为硅谷离职AI高管热门去向,正从概念叙事进入基础设施建设阶段,包括数据、模型、应用层。
AI科技评论
产品应用8
百度‘伐谋’:让AI搜索未知解赋能多领域
文章介绍AI科研应用新趋势,从学习已知知识转向搜索未知解。以百度‘伐谋’为例,它助力南京林业大学检测松材线虫病,还在多学科和产业场景中展现价值,百度还启动科学家计划推动其发展。
新智元
算法论文8
RefCaptioner 让视频与参考图精准对应
多模态大模型处理多参考图与视频对应关系能力不足。为此提出 RefCaptioner,强化模型对参考图识别感应能力、优化输出格式与奖励函数;还构建 MRVBench 评测基准,实验显示其表现优异。
机器之心