算法论文7
MLS - Bench评测:AI科研创新能力待提升
新智元
AI 摘要
新智元报道,MLS - Bench评测显示,前沿模型虽工程执行能力强,但科学发现能力弱,难以提出有效算法创新。当前AI科研不能只靠堆搜索,需独立提出推动AI前进的方法。
阅读原文 · 新智元
代码榜刷满分,AI科研却撞墙?140道真实研究题撕开「自进化」真相
新工作MLS - Bench覆盖12领域、140个研究任务,评测前沿模型科研能力。虽模型工程执行强,但科学发现能力弱,当前仍难提出有效算法创新。其评测已纳入Kimi K3和Qwen3.8 - Max官方发版表。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
开源动态8
ASI - Bench:测AI距自主科研有多远
ASI-Bench是衡量AI系统科学自主性的基准测试,由多机构联合开发。它能测试AI通用智能、创新性和执行力,通过信息梯度设计,让模型在不同指导量下完成科研任务,结果显示当前AI离自主科研有明显距离。
机器之心
产品应用7
Agent:让剪辑产品开启自进化
作者的剪辑产品有了“外部研发部”——Agent。它每天研究新方法、用真实项目测试。作者三步搭建此“研发部”,让其自动查询、测试和汇报,自己负责最终决策,项目获取新方法不再只靠偶然。
AI产品自由
开源动态7
Prime Intellect:开源模型+Harness逼近顶级闭源模型
开源AI基础设施公司Prime Intellect研究表明,借助多智能体Harness,让开源模型负责监控和实现,可让‘AI开发AI’更便宜、效果更好。实验中,Kimi K3搭配Harness逼近Opus 5。
量子位
算法论文8
SWE - Touch揭示Coding Agent共享协作能力缺口
当前基于大模型的Coding Agent是热门研究方向,现有评测多假设其独占代码仓库。中科院自动化所团队构建SWE - Touch框架,对9个前沿模型测试,发现用户干预下模型性能下降、排名洗牌。
深度学习自然语言处理