算法论文8
北大GENIUS评估生成式AI流体智力
机器之心
AI 摘要
北大团队提出GENIUS评估模型生成式流体智力。实验表明,现有模型晶体与流体智力割裂、预训练知识有阻力,还分析了模型失效原因,并提出免训练校准机制提升性能。
阅读原文 · 机器之心
CL-Bench的故事没有结束,生成式CL-Bench:GENIUS来了
北大团队发布GENIUS,用于评估模型生成式流体智力。它构建含510个样本、20个子任务的评测集,测试模型多方面能力。实验显示当前模型流体智力有短板,还提出免训练注意力校准机制提升性能。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
新闻资讯7
李飞飞押注空间智能,破局之路在哪?
李飞飞押注的空间智能是世界模型主流路线之一,旨在让AI生成可操作三维世界。但当前AI生成世界存在“中看不中用”问题,构建“站得住”的世界面临速度与状态瓶颈,生境科技等实践提供了解决思路。
AI科技评论
算法论文8
SWE - Touch揭示Coding Agent共享协作能力缺口
当前基于大模型的Coding Agent是热门研究方向,现有评测多假设其独占代码仓库。中科院自动化所团队构建SWE - Touch框架,对9个前沿模型测试,发现用户干预下模型性能下降、排名洗牌。
深度学习自然语言处理
推荐文章7
田口善弘:AI成人类威胁说法存疑
文章从非线性非平衡多自由度系统研究视角探讨生成式AI发展态势,对‘规模增大引发相变实现奇点’及‘AI成人类威胁’观点存疑,指出人类智能与AI智能有差异,推荐《智能的真相:AI能替代人脑吗?》。
AIGC开放社区
算法论文7
MLS - Bench评测:AI科研创新能力待提升
新工作MLS - Bench覆盖12领域、140个研究任务,评测前沿模型科研能力。虽模型工程执行强,但科学发现能力弱,当前仍难提出有效算法创新。其评测已纳入Kimi K3和Qwen3.8 - Max官方发版表。
新智元