新闻资讯7
「人类最后考试」:全球AI模型集体不及格
新智元
AI 摘要
新智元报道,AI发展快,现有基准难跟上。全球联盟推出「人类最后的考试」,含多领域难题,当前最强AI准确率不足50%,显示AI在深度专业知识上与人类专家差距大。
阅读原文 · 新智元
MMLU已死?「人类最后考试」登Nature:全球AI模型集体不及格!
AI发展迅猛,现有基准测试难以跟上其步伐。近1000名研究人员组成的全球联盟创建「人类最后的考试」(HLE),涵盖多领域难题,目前最强AI准确率不足50%,凸显AI与人类专家的差距。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
推荐文章7
董舒:AI数字员工催生OPC一人公司
OpenHex董舒认为AI最大价值是替人出面干活,提出数字员工概念。他指出判断力密度高的岗位易被AI取代,中国服务业有发展机会。还辨析数字员工类型,介绍其平台OPS Agent,最后分享了数字员工相关Q&A。
AI科技大本营
新闻资讯7
J-Space让V4 Pro超Fable 5?测试结果翻车!
前两天J-Space凭夸张测试结果刷屏,宣称一份Skill接入Agent环境,能让V4 Pro在多基准大幅提升,部分成绩超Fable 5。但社区复测结果相反,作者未公开完整评测记录,还删质疑帖,引发公开打假。
机器之心
推荐文章8
TypeScript 之父:AI 杀不死老语言,初级工程师不会被取代
前 Meta 资深工程师 Ryan Peterman 对话 TypeScript 之父 Anders Hejlsberg,谈及 TypeScript 编译器从 JavaScript 移植到 Go 的考量,反驳‘AI 将写完所有代码’等论调,指出主流语言地位会因 AI 更巩固,初级工程师不会被取代。
AI科技大本营
产品应用8
祝毅晨团队发布世界仿真器CurrentWorld - 0
Current Robotics团队发布交互式世界仿真器CurrentWorld - 0,创始人祝毅晨履历亮眼。该仿真器能跨本体、多视角、力 - 触觉预测,可用于评测机器人,还能让人类接管以探索不同动作结果。
量子位