新闻资讯8
全球学者打造HLE测试集测AI极限
AIGC开放社区
AI 摘要
人类最后的考试(HLE)测试集登上Nature。它由全球近千名学者打造,含2500道难题。现有评估工具难测AI极限,HLE让顶尖模型成绩惨烈,暴露其短板,也提醒技术演进要找高效算法。
阅读原文 · AIGC开放社区
人类最后考试登上Nature:全球50个国家近千名顶尖学者打造的AI测试集
人类最后的考试(HLE)登上Nature,这一测试集由全球50个国家近千名顶尖学者打造,含2500道高难度试题。现有的人工智能评估工具已跟不上技术演进,HLE能测出AI极限,让顶尖机器暴露短板。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
算法论文8
牛津、NUS 提出心智世界建模新方向
牛津大学和新加坡国立大学研究团队提出心智世界建模(MWM)通用框架,将心智变量纳入世界状态。还实现基准系统 MENTIS 验证其有效性,实验表明 MWM 对预测人类决策必要,瓶颈是状态转移模拟能力不足。
机器之心
新闻资讯7
DeepSeek V4 Pro 发布,撞车马斯克 Grok 4.6
周三晚间,DeepSeek 突然发布 V4 Pro 大语言模型正式版,命名为 DeepSeek - V4 - Pro - 0813,官方未调升 API 使用价格。有用户称调用的 V4 Pro 思维链风格有变,跑分显示其 Agent 评测表现可媲美顶级模型,还撞车了马斯克的 Grok 4.6。
机器之心
算法论文8
港校提出 Libra,Agentic RL 吞吐最高提 3 倍
大语言模型走向“完成任务”,Agentic RL 后训练让系统工作负载不稳定。港中文和恒生大学团队提出 Libra 资源管理系统,统一优化训练与 rollout,在多任务中提升吞吐,论文与代码已公开。
机器之心
算法论文8
TurboVLA:绕开LLM实现高效动作预测
近年来,VLA模型成通用机器人控制重要路线,但模型大、动作更新慢的矛盾凸显。华中科技大学联合华为提出TurboVLA,绕开大语言模型,形成V+L→A路径,降低成本,保持操作能力。
机器之心