数学竞赛基准」共找到 1337 篇相关文章

新闻资讯8

刚刚,Claude独立攻克图论猜想,仅用31步!算法祖师爷高德纳震惊发文

Claude Opus 4.6仅用31步独立攻克图论猜想,算法祖师爷高德纳震惊发文,认为需重新评估生成式AI在数学研究中的作用。这标志着AI在自动推理和解决创造性问题上达到新里程碑。

新智元
算法论文8

ICLR 2026 | LongHorizonUI:让 GUI 智能体不再"半途而废"——面向长链路任务的统一鲁棒自动化框架

近年来,基于多模态大语言模型的GUI智能体在自动化操作上虽有进展,但任务步数超10 - 15步时成功率断崖下跌。研究人员提出LongHorizonUI框架,构建LongGUIBench评测基准,推动GUI自动化在复杂场景落地。

机器之心
新闻资讯7

OpenAI夺金IOI,但输给3位中国高中生

OpenAI官宣其推理模型在今年IOI线上竞赛中成绩刷新纪录,总分533.29,全球330名人类选手中排第六,AI参赛者中居首。不过其没比过三位中国高中生。此前OpenAI称模型获IMO金牌引争议,此次网友更谨慎。

量子位
推荐文章8

被轻视的巨大市场,大厂做不好的Local Agent为何难?| 甲子光年

文章指出大模型边际收益递减,AI竞赛规则生变,产业从‘参数竞赛’转向‘效率革命’。本地Agent有潜力,但主流产品体验差。GreenBitAI深耕低比特模型,推出Libra,有望撬开万亿美元增量市场。

甲子光年
开源动态8

Agent记忆赛道大洗牌!LoCoMo-Refined重磅发布,主流记忆框架迎来核心检验

南京大学与上海人工智能实验室联合推出 LoCoMo-Refined,这是严苛的 Agent 记忆评测基准。它指出当前记忆评测基准有两大漏洞,在其标准下主流记忆框架得分普降,且相关数据集和评测脚本已开源。

AI科技评论
新闻资讯7

抢天才还是拼算力?前 Llama 推理负责人详解 AI 的真实天花板

前 Llama 推理负责人 Ross Taylor 在播客访谈中指出,AI 竞赛中的混乱和挖角是噪声,最终会被指数级算力淹没。他阐释了算力指数曲线决定竞赛天花板,强调系统性实验、高质量评估的重要性。

机器之心
新闻资讯8

17岁高中生用AI解决数学界难题,陶哲轩、Jeff Dean点赞

17岁高中生 Enrique Barschkis 课间休息时解决埃尔德什第347号问题,引发热议获 Jeff Dean 盛赞。他在陶哲轩等人思路基础上完成证明,用 AI 工具将证明形式化,成果获数学社区认可,标志数学研究进入新阶段。

机器之心
算法论文7

VaseVQA:考古领域实现专家级,诊断+补弱RL框架

在文化遗产与人工智能交叉领域,研究人员提出把大型多模态模型放于‘诊断—补弱—精细化评估’闭环训练,配套结构化评测基准,让模型在文化遗产领域接近专家级能力。介绍了技术步骤、数据基准及关键发现等。

新智元
新闻资讯8

震撼!OpenAI神秘模型连破6道前沿难题,奥特曼:AI在造「新知识」

OpenAI首席科学家爆料,其神秘内部模型一周攻克10道未发表顶尖数学难题中的6道。First Proof团队用公开模型测试,结果冷峻。虽OpenAI实际命中率或低于宣称,但AI解前沿题意义重大,也暂无法取代数学家。

新智元
算法论文8

大模型顿悟原理!Meta新论文说清楚了

Meta超级智能实验室(FAIR)最新论文把大模型顿悟(grokking)现象的数学机制说清楚了。提出Li2数学框架,将两层神经网络的grokking动态分三阶段,还推导了泛化缩放定律等。

AI工程化