数学评测」共找到 952 篇相关文章

算法论文8

Auto-Research「终极大考」:新基准撕下大模型科研伪装

来自多所高校的研究者提出MLS - Bench,用于解决现有Auto - Research评测的归因问题。它含140个真实研究任务,校准受控修改范围,主实验显示当前模型在方法发现上有明显缺口,Auto - Research需更严格评测标准。

机器之心
8

字节Seed数学新模型,SOTA了

字节发布全新复杂数学解决模型Seed-Prover,全面超越谷歌AlphaGeometry2,在MiniF2F数据集达100%正确率。它采用引理式证明,集成几何推理引擎Seed-Geometry,还展现了卓越泛化能力。

量子位
新闻资讯8

Gemini证明数学新定理!全程没联网

Gemini内部数学版学霸模型FullProof全程不联网,帮数学家证明代数几何领域新定理,即0亏格映射到旗簇空间的motivic类等价结论。它埋下关键思路伏笔、独立给出反例,比Macaulay2更优。

量子位
开源动态8

多模态Deep Research,终于有了「可核验」的评测标准

俄亥俄州立大学与 Amazon Science 等联合发布 MMDR - Bench,将多模态 Deep Research 评估拉到可核验标准。它含 140 个专家任务,覆盖 19 领域,把评估拆成 3 段管线、12 指标,强调过程证据链。

机器之心
新闻资讯8

菲尔兹奖得主:AI现在主要靠「抬杠」突破重大数学猜想

1998年菲尔兹奖得主Gowers发现,最近AI在数学界的轰动突破,如雅可比猜想、Erdős单位距离猜想等,多靠“找反例”实现。他指出AI热衷此,因知道得多且试得起,但目前缺“嗅觉”。

量子位
开源动态8

103K「硬核」题,让大模型突破数学推理瓶颈

现有大语言模型在数学推理训练时面临数据瓶颈,腾讯AI Lab与上海交大团队推出DeepMath - 103K数据集。它规模大、难度高、数据新颖、严格去污染,让DeepMath系列模型达SOTA,还能实现推理泛化。

机器之心
开源动态8

世界模型评测的最大盲区,被这个新基准捅破了

过去一年,‘世界模型’成视频生成领域热词,厂商强调产品要模拟真实世界运行规律,但业界评测一直未能精准检验其‘物体恒存’的认知能力。为此,研究者提出新基准MemoBench,测试了主流模型,揭示其短板。

机器之心
新闻资讯8

刚刚,GPT-5首次通过「哥德尔测试」!破解三大数学猜想

GPT - 5首次通过「哥德尔测试」,破解三大组合优化猜想。研究由海法大学和思科主导,团队设计五项测试任务,GPT - 5在三个简单问题上近乎完美,还推导出不同解法,标志AI从「学习数学」迈向「做数学」。

新智元
新闻资讯8

谷歌Gemini 3杀疯了!陶哲轩亲测:10分钟干翻百年数学难题

Gemini 3本周一发布后开启横扫基准测试之旅。在FrontierMath基准测试创纪录,Epoch能力指数超GPT - 5.1。陶哲轩用Gemini Deepthink十分钟解决埃尔德什问题关键证明,同时它还霸榜物理基准测试CritPt。

新智元
算法论文8

DeepMind爆火论文:向量嵌入模型存在数学上限,Scaling laws放缓实锤?

DeepMind一篇关于向量嵌入局限性的论文在AlphaXiv爆火。其证明向量嵌入有数学上限,Scaling laws或放缓。研究构建LIMIT数据集,测试发现即便是先进嵌入模型也难解决简单任务,揭示了RAG系统约束,让人反思Scaling Laws边界。

机器之心