Lean定理证明器」共找到 348 篇相关文章

开源动态8

RL缩放王炸!DeepSWE开源AI Agent登顶榜首,训练方法、权重大公开

今天凌晨,Together.ai联合Agentica开源AI Agent框架DeepSWE,基于Qwen3 - 32B模型用强化学习训练。所有内容开源,测试中性能超所有开源Agent框架,证明强化学习训练潜力。

AIGC开放社区
算法论文7

让大模型指哪打哪的Multi-Agent路由新范式

随着MCP生态兴起,一个Assistant背后可能挂数百工具/子Agent,传统检索方式有成本高、埋没工具等问题。作者提出Tool-to-Agent Retrieval新范式,实验显示指标全面提升,证明工具细节能补足语义。

PaperAgent
新闻资讯8

陶哲轩:AI 正在让“想法”变得廉价,而真正的瓶颈从未改变

数学家陶哲轩与Dwarkesh Patel访谈,探讨AI在科学发现中的作用。他指出AI让‘想法生成’成本降为零,验证想法成新瓶颈;AI擅长广度,人类擅长深度;AI负责找证明,人类提炼‘理解’与‘智慧’。

力学与人工智能
开源动态7

从“小卡拉米” 杀入 CNCF,创始人却说:HAMi火了,我们每天仍如履薄冰

本文讲述 HAMi 项目从“小卡拉米”到进入 CNCF 孵化阶段的历程。该项目解决 GPU 利用率问题,建立跨厂商生态。密瓜智能围绕其成立,补社区短板。虽 HAMi 成功,但密瓜智能仍需证明商业价值。

InfoQ
算法论文8

Anthropic让9个Claude Agent花5天做出比人类强4倍的对齐成果

Anthropic发表Automated Weak - to - Strong Researcher,用9个并行的Claude Opus Agent组成自动化研究团队,5天就把PGR从人类的0.23提升到0.97,成本约$18,000,证明AI自动化研究可行。

PaperAgent
算法论文7

做过十遍还要从头摸索?Agent 的记忆终于开始长成技能

MemTensor 等机构提出无需训练基础模型的 MSCE 框架,为 Agent 外部经验建‘晋升制度’,让经验成技能。该论文在 EvoAgentBench 与 LoCoMo 测试中结果更好,但在因果证明、模型依赖等方面有不足。

深度学习自然语言处理
新闻资讯8

OpenAI连破10道数学难题,Fable 24小时「复现」5道

这个周末,OpenAI与Anthropic两大AI巨头在数学前沿短兵相接。先是OpenAI用未发布模型Astra证明10项数学成果,不到24小时,Anthropic的Fable复现了其中5项。AI解难题成本降低,成果验证成新考验。

新智元
新闻资讯8

北大数学家终结50年猜想!一只蝴蝶翅膀,竟难倒菲尔兹奖得主

历时50年的「十杯马提尼猜想」被北大Lingrui Ge等学者证明。该猜想连接量子物理和数学,为解「霍夫施塔特蝴蝶」之谜。他们基于「全局理论」找到对偶方程,成果发表在arXiv,还攻克另外两个关键问题。

新智元
新闻资讯8

留给人类数学家的悬赏不多了!谷歌DeepMind一口气解决9道埃尔德什问题

AI进军数学界速度惊人,谷歌DeepMind发布由Gemini驱动的AlphaProof Nexus框架,解决9个埃尔德什开放问题,还证明44个猜想、搞定代数几何难题、改进凸优化理论边界,推理成本低且代码开源。

量子位
新闻资讯8

陶哲轩震撼!数学家1975年埋下的「坑」,被AI和全球网友用48小时填平了

2025年12月,困扰数学界50年的Erdos#1026问题被攻克。陶哲轩宣布,在AI辅助下人类团队仅用48小时就完成证明。传统方法可能需数周甚至数月,AI带来全新理解,生成了新数学洞见。

新智元