「自动化数学证明」共找到 1071 篇相关文章
SPIRAL:零和游戏自对弈成为语言模型推理训练的「免费午餐」
新加坡国立大学等机构团队提出 SPIRAL,让模型在零和游戏自对弈强化推理,摆脱人工监督。研究发现游戏可培养推理能力并迁移到数学,还开发系统保障训练,虽有局限但为 AI 发展指明方向。
不再止步于自然语言!PhiZero让世界模型学会「物理语言」
PhiZero由中科院自动化所团队研发,探索让AI读懂真实世界运动、交互与变化的“物理语言”。它构建Reason - then - Render框架,经大量数据训练,在多基准测试中表现领先,为AI理解物理世界开辟新通道。
两个LLM互相对线,推理能力起飞:康奈尔团队发布大模型版类GAN训练法
康奈尔大学团队提出面向大语言模型的类GAN训练框架PasoDoble,通过对抗训练两模型提升推理能力,不依赖外部监督,在多模型实验中显著提升数学基准表现,不过在部分领域外任务有局限。
VLA统一架构新突破:自回归世界模型引领具身智能
北京智源研究院联合中科院自动化所提出 UniVLA 全新 VLA 模型架构,基于全离散、自回归机制建模多模态信号,后训练引入世界模型。它刷新多项基准纪录,在真机操控和自动驾驶有潜力,为多模态感知决策融合带来新思路。
POF|清华大学张宇飞团队:采用数据驱动湍流模型的三维增升装置模拟
传统RANS方法预测分离流动有挑战,数据驱动湍流模型泛化性能有局限。清华大学张宇飞团队研究其在复杂三维增升装置应用,验证SST - CND模型泛化能力及修正项迁移能力,证明其可用于真实工程流动问题。
8B模型任务击败GPT-5?阶跃星辰开源Deep Think新框架,小模型解锁百万Token测试时计算
阶跃星辰推出并行协同推理框架PaCoRe,让大模型突破上下文窗口和处理速度限制。基于此框架,小模型能解锁百万级Token测试时计算。PaCoRe - 8B在数学基准测试中超越GPT - 5,还具备前沿性能、“综合”能力涌现等优势。
Nature公开谷歌IMO金牌模型技术细节!核心团队仅10人,一年给AI编出8000万道数学题训练
谷歌DeepMind的IMO金牌模型AlphaProof技术细节公开。团队规模小,核心成员是IMO金牌得主。它把数学证明当游戏,用30亿参数模型和改进树搜索算法。训练难题靠自动形式化解决,赛场用TTRL突破,已开放使用。
完全相信 AI 代码的 Uncle Bob,坦诚这条路还没走通
在AI代码普及当下,Uncle Bob放弃人工评审代码,搭建管控框架引争议,Grady Booch反对,认为AI无法替代资深工程师。Uncle Bob设强约束体系,虽有成效但自动化架构规划未达理想,还给出开发建议。
人类已成少数派!DeepMind 研究科学家:广告没人看了,互联网上AI的流量已经超过了真人
Google DeepMind高级研究科学家Nenad Tomašev预测,未来世界主要网民将是智能体。他指出智能体虽能自动化工作,但存在安全风险,如认知单一化、网络陷阱等,还探讨了协作模式、安全防护及未来形态。
VL-LN Bench:模拟「边走边问找具体目标」的真实导航场景
上海人工智能实验室等研究者完成VL - LN Bench,模拟真实导航场景。它构建自动化数据收集管线,依托InternVLA - N1训练评测。结果显示主动对话可提升表现,但当前方法在实例感知对齐等环节有短板。