「AI数学基金」共找到 9829 篇相关文章
推理正确率下降65.5%!斯坦福、MIT等用「不等式」拷问AI逻辑极限
大语言模型在数学证明常现推理漏洞,斯坦福等高校团队提出IneqMath基准评估其严谨性。用不等式证明题切入,拆解为子任务,构建评测体系,用LLM - as - Judge审查。结果显示模型推理正确率低,存在结构性缺陷。
杨立昆亲自指导开源世界大模型,为AI Agent打造超级大脑
今天凌晨,Meta开源世界大模型V - JEPA 2,它用超大规模数据集训练,能让AI Agent理解物理世界。图灵奖得主杨立昆参与开发并推荐。模型经多方面改进,还拓展用于机器人规划和视频问答,效果良好。
陶哲轩重写20年本科经典教材!Lean编程数学证明,GitHub已放出
陶哲轩迷上形式化数学证明,开设YouTube账号分享用Lean形式化证明的视频,还发布开源项目,将经典教材《Analysis I》定义、定理和习题「翻译」成Lean代码,项目可作学习资料,部分内容已完成翻译。
12.4K 标星!开源AI编程神器 Dyad,v0、Bolt的开源平替!
AI 编程领域的 v0、Lovable、Bolt 等平台虽降低开发门槛,但有联网、隐私等问题。开源项目 Dyad 可作其替代方案,支持本地运行、多模型,能与 IDE 等集成,已获 12.4K 标星。
AI能否「圣地巡礼」?多模态大模型全新评估基准VIR-Bench来了
来自日本高校和企业团队提出多模态大模型评估基准 VIR-Bench,用于评测 AI 对旅行视频中地理位置与时间顺序的理解。它将任务拆解,构建数据集,实验显示模型虽有改进但性能远未达标,指明了大模型进化方向。
中美AI竞争的四种未来:OpenAI情报与调查团队指出决胜点
OpenAI情报与调查团队对中美未来几年AI竞争进行推演,指出美国有资本、算力等优势,但面临电力等问题;中国靠国家意志推动,有工业协调等优势。未来博弈有四种结局,决胜看中国算力自救、全球‘朋友圈’和本土市场消化能力。
AI也能换岗了!Anthropic教智能体交接班,不怕长任务断片
Anthropic设计出长时智能体运行框架,让AI跨越数小时任务渐进式推进。其采用双智能体架构,结合环境管理方法,提升全栈Web应用开发稳定性,但仍有通用与多智能体架构选择等开放问题。
开源AI真人级互动老师,多Agent+可视化画布,函数/思维导图实时作图!
本文介绍开源项目ChatTutor,它是可视化互动式AI老师,能边说边画。有数学画布、思维导图等功能,未来将支持代码、物理等画布,可用于解题、备课等,已上线chattutor.app。
追觅CES亮剑:一台AI具身机器人的洗衣革命|甲子光年
2026年CES上,追觅推出首款AI具身洗护机器人,可完成洗衣全流程。它整合多系统,展示新创新逻辑。具身智能分阶段发展,追觅结合制造与技术,欲降低用户洗护成本,但落地仍面临挑战。
数学推理热潮下的冷思考!如何训练真正"全能"的推理模型?
论文评估20余个开源推理模型在多领域表现,发现多数模型数学成功难迁移。揭示微调方法(RL vs SFT)决定能力泛化,SFT像‘填鸭’,RL似‘思维健身’,为构建通用推理智能体提供新路径。