算法论文8
沪高校团队方案提升MLLM推理泛化能力
机器之心
AI 摘要
上海交通大学等团队针对MLLM推理难题,提出“以形式化增强非形式化推理”方案。构建TrustGeoGen、GeoBench、SGVR,提升模型推理能力,实现跨域泛化,未来将拓展至更多领域。
阅读原文 · 机器之心
从平面几何出发:形式化验证如何驱动MLLM的推理能力跃迁
多模态大语言模型在复杂数学与几何推理中有缺陷,现有训练方式让模型难有鲁棒推理能力。上海交大等团队提出“以形式化增强非形式化推理”方案,构建完整闭环,提升模型推理及泛化能力。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
开源动态8
Specula:数小时揪出开源系统382个深层bug
截至2026年8月19日,Specula已在67个开源系统找出382个bug。它让coding agent自动生成TLA + 模型和正确性不变量,运行检查并复现问题,将数月的形式化验证缩短到几小时,降低了形式化方法使用门槛。
机器之心
新闻资讯7
数学家被AI“逼退”,投身验证领域
顶尖数学学者Rishikesh Gajjala靠AI攻破博士课题,却宣布退出学术圈。他认为AI生成证明虽精巧但难验证,“漂亮证明未验证和垃圾无异”。他投身形式化验证领域,而AxiomProver完成“246定理”形式化验证。
新智元
产品应用8
Claude Opus 5:低价高编码能力之选
Anthropic 发布 Claude Opus 5,定价与 Opus 4.8 相同,价格是 Fable 5 的一半。它在编码、知识工作和推理上表现出色,虽有不足,如速度慢、幻觉率较高,但提供多种 effort 等级,成本低,安全对齐性好。
AI工程化
新闻资讯7
国产3B小模型编程能力比肩大模型
最近,3B小模型VibeThinker - 3B在X上火了,它在编程等推理任务上比肩前沿大模型,体积却小很多。它是国产模型,来自新浪微博团队,在各项基准测试表现出色,不过在通用知识领域表现欠佳。
机器之心