新闻资讯7
Gemini夺IMC金牌,AI数学推理时代已至
新智元
AI 摘要
苏黎世联邦理工学院博士生测试Gemini三种模式,在IMC中表现远超普通大学生。研究人员进行结果分析,展现Gemini优势。网友期待更多模型表现,AI数学推理能力日益强大已无法忽视。
阅读原文 · 新智元
Gemini再揽金牌,力压大学学霸,AI数学推理时代来了!
苏黎世联邦理工学院博士生在大学生国际数学竞赛(IMC)测试了Gemini三种模式,其表现远高于金牌门槛,远超普通大学生。研究人员还从模型输出提取见解,展现了Gemini在数学推理上的优势,凸显AI数学推理能力日益强大。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
新闻资讯7
可验证或成AI发展新瓶颈
在AGI Playground 2026圆桌论坛,Axiom Math联合创始人等探讨AI核心问题。提到AI进入生产环境,可验证或成瓶颈,还从长任务智能体、推理基建等多方面深入交流,如模型验证、基建优化等。
Founder Park
新闻资讯8
2026崇礼论坛:AI走进生活大揭秘
2026年9月12 - 13日,2026夏季崇礼论坛将在崇礼·太舞小镇举行,主题为“未来此刻”。有五大看点,包括俞敏洪等探讨AI能力与入口,揭晓“AI NEXT 20”榜单,多场硬件、内容等相关圆桌及产品展示。
甲子光年
算法论文8
Arc 研究所:STATE 模型破解跨细胞预测难题
生物学和药物研发中,因细胞组合庞大,难以全实验验证,且同药在不同细胞效果不同。Arc Institute 团队推出虚拟细胞模型 STATE 及评测套件 Cell - Eval,STATE 预测效果优,但也存在短板。
DeepTech深科技
算法论文8
北大团队推MathDebugger,提升合成数据质量
随着合成数据增多,模型需判断数学数据题目能否被信任。北大DCAI团队提出MathDebugger质检BenchMark,覆盖问答两端,评测主流LLM和PRM。还探究能否判断正误、分类错误、修复数据,证明错误标签可作监督信号。
InfoQ