「国际数学奥林匹克竞赛」共找到 488 篇相关文章
哈工大、中科院等利用模型“潜意识”提高推理模型效率,0.6B撬动复杂推理
哈工大、中科院等提出TrajSelector框架,让推理模型‘倾听内心独白’。它利用模型隐藏状态,用0.6B轻量级验证器实现比7B裁判模型更精准选择,在数学竞赛基准测试中表现出色,还能离线筛选数据,但在开放域问答有难题。
大模型刷数学题竟有害?CMU评估20+模型指出训练陷阱
CMU团队评估20多个大模型,发现只有强化学习(RL)训练的模型能将数学推理技能广泛迁移到其他任务,监督微调(SFT)训练的模型迁移有限甚至无迁移。研究还探索差异原因,表明RL微调更具优势。
Reasoning模型可以Self-Train!
当前大模型依赖人类标注数据,成本高且扩展难。论文探讨模型自我纠错、自主进化可能,提出自我奖励训练(SRT),用投票共识代替人类标注。在数学数据集上有效果,但高难度数据集出现问题,作者给出解决办法并开源代码。
悬赏5000刀!148局AI斗蛐蛐世界杯官方战报出炉,全球赛邀你接棒来战
淘宝举办AI大模型斗蛐蛐世界杯,将12个顶尖模型放同一Agent框架,在12人局技能狼人杀场景对战150局。截至148局,谷歌两模型暂居前二,Qwen3-Max-2026-01-23排第三。还开启WhoisSpy国际赛,开发者可参与,前十有奖励。
中文版Nano Banana来了?Qwen-Image-2.0炸场:1K长文本硬吃,中文生图彻底不拧巴了
AI生图曾有文本长易糊、指令复杂就出错、中文渲染差等问题。阿里新发布的Qwen-Image-2.0能处理1K token长文本,理解复杂指令,中文渲染佳,还能多图编辑,国际评测表现也靠前,阿里云百炼已开通API邀测。
AI首次拿下IMO官方满分金牌,背后藏着一套自我纠错机制
在第67届国际数学奥林匹克(IMO 2026)上,小红书的「dots-note-3.0」成为首个获官方满分金牌的AI模型。它解题时自我检查修正,有自主探索能力。之后模型要应对生活中长周期、多变任务的挑战。
先进封装补完计划
2024年美国众议院点名批评美资对盛合晶微投资,后将先进封装列为投资禁区。盛合晶微由中芯国际和长电科技合资成立,攻克硅中介层难题。AI芯片变大使台积电产能紧张,盛合晶微为国产芯片提供新选择。
IMO题库“过时”了!OpenAI内部模型挑战最新First Proof,做了7天错了一半
谷歌发布Gemini 3 Deep Think爆火后,OpenAI用未发布内部模型,一周内尝试解答10道来自数学家科研现场的真实问题,5道基本正确。这些题取自真实研究,切断模型“背答案”可能,意味着自主推理能力进化。
科学能力太强,这个多模态推理「六边形战士」被严重低估!Intern-S1开源登顶
7月26日,上海AI实验室发布并开源「书生」科学多模态大模型Intern-S1,其多模态能力全球开源第一,文本能力比肩一流,科学能力国际领先。它开创「通专融合」新范式,重构科研生产力,引发国际关注。
一个「流浪」数学家的遗产,正在被AI公司疯抢
2026年,OpenAI等公司用AI解决多个匈牙利数学家Paul Erdős提出的问题,震动数学界。这些问题分布广、难度跨度大,适合模型测试。不过,AI证明的验证和人类数学家地位受关注。