数学竞赛基准」共找到 1337 篇相关文章

新闻资讯8

刚刚,GPT-5.5 Instant全员免费!数亿人的ChatGPT变了

OpenAI深夜推出GPT - 5.5 Instant,全面接管ChatGPT默认模型且全员免费。它亮点诸多,如幻觉率暴降、数学成绩提升、回复字数减少、记忆和个性化功能升级等,三个月后GPT - 5.3将退役。

新智元
算法论文7

「微调已死」再添筹码,谷歌扩展AI自我进化范式,成功经验与失败教训双向学习

近期,‘微调已死’言论引关注。谷歌《ReasoningBank: Scaling Agent Self - Evolving with Reasoning Memory》论文提出类似概念,可让智能体从自身成败经验学习,还引入MaTTS,实验显示其有效性和效率优于基准方法。

机器之心
新闻资讯7

陶哲轩回应OpenAI宣称内部实验模型获得IMO金牌:不予置评「测试方法不公开就是“作弊”?」

OpenAI宣称内部实验模型获IMO2025金牌,陶哲轩呼吁对AI竞赛表现保持审慎。他强调评估AI不能只看结果,测试方法很重要,对未公开测试方法的自我报告成绩不予置评。

AI寒武纪
开源动态8

华为推出软工代码智能体SWE-Lego,解锁SFT训练极致性能

华为研究团队推出仅基于监督微调(SFT)的软件工程代码智能体SWE-Lego,无需复杂RL流程,在SWE-bench Verified基准中表现出色,项目已开源。它有数据、训练和测试时扩展三大创新。

机器之心
开源动态8

Meta开源Muse Glimmer,30B Agent小钢炮跑进你的电脑

Meta发布并以宽松协议开源Agent模型Muse Glimmer。它30B参数,能跑在Mac或PC上,多项Agent基准领先。可完成端到端任务、调用工具及多步推理,接受文本与图像交错输入,用途广泛。

AIGC开放社区
算法论文8

双榜SOTA!微软ACL2026新作重新定义AI长记忆

大语言模型落地中,AI长期记忆能力成瓶颈,传统RAG方案有局限。微软研究团队提出AI记忆框架Mnemis,受认识论与认知科学启发,在两大权威长期记忆基准达SOTA性能,工作被ACL2026主会议接收。

量子位
新闻资讯7

刚刚,OpenAI内部推理模型斩获IOI 2025金牌!所有AI选手中第一

OpenAI内部推理模型获IOI 2025金牌,总排名第6、AI组第1,沿用IMO金牌版本且未专门训练。商业模型在IOI表现不足,Grok 4相对领先。巨头热衷竞赛,源于竞争、技术迭代及多方利益考量。

新智元
开源动态8

本地运行、支持视觉与工具调用:Meta 开源智能体模型

Meta AI Research 推出 300 亿参数的开放权重模型 Muse Glimmer,采用 Apache 2.0 许可证。它专为本地工作流设计,能在消费级硬件运行,经多项优化,在基准评估中表现出色,还支持多种框架。

AI前线
新闻资讯8

OpenAI挖到最新菲尔兹奖得主,字节刚出炉的科学家计划在瞄准谁?

今年菲尔兹奖得主之一Jacob Tsimerman将入职OpenAI安全部门。当下顶尖科学家流向头部大模型公司,AI与前沿科学融合成趋势。字节发布Seed STEM科学家计划。大模型下半场比拼基础研究,构建评测基准很重要。

机器之心
新闻资讯7

黄仁勋盛赞中国AI的背后,暴露了英伟达的野“芯”

英伟达CEO黄仁勋多次批评美出口管制政策,称中国将赢得AI竞赛。其呼吁是为扫除商业与技术垄断障碍。若英伟达芯片入华,或抑制国产芯片发展,中国应掌握核心技术实现自强。

芯师爷