新闻资讯7
o3破解数学难题却有短板
新智元
AI 摘要
Epoch AI报告:o3 - mini - high能破数学难题,有学识会直觉解题,但有短板,如缺乏精确性、创造力,还存在幻觉问题,未来推理模型思维或与人类差异增大。
阅读原文 · 新智元
数学圈地震!o3靠直觉刷爆人类顶尖难题,14位专家集体破防
Epoch AI新研究发现,o3 - mini - high能破解顶尖数学难题,具备渊博学识且会基于直觉解题,但推理风格依赖直觉,缺乏严谨性和创造力,还存在投机取巧、幻觉等问题。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
新闻资讯8
OpenAI:GPT破十大数学难题近“奇点”
OpenAI公开62页核心手稿,展示GPT对十大「菲尔兹奖级」数学难题的完整推演,涵盖高维球体堆积、非sofic群构造等。仅花2000美元Token成本,引发全网热议,被指或为GPT - 6,强化学习大佬称像“奇点前夜”。
新智元
新闻资讯8
OpenAI成果被Fable 24小时追平一半
这个周末,OpenAI与Anthropic两大AI巨头在数学前沿短兵相接。先是OpenAI用未发布模型Astra证明10项数学成果,不到24小时,Anthropic的Fable复现了其中5项。AI解难题成本降低,成果验证成新考验。
新智元
算法论文8
人大DelTA算法提升强化学习推理正确率
人大高瓴研究团队提出DelTA算法,不依赖经验为强化学习目标中每个token算最优权重。实验显示它适配主流强化框架,在多任务上提升base模型效果,还能让训练更稳定。
量子位
开源动态8
蚂蚁百灵开源万亿参数推理模型Ring-2.6-1T
5月15日,蚂蚁百灵开源旗舰级推理模型Ring-2.6-1T,权重文件上线Hugging Face、ModelScope平台。该模型有万亿参数,‘按需思考’,在代理执行、推理机制、训练范式三方面升级,评测表现出色。
AI前线