「数学研究目标」共找到 2654 篇相关文章
刚刚,GPT-5首次通过「哥德尔测试」!破解三大数学猜想
GPT - 5首次通过「哥德尔测试」,破解三大组合优化猜想。研究由海法大学和思科主导,团队设计五项测试任务,GPT - 5在三个简单问题上近乎完美,还推导出不同解法,标志AI从「学习数学」迈向「做数学」。
统计学最高荣誉回归华人!苏炜杰:AI需要一门新的数学语言
2026年,宾夕法尼亚大学苏炜杰教授获统计学界“诺贝尔奖”考普斯会长奖。他认为AI时代统计学会更重要,还提出AI需新数学语言,访谈中分享诸多对AI的思考与见解。
前两天刚被群嘲,ChatGPT转头就解决了一个数学难题
前些天,OpenAI研究员宣称GPT - 5‘发现’数学难题解法被指只是检索文献引群嘲。但加州大学洛杉矶分校教授用ChatGPT解决凸优化未决问题,还有教授用其发现命题反例,甚至要将其列为论文一作,AI正成研究伙伴。
数学圈地震!o3靠直觉刷爆人类顶尖难题,14位专家集体破防
Epoch AI新研究发现,o3 - mini - high能破解顶尖数学难题,具备渊博学识且会基于直觉解题,但推理风格依赖直觉,缺乏严谨性和创造力,还存在投机取巧、幻觉等问题。
刚刚,Claude独立攻克图论猜想,仅用31步!算法祖师爷高德纳震惊发文
Claude Opus 4.6仅用31步独立攻克图论猜想,算法祖师爷高德纳震惊发文,认为需重新评估生成式AI在数学研究中的作用。这标志着AI在自动推理和解决创造性问题上达到新里程碑。
从「记忆解题」到「深度推理」:港科大推出首个本科数学动态评测基准 UGMathBench
港科大团队发表在 ICLR 2025 的研究 UGMathBench,是首个本科数学动态评测体系。它涵盖 16 个学科领域,通过变量扰动创建多版本试题,引入创新指标评估模型推理能力,测试结果揭示了当前模型短板。
14B打败671B!微软rStar2-Agent在数学推理上超过DeepSeek-R1
如今的大语言模型推理能力关键在于测试时扩展,但长思维链有局限。微软研究团队用主动式强化学习探索,成果 rStar2 - Agent 方法训练出 14B 的 rStar2 - Agent - 14B 模型,性能超 671B 的 DeepSeek - R1。
AIAA J | 香港理工大学王旭等:目标导向的特征提取-以特征构建增强数据驱动模型
该论文通过对比学习理清潜在输入特征与目标输出的关联性,提出输出驱动的输入特征构造方法。所构造特征在高维代理模型构建中增强效果显著,还可减少预测误差分布及不同模型收敛性和鲁棒性差异。
OpenAI两位首席最新采访信息量好大!终极目标是“自动化研究员”,招人并非寻找“最出圈”的人
OpenAI首席科学家Jakub Pachocki和首席研究官Mark Chen在采访中爆料,谈到GPT - 5将推理引入主流、实现自动化研究员目标、强化学习未到瓶颈等,还阐述用人标准、算力分配等问题。
Anthropic 研究发现:仅需少量污染文档即可对 LLM 实施投毒
Anthropic的Alignment Science团队研究大语言模型训练投毒攻击,实验发现仅250条恶意样本就能植入“后门”,且模型越大攻击越易,还对微调数据集实验,引发讨论。