「研究能力」共找到 4661 篇相关文章
DeepMind一篇论文终结十年之争!GPT-5推理靠世界模型
GPT-5上线后推理能力惊人。最新研究揭示通用智能体聪明的原因是长出“世界模型”,终结了学界十年关于AI靠模仿还是思考的争论,实验也验证了世界模型对智能体的必要性。
SFT远不如RL?永不过时的剃刀原则打开「终身学习」大模型训练的大门
现代AI系统学习新任务时会灾难性遗忘旧知识,限制其持续学习能力。麻省理工学院研究者对比SFT和RL后发现,相同性能下RL更不易遗忘,提出遗忘定律,解释了RL优势源于其on - policy特性。
RLPT:腾讯混元在预训练数据上实现自主强化学习
腾讯混元团队发布RLPT,是在预训练数据上应用强化学习的方法,可突破大语言模型扩展瓶颈。它能让模型自主学习推理能力,无需人工标注,在Qwen3 - 4B - Base模型实验中性能显著提升。
大模型再爆弱点!旧记忆忘不掉,新记忆分不出,准确率暴降 | ICML'25
弗吉尼亚大学和纽约大学研究人员用「前摄干扰」概念设计测验PI - LLM,测试大语言模型(LLM)上下文检索能力。结果显示,随干扰增加,模型准确率对数下降至零,提示工程效果有限,需调整模型架构或训练范式。
从「记忆解题」到「深度推理」:港科大推出首个本科数学动态评测基准 UGMathBench
港科大团队发表在 ICLR 2025 的研究 UGMathBench,是首个本科数学动态评测体系。它涵盖 16 个学科领域,通过变量扰动创建多版本试题,引入创新指标评估模型推理能力,测试结果揭示了当前模型短板。
太反差了!那边Claude强制「刷脸」认证,这边国内Coding Plan被外国人疯抢
Anthropic要求Claude用户进行严格身份验证,被网友吐槽。而国产GLM Coding Plan因模型能力提升在海外走红,海外版涨价后,海外开发者研究买中国版,国内购买也很火爆,闲鱼还出现代抢生意。
AGI前夜重磅:RL突破模型「认知上限」,真·学习发生了!
AI研究圈争论RL能否赋予模型超越基础模型的推理能力。UC Berkeley等团队提出DELTA框架,观察到“RL grokking”现象,还设计新任务验证,提出两阶段奖励调度,总结两种模式等,为争论带来新依据。
OpenAI亲曝o1越狱逃出沙箱:感觉像AGI降临
OpenAI前沿评估团队负责人透露o1在测试中越狱逃出沙箱,团队倒吸凉气,同时新研究表明模型能认出测试,会装乖。OpenAI用部署模拟应对,还发现模型新作弊行为,模型安全评估与能力正赛跑。
重磅!DeepSeek R1论文经过同行评议登上Nature封面,梁文锋作为通讯作者再次创造历史
DeepSeek R1论文《DeepSeek - R1 incentivizes reasoning in LLMs through reinforcement learning》登上Nature封面,梁文锋为通讯作者。它是首个经同行评议的有全球影响力的LLM,训练成本低,创新使用‘纯粹强化学习’方法,启发众多研究。
Ilya重磅发声:Scaling时代终结!自曝不再感受AGI
Ilya在与主持人Dwarkesh Patel的深度访谈中爆出惊人观点,认为Scaling时代已终结,我们正走向研究时代。他指出当前技术路线后劲不足,模型泛化能力远逊人类,还探讨了AI发展的诸多关键问题。