强化预训练」共找到 2556 篇相关文章

算法论文7

LSTM之父22年前构想将成真?一周内AI「自我进化」论文集中发布,新趋势涌现?

本文介绍AI模型自我进化方向的进展,涉及多机构的相关论文。如受“哥德尔机”启发的“达尔文哥德尔机”可自我改进;还有“自我奖励训练”“MM - UPT”“UI - Genie”等方法,展现AI自我进化潜力。

机器之心
算法论文8

AI数学能力暴涨100%,自进化直逼RL极限!CMU新作颠覆认知

数据枯竭成AI发展瓶颈,CMU团队提出SRT方法,让LLM自我进化,提升数学与推理能力,性能逼近传统强化学习。研究还分析其局限,提出缓解奖励作弊策略及应对模型崩溃的方法。

新智元
算法论文8

刚刚,DeepSeek首曝V3降成本秘诀!软硬协同突破Scaling天花板

DeepSeek最新论文从硬件架构和模型设计双重视角,探讨如何相互配合实现低成本大规模训练和推理,分析硬件特性对架构选择的影响,研究两者相互依赖关系,还为未来协同设计提出建议。

新智元
算法论文8

ICML 2025 | 如何在合成文本数据时避免模型崩溃?

随着生成式AI发展,合成数据成大模型训练重要部分,但可能引发“模型崩溃”。ICML 2025会议上,上交大等团队剖析此问题,提出Token - Level Editing策略,避免模型崩溃,实验验证了其有效性。

机器之心
算法论文8

答对了却没看图?EASE给多模态RLVR装上「视线校正器」

强化学习与可验证奖励提升视觉语言模型推理能力,但存在答案奖励只知对错、不知证据区域问题。哈工大等团队提出EASE,把标注证据区转为目标分布,监督空间注意力,推理无额外标注,实验成绩优异。

机器之心
推荐文章8

为什么今天造大模型的人,一半在学物理

文章指出在AI前沿,不少定义方向的人出身物理。物理训练赋予的品味与做AI的方法论高度重合,体现在统计力学与神经网络、对普适规律的信仰等方面,还提到Scaling Laws最能体现这种品味。

五源资本 5Y Capital
开源动态8

蚂蚁具身智能明牌了:做大脑,和宇树们错位竞争

蚂蚁灵波开源具身智能基座模型LingBot-VLA,用20000小时真实世界数据训练,解锁最大规模开源真机数据之一。它性能超国际顶尖模型,还指明通用具身智能发展路径,为行业提供全栈解决方案。

量子位
新闻资讯7

AI招聘逆天研究:看照片测一生职业成就

硅谷大厂HR标配的AI招聘系统Eightfold AI被指控算法歧视,求职者要求提高招聘筛选透明度。同时,美国多所高校研究者完成一项研究,AI能通过人脸照片测职业走向,但因训练数据问题引发公平性争议。

量子位
算法论文8

瘦身不降智!大模型训推效率提升30%,京东大模型开发计算研究登Nature旗下期刊

京东探索研究院大模型研究登Nature旗下期刊。其提出系统与方法,经四大创新使大模型推理提效30%、训练成本降70%。成果支撑JoyBuild平台,可帮企业将通用模型转化为专业模型,加速商业化落地。

量子位
新闻资讯7

反击AI论文!arXiv每年拒掉2%造假内容,自动化工具加入审核

AI生成论文泛滥,arXiv等印本平台升级审核机制,用自动化工具检测。Nature发现每年约2%论文因AI使用被拒,如bioRxiv等平台每天拒绝不少AI手稿。平台既要防造假,又要避免误伤合理AI润色。

量子位