「自奖励训练」共找到 3107 篇相关文章
清库存!DeepSeek突然补全R1技术报告,训练路径首次详细公开
DeepSeek给近一年前登上《Nature》封面的R1论文补64页技术细节,正文大幅翻修。新论文展开R1完整训练路径,补充R1 - Zero分析,还披露安全评估细节。此外团队稳定,引发对其后续动作猜测。
3个月融资亿元,流形空间证明世界模型也需要预训练 | 甲子光年
2025年5月武伟创办流形空间,成立3个月获亿元融资。他认为VLA是过渡方案,世界模型是AGI新基建。当下技术分显式物理建模和隐空间交互两派,流形空间做具身世界模型,从预训练做起,还将领域模型产品化。
10步优化超越强化学习,仅需1条未标注数据!后训练强势破局
无监督的熵最小化(EM)方法仅需一条未标注数据和约10步优化,就能显著提升大模型在推理任务上的表现,甚至超越依赖大量数据和复杂奖励机制的强化学习(RL)。EM为大模型后训练提供了更高效简洁的新思路。
思维链推理是一种脆弱的‘海市蜃楼’,一旦超出训练分布,它便会消失。| 直播预约
思维链提示能提升LLM在多任务上的表现,让人感觉模型在深思熟虑。但研究从数据分布角度剖析,发现思维链推理是脆弱的‘海市蜃楼’,超出训练分布就会消失,强调实现通用推理能力挑战大。
VAE再被补刀!清华快手SVG扩散模型亮相,训练提效6200%,生成提速3500%
前脚谢赛宁宣告VAE在图像生成领域退役,后脚清华与快手可灵团队就推出无VAE潜在扩散模型SVG。它通过语义+细节双分支+分布对齐,实现多任务通用,训练提效62倍、生成提速35倍。
VGGT4D:无需训练,挖掘3D基础模型潜力,实现4D动态场景重建
香港科技大学(广州)与地平线研究团队提出 VGGT4D,无需训练,通过挖掘 Visual Geometry Transformer 注意力层运动线索,在动态物体分割等任务表现优异,为 4D 重建提供新思路。
为什么大模型会产生幻觉?OpenAI最新研究终于搞清楚了
OpenAI发布研究论文剖析LLM幻觉根源,指出当前主流训练与评估体系是核心驱动因素之一。现行评估奖励猜测行为,幻觉起源于预训练的‘下一词预测’,论文还澄清五大误区,建议改革评估体系。
训练时间减半,性能不降反升!腾讯混元开源图像生成高效强化方案MixGRPO
混元基础模型团队提出全新框架MixGRPO,结合SDE和ODE,简化MDP优化流程,提升效率与性能。还推出更快变体MixGRPO - Flash。MixGRPO训练时间降近50%,MixGRPO - Flash再降71%,效果和效率优于DanceGRPO。
Kimi K2.5登顶开源第一!15T数据训练秘籍公开,杨植麟剧透K3
Kimi K2.5登上Hugging Face热榜榜首,下载超5.3万。它主打Agent能力,成绩超GPT - 5.2等闭源模型,性价比高。官方技术报告公开其用15T数据训练,还搭载Agent Swarm架构,团队还剧透了Kimi K3。
吞下17亿图片,Meta最强巨兽DINOv3开源!重新定义CV天花板
Meta训出70亿参数「视觉巨兽」DINOv3并完全开源。它用自监督学习,无需人工标注,可生成强大图像特征,在多任务超专用方案,NASA已用其探索火星,还能推动多行业进步。