世界模型强化学习」共找到 8140 篇相关文章

算法论文8

生成视频总出物理bug?用VLM迁移+token级对齐,让燃烧在正确位置发生,碰撞遵循动量守恒丨CVPR 2026近满分接收

现有生成式视频模型多停留在“外观拟合”,未真正“物理建模”。中山大学等机构提出ProPhy,构建渐进式物理对齐框架,使模型有“分层物理理解”与“空间物理对齐”能力,论文被CVPR2026近满分接收。

量子位
开源动态8

DeepSeek-R1发布后的100天复现之旅方法总结

DeepSeek团队发布「推理大模型」DeepSeek-R1 ,其技术细节未完全开源,全球研究团队开启“复现竞赛”。论文总结100天复现经验,介绍推理大模型与普通大模型区别、复现方法、关键发现及未来方向。

深度学习自然语言处理
新闻资讯7

复读一年,AI 把高考数学成绩从及格线提到 145 分!AI 数学能力发生了什么?

今年媒体让AI做高考数学题,Gemini 2.5 Pro获145分排第一。从去年到今年,AI数学能力指数级增长,这得益于推理模型。推理模型用思维链和强化学习解题,未来高考数学或难区分模型能力。

宝玉AI
算法论文8

迈向原生全模态AI智能体:人大&小红书发布OmniGAIA新基准

中国人民大学等团队推出 OmniGAIA 新基准及 OmniAtlas 训练框架。OmniGAIA 含 360 个高难度任务,覆盖多领域。实验显示闭源与开源模型差距大,OmniAtlas 显著提升开源模型表现,并指出未来全模态智能体发展方向。

PaperAgent
算法论文8

AI自己给自己当网管,实现安全“顿悟时刻”,风险率直降9.6%

大型推理模型有安全风险,此前监督微调泛化能力有限。SafeKey团队提出创新的SafeKey框架,发现大模型信息“越狱”两大核心,通过双通路安全头和查询遮蔽建模强化模型安全,实验验证其有效性。

量子位
算法论文8

隐形束缚:RLVR为何无法突破LLM的推理边界?

大型推理模型进展依赖带可验证奖励的强化学习(RLVR),但它能否扩展模型推理能力存疑。本文通过理论证明与实验,揭示RLVR存在“隐形束缚”,只能在基座模型初始能力内优化,难以发现新解。

深度学习自然语言处理
新闻资讯7

谷歌神秘模型Kingfall泄漏!

近日,谷歌AI模型Kingfall在AI Studio平台短暂开放后意外曝光。它具备多模态处理能力,上下文窗口6.5万个token,有两种模式。生成SVG矢量图能力超Claude 4,身份猜测不断。

AI工程化
算法论文8

大语言模型逻辑评估

现有归因问答评估方法有‘归因短视’问题,研究团队提出 LOGICSCORE 框架,从三维度量化推理质量。在多数据集测试多款 LLM,发现专有、开源模型等存在不同逻辑问题,还分析典型逻辑错误。

深度学习自然语言处理
算法论文8

扩散语言模型九倍推理加速!上海交大:KV Cache并非自回归模型的专属技巧

上海交通大学EPIC Lab团队提出免训练推理缓存机制dLLM - Cache,复用特征降低计算量。它即插即用,通用于主流dLLM架构,在多个基准测试中实现数倍推理加速,且不降低生成质量。

量子位
算法论文8

Agent也能蒸馏了!性能超好

模型运行成本高,普通用户用不起。传统小模型模仿大模型解题步骤易出错。论文提出Agent蒸馏,让小模型学会用检索和代码工具,还加首思前缀与自我纠错“外挂”,使小模型性能直逼大模型

深度学习自然语言处理