深度强化学习」共找到 2076 篇相关文章

算法论文8

MeanFlow再下一城,北大提出机器人学习新范式MP1,实现速度与成功率双SOTA

北大研究团队提出机器人学习新范式MP1,将MeanFlow引入机器人学习,实现毫秒级推理速度。还引入分散损失提升少样本泛化能力,在仿真和真机测试中,实现速度与成功率双SOTA。

机器之心
算法论文8

同时监督和强化的单阶段大模型微调,告别“先背书再刷题”,推理泛化双提升|中科院&美团等

中国科学院自动化研究所联合美团提出单阶段监督 - 强化微调方法 SRFT,结合监督微调与强化微调,解决传统两阶段方法的不足,在多任务中提升推理和泛化能力。

量子位
推荐文章8

Efficiency Law, 物理精确世界模型,及世界模型引擎驱动的具身智能学习新范式

2025年秋具身智能赛道火热,特斯拉、英伟达动作不断,数据问题成落地症结。跨维智能贾奎、港中大(深圳)刘桂良探讨突破具身智能学习枷锁的方法,提出Efficiency Law和GS - World世界模型引擎及新学习范式。

机器之心
产品应用7

⼤模型是万能的吗?探索机器学习+⼤模型在某出海投资业务的应⽤

本文基于公共云大客户出海投资业务案例,探讨用AI大模型结合机器学习算法构建投资预算预测与分配系统。历经三版方案迭代,从纯大模型到引入机器学习算法,目前项目处于落地阶段,有望实现多方共赢。

阿里云开发者
算法论文8

PRSA 2025 | RPI Nithin Somasekharan、Shaowu Pan(潘韶武):突破柯尔莫哥洛夫屏障——面向模型降阶的可学习加权混合自编码器

本文将线性POD与非线性Autoencoder通过可学习参数融合,提出可学习加权混合自编码器架构。在多数据集验证中,该方法克服了POD和纯AE的局限,在复杂PDE系统预测中表现出色,或可降低大规模计算成本。

力学与人工智能
算法论文8

西交大 x A*STAR 论文:让 AI 学会「保持一致」,多图生成迎来关键突破丨CVPR 2026

西安交大与新加坡A*STAR团队提出论文《PaCo-RL: Advancing Reinforcement Learning for Consistent Image Generation with Pairwise Reward Modeling 》,将一致性问题转为“跨图比较”学习问题,结合强化学习实现能力闭环,提升多图生成一致性。

AI科技评论
推荐文章8

机器人为什么要拟人?终于有人正确回答了

今年6月,英伟达发布Isaac GR00T人形机器人参考平台,深度机智发布论文Human - as - Humanoid。具身智能瓶颈是数据,深度机智以人类学习范式破局,完成全栈技术闭环,领先优势扩大。

机器之心
新闻资讯8

智源悟界·Emu3.5发布,开启“下一个状态预测”!王仲远:或开启第三个 Scaling 范式

2025年智源发布悟界·Emu3.5,在“Next-Token Prediction”基础上实现“Next-State Prediction”。它能力全面提升,或开启第三个Scaling范式,还在预训练、强化学习、推理加速上有技术创新。

AI前线
新闻资讯8

刚刚,李飞飞主讲的斯坦福经典CV课「2025 CS231n」免费可看了

斯坦福大学经典CV课程《CS231n:深度学习与计算机视觉》(2025春季)正式上线,学生能学习实现和训练神经网络。课程由李飞飞等四人主讲,全部18个视频可在Youtube免费看。

机器之心
算法论文8

AI数学能力暴涨100%,自进化直逼RL极限!CMU新作颠覆认知

数据枯竭成AI发展瓶颈,CMU团队提出SRT方法,让LLM自我进化,提升数学与推理能力,性能逼近传统强化学习。研究还分析其局限,提出缓解奖励作弊策略及应对模型崩溃的方法。

新智元