持续学习范式」共找到 2464 篇相关文章

算法论文8

碾压π0.5,复旦团队首创「世界模型+具身训练+强化学习」闭环框架

复旦团队针对当前 VLA 策略依赖模仿学习、真实机器人在线 RL 成本高、传统物理仿真器有局限等问题,提出 ProphRL 框架。该框架以世界模型 Prophet 为核心,结合 RL 算法,为具身智能落地提供更可行路径,实验效果显著。

机器之心
算法论文8

头号玩家照进现实!NTU发布世界模型交互新范式,攻克主动操作难题

南洋理工大学MMLab团队推出Hand2World,让AI世界模型能真正互动。它摒弃旧有遮挡误导,用3D手部结构与射线编码解耦手与头运动,实现闭环持续交互,基于单目视频全自动标注,为AR、机器人交互铺路。

新智元
算法论文8

社交Agent: 通过RL学习自适应Thinking,根据场景在“秒回”和“深思”间灵活切换

现有聊天机器人在人情世故场景表现不佳,论文指出大模型思维‘一根筋’。研究团队设计4种思维模式,用AMPO强化学习算法动态切换。在模拟社交任务中,AMPO表现超GPT - 4,省时高效。

深度学习自然语言处理
产品应用8

1700个OpenClaw技巧,我用多邻国的方式学会的!

AI带来学习方式变革,OpenClaw技巧众多难记。智谱清言APP的学习搭子功能,可将GitHub项目生成多邻国式课程,还能处理论文、演讲等素材,通过多种技术实现知识读薄、读活、读透。

量子位
算法论文8

王兴兴署名,宇树机器人春晚之后又进化了:单个策略就能学习各种极限动作

春晚上,宇树机器人展现高动态、高协同的全自主集群控制技术。现在,多机构提出 OmniXtreme 通用策略,可执行各种极限动作。该框架分两阶段,经测试在仿真和现实中表现出色,打破了泛化壁垒。

机器之心
新闻资讯8

模型越强,人的判断力越值钱:微软CEO破解“AI替代”焦虑

微软CEO纳德拉长文探讨‘AI驱动的经济中企业的未来’,指出企业要构建AI学习闭环,让人力资本和AI能力叠加增长。还提出认知闭环概念,强调人的判断力在AI时代更有价值,给出构建学习系统的具体方法。

AIGC开放社区
算法论文8

首次结合RL与SFT各自优势,动态引导模型实现推理⾼效训练

新一代大型推理模型在复杂推理有进展,核心是ZERO - RL训练法。华为香港研究所小艺团队等合作推出GHPO算法框架,融合在线强化学习与模仿学习,解决了RLVR方法局限,提升模型训练效果,代码数据开源。

机器之心
算法论文8

全球首个人形机器人通用视觉感知系统,Humanoid Occupancy建立多模态环境理解新范式

北京人形机器人创新中心推出 Humanoid Occupancy 感知系统,创新性融合多模态传感器信息,构建通用感知框架。它以语义占用表征为核心,有全编码和适配融合优势,经实验验证性能优,推动机器人迈向通用感知时代。

机器之心
推荐文章7

大语言模型高考数学拿高分靠强化学习,那文科考高分得靠什么?

大语言模型在高考数学拿高分靠强化学习,但文科题无标准答案,此方法行不通。豆包1.6系列高考文科全科获683分,靠训练数据、思维链、长上下文和多模态直接读图等因素。

宝玉AI
算法论文8

24小时、78轮实验、持续迭代,AiScientist自己把最优解一步一步逼出来了

中国人民大学高瓴人工智能学院的AiScientist挑战让AI持续推进研究工程。它采用“thin control over thick state”设计,通过分层编排和File - as - Bus等方式,在多任务上表现出色,为AI科研工程补上关键底座。

PaperAgent