级联式强化学习」共找到 1495 篇相关文章

算法论文7

3D-R1重塑三维视觉语言推理!让三维交互更智能

近年来,视觉 - 语言模型在2D图像理解有突破,但3D视觉语言模型面对复杂场景不足。为此上海大学团队提出3D - R1模型,它基于新数据集和策略构建,有强多任务三维理解能力,不过也存在进步空间。

带你学AI
新闻资讯7

思维链之父跳槽Meta,不只因为1亿美元!离开OpenAI前泄天机

硅谷人才争夺战升级,Meta砸钱抢人,思维链之父Jason Wei从OpenAI跳槽到Meta。他离职前发博客,谈及从强化学习获得的人生启示,还阐述AI领域验证非对称性概念及重要性。

新智元
算法论文8

感知错误率降低30.5%:隐式感知损失让模型主动“睁大眼睛” | UIUC&阿里通义

伊利诺伊大学香槟分校与阿里通义实验室推出多模态推理强化学习算法PAPO。它用隐式感知损失设计,解决感知与推理脱节问题,在多基准测试中表现优,但有KL_prcp Hacking现象。

量子位
新闻资讯7

Claude 4如何思考?资深研究员回应:RLHF范式已过,RLVR已在编程/数学得到验证

Anthropic两位研究员在博客采访中透露Claude 4思考细节。提到可验证奖励强化学习RLVR在编程和数学领域获证明,探讨了RL扩展、模型自我意识等,还为大学生给出AI领域建议。

量子位
算法论文8

纯靠“脑补”图像,大模型推理准确率狂飙80%丨剑桥谷歌新研究

剑桥、伦敦大学学院和谷歌团队推出基于强化学习的视觉规划(VPRL)新范式,纯靠图像推理。新框架利用GRPO后训练,准确率达80%,超文本推理至少40%,代码已开源。

量子位
算法论文8

ICML 2026 | 北大提出的APEIRIA,打破了3D MLLM黑盒推理困境

北大团队提出面向3D空间推理的新框架APEIRIA,将神经符号程序推理模式蒸馏进3D MLLM。采用三阶段课程学习,在多基准测试表现强劲,保留模块化优势,为具身智能系统提供启发。

机器之心
新闻资讯7

315曝光的“AI投毒”原理:GEO这样操控大模型推荐

央视3·15晚会揭开AI“投毒”灰色产业链,利用GEO操控大模型推荐。介绍了训练数据污染、检索上下文劫持、提示注入诱导攻击三种“投毒”技术,还阐述了内容生产、渠道投放、效果强化的产业链运转流程。

量子位
产品应用7

Claude Opus 4.7 上手实测:花7倍价格买输出,值不值?

作者实测Claude Opus 4.7,其定价约为GPT - 4.5的6 - 7.5倍。它有全新架构、强化Agent能力等升级,在代码生成、推理分析等多场景表现出色,是否值高价取决于使用场景。

小华同学ai
算法论文8

ICML 2025 | 千倍长度泛化!蚂蚁新注意力机制GCA实现16M长上下文精准理解

在大语言模型发展中,长文本建模挑战大。蚂蚁研究团队提出注意力机制GCA,可端到端学习检索相关片段,实现超长序列处理与泛化,其Triton kernel实现已开源,论文被ICML 2025接收。

机器之心
算法论文8

清华朱军团队Nature Machine Intelligence:多模态扩散模型实现心血管信号实时全面监测

清华朱军等团队提出多模态生成框架 UniCardio,在单扩散模型中实现心血管信号去噪、插补与跨模态生成。它采用扩散模型和 Transformer 架构,结合持续学习范式,实验表现优,有望用于多领域。

机器之心