「自我奖励」共找到 537 篇相关文章
告别「边画边说」:LatentMorph 开启视觉生成隐式潜空间推理新范式
现有的文生图模型缺乏动态思考与自我修正能力,香港科技大学团队提出LatentMorph框架,将隐式潜空间推理集成到T2I生成过程中,实验显示其显著提升基座模型性能,削减推理延时与Token消耗,实现人机认知对齐。
Agent RL 总是训练崩?UCLA 这篇论文给了救命稻草!
这篇解读UCLA和威斯康星大学麦迪逊分校论文《ARLArena: A Unified Framework for Stable Agentic Reinforcement Learning》的文章指出,Agent RL训练易崩溃,原因在于多轮交互任务带来奖励稀疏等问题。论文建“竞技场”,提出SAMPO算法提升稳定性,还给出从业者建议。
解决智能体手工构造难题! 浙大&腾讯提出 ReCreate,从零自动构建领域智能体
浙大、腾讯等机构研究者提出ReCreate框架,不依赖手工设计,让智能体自主构建。它从交互经验中找优化方向,有三重设计,实验显示能提升多领域任务通过率、降成本,未来或开启AI“自我制造”时代。
LSTM之父Jürgen再突破,「赫胥黎-哥德尔机」让AI学会自己进化
LSTM 之父 Jürgen Schmidhuber 对 2003 年提出的哥德尔模型进行新尝试,构建赫胥黎 - 哥德尔机(HGM)。它能在 SWE - Bench Lite 媲美最佳人类设计智能体,还在多基准测试中超越现有方法,展现强大迁移能力。
混合数学编程逻辑数据,一次性提升AI多领域强化学习能力 | 上海AI Lab
上海AI Lab的OpenDataLab团队通过大规模实验剖析RLVR在多领域推理机制。构建多领域评估框架与定制奖励策略,基于Qwen2.5 - 7B系列模型联合训练,有多项关键发现,为构建AI推理模型提供参考。
多模态模型学会“按需搜索”,少搜30%还更准!字节&NTU新研究优化多模态模型搜索策略
字节与NTU优化多模态模型搜索策略,通过搭建工具、构建数据集及设奖励机制,用强化学习训练模型,使其按需搜索。实验显示,MMSearch - R1系统少搜30%还更准,为多模态大模型发展提供洞见。
北大2篇Skill炸场,Agent彻底进化
北京大学连发两篇论文,给出让 Agent 变强的答案:让 Skill 自己进化。`SESA` 针对工具增强的搜索问答,用四个阶段闭环使任务生成和技能记忆一起进化;`VeriSkill` 把验证器废信号变成可信更新,二者场景不同但核心一致。
硅谷这一夜,属于中国机器人!图灵奖得主、英伟达大牛全来了
美西4月28日,具身智能全球性峰会GEIS在硅谷落幕。中国公司魔法原子发起,图灵奖得主演讲,英伟达等科学家对谈。会上发布世界模型Magic - Mix、灵巧手H01和人形机器人MagicBot X1三款产品,展现全栈自研实力。
OpenAI新幻觉论文惹争议!GPT-5拉胯是测试基准有问题??
OpenAI新论文《语言模型为何会产生幻觉?》提出,模型有幻觉是因标准训练和评估流程倾向奖励“猜对”。GPT - 5不爱猜测,在榜单表现不佳,网友质疑论文是为GPT - 5挽尊,论文引发网友多方向讨论。
AI里最大的Bug,却也是人类文明最伟大的起点。
OpenAI论文指出AI产生幻觉是因其训练方式奖励瞎蒙行为。以考试为例,AI在信息不足时猜测是最优策略。还从统计学解释根源,指出解决幻觉需改变评估指标,也引发对人类想象力起源的思考。