行为校准强化学习」共找到 927 篇相关文章

推荐文章8

刚刚!北大校友Lilian Weng最新博客来了:Why We Think

北大校友Lilian Weng更新博客《Why We Think》,回顾利用测试时计算的研究进展,探讨让模型“思考更久”的方法。文中介绍了思维链、潜变量建模等策略,还提及多种提升生成质量的策略,如并行采样与序列修订,以及强化学习提升推理能力等内容。

机器之心
算法论文7

小扎「梦之队」首批论文上线!LLM自举进化,单步性能狂飙22%

Meta超级实验室MSL新论文探索用强化学习微调大语言模型。提出探索迭代(ExIt)法,基于RL自动课程学习,训练仅需单步任务,模型学会多步自我改进。在MLE - bench上,ExIt相对GRPO提升约22%。

新智元
产品应用8

新模型亦是新 Agent,Kimi-Researcher 超大量一手实测!

2025 年被称为“Agent 元年”,月之暗面发布了端到端强化学习训练的新一代 Agent 模型 Kimi - Researcher,其基座是自研新模型。文章对其进行大量实测,与 OpenAI 等对比,并探讨了 Deep Research 的重要性及 Kimi 的不足。

特工宇宙
产品应用8

文心X1.1三大能力狂飙,海内外实测还挺惊艳!

9日WAVE SUMMIT深度学习开发者2025大会上,文心大模型X1.1发布,事实性、指令遵循、智能体能力显著提升,多项测试表现佳。它能做到知识一致,精准遵循指令,智能体解决问题出色,代码、数学、多模态能力也有进化,得益于迭代式混合强化学习训练框架。

新智元
开源动态8

X 推荐算法开源,暴力拆解推荐机制,这是内容创作者的终极流量增长秘籍。

马斯克兑现承诺,将X推荐算法开源。文章用通俗语言介绍其运作原理,把推荐系统比喻成两个‘内容买手’和一个‘裁判’,还给出内容评分标准、过滤机制及创作者提升流量的实战建议。

开源AI项目落地
开源动态8

文生图进入R1时代:港中文MMLab发布T2I-R1,让AI绘画“先推理再下笔”

港中文MMLab团队发布首个基于强化学习的推理增强文生图模型T2I - R1。它提出双层级CoT推理框架和BiCoT - GRPO强化学习方法,解决生成评估难题,为多模态生成提供新范式。

量子位
开源动态8

在AK大神爆火的任务里,摸清国产AI真实水平

4月20日深夜Kimi K2.6发布并开源,作者借Andrej Karpathy的AI Wiki思路设计高承压任务,测试其Agent底层能力,考察它在单Agent、Agent网站和Agent Swarm三种模式下表现,探究国产AI真实水平。

InfoQ
开源动态8

重磅开源!首个全异步强化学习训练系统来了,SOTA推理大模型RL训练提速2.77倍

清华大学和蚂蚁技术研究院联合团队开源全异步强化学习训练系统 AReaL-boba²,坚持“全面开源、极速训练、深度可定制”理念,实现异步 RL 训练,训练速度最高提升 2.77 倍,支持多轮智能体强化学习训练。

机器之心
算法论文8

真机RL杀疯了!机器人自学20分钟100分,数字孪生封神

至简动力等提出数字孪生协同强化学习框架 TwinRL,可在真机高效执行在线强化学习。它用手机构建数字孪生,让机器人先探索再真机操作,20 分钟达 100%成功率,比现有方法快 30%,还降低人类干预。

新智元
新闻资讯7

一边秀肌肉,一边设围墙,NVIDIA 发布 OmniVinci,性能碾压 Qwen2.5-Omni,却被骂“假开源”

NVIDIA 推出多模态大模型 OmniVinci,结合架构创新与合成数据流水线,训练 token 仅为 Qwen2.5 - Omni 的六分之一,却在多项基准测试表现更佳。但采用限制商业用途的许可证,引发“假开源”争议。

InfoQ