「测试时强化学习」共找到 2992 篇相关文章
中科院联合清华等发布视觉语言行动推理模型VLA-R1,让机器人先思考再行动
中科院自动化所、清华和GigaAI联合发布视觉 - 语言 - 行动模型VLA - R1,让机器人先思考再行动。它通过构建数据集教模型思维链,结合监督微调与强化学习提升性能,经多场景测试表现出色。
模仿人类推理修正过程,阶跃星辰提出形式化证明新范式 | 开源
阶跃星辰发布并开源形式化定理证明大模型 StepFun-Prover-Preview-7B 和 32B。采用两阶段监督微调、工具集成强化学习及 RL 与 SFT 迭代循环优化等策略,在基准测试集表现佳,还展示多个证明案例。
IC测试座与HBM:AI 时代幕后英雄
在AI技术飞速发展的当下,高性能计算芯片是关键,HBM作为AI芯片重要组成,其测试技术愈发重要。文章介绍了IC测试座与HBM在AI芯片中的应用、发展趋势,还提及HBM测试挑战及相关技术设备等内容。
吴恩达:自动化测试在 AI 编程时代将变得极其重要
吴恩达分享团队用AI编程助手的经历,如Agent删代码。他认为AI辅助编程时代,自动化测试愈发重要,智能体测试能发挥作用,还强调优先测试基础设施代码,后端测试更关键。
阿里通义开源GUI智能体SOTA:2B到235B端云协同重新定义移动端GUI智能体
阿里通义实验室开源MAI - UI,通过端云协同架构等解决GUI智能体部署难题。它全谱系模型设计应对硬件约束,自进化数据管线和在线强化学习提升性能,端云协同平衡隐私与效率,扩展动作空间打破局限,在多基准测试创SOTA。
刚刚!北大校友Lilian Weng最新博客来了:Why We Think
北大校友Lilian Weng更新博客《Why We Think》,回顾利用测试时计算的研究进展,探讨让模型“思考更久”的方法。文中介绍了思维链、潜变量建模等策略,还提及多种提升生成质量的策略,如并行采样与序列修订,以及强化学习提升推理能力等内容。
伯克利神作背刺OpenAI:持续学习才是真神!
伯克利等机构发布FST框架,通过快慢分层解决大模型持续学习死局。过去两年头部实验室都在提升模型推理能力,却忽视持续学习。FST让模型像大脑一样快慢分层,提升数据效率、减少遗忘,使持续学习可工程化。
经典之作!Agent无需奖励也能学习:通过“早期经验”的Agent Learning
该论文提出‘早期经验’范式,让智能体通过执行动作、观察结果状态学习,无需外部奖励。它能降低数据依赖,提升泛化与鲁棒性。实验显示,其在多样环境中效果出色,为智能体训练提供新思路。
Sutton 的批评与反思:AGI 的下一步是什么?
文章是对 Richard Sutton 采访的反思,指出 LLM 训练效率低、依赖人类数据,未实现有机自主学习。作者与 Sutton 有分歧,认为模仿学习与强化学习互补,还探讨持续学习,称 Sutton 批评有启发性。
游戏教父 John Carmack:LLM 不是游戏的未来
游戏教父 John Carmack 认为 LLM 不是游戏未来,强调交互式体验学习重要性。他分析游戏学习现状,指出 Atari 游戏研究虽有成果但仍存问题,还探讨强化学习多方面挑战及应对思路。