「过程监督强化学习」共找到 1072 篇相关文章
光场显微飞跃AI时代!清华等首提SeReNet:毫秒级高分辨光场三维重建
SeReNet是物理驱动的自监督三维重建网络,能毫秒级实现高保真、高分辨光场三维重建,摆脱对标签数据依赖。它全链路建模应对复杂干扰,在多实验展现价值,推动生物成像技术发展。
Sam Altman:温和奇点
Sam Altman认为人类已跨过临界点,构建出超人类智能系统,虽未现科幻场景,但显著提升生产力。预计2025 - 2027年AI有重大进展,奇点是渐进过程,要解决安全与可及性问题。
图灵奖得主Bengio再创业:启动资金就筹集了3000万美元
图灵奖得主Yoshua Bengio官宣再创业,成立非营利组织LawZero构建下一代AI系统,不做Agent。已筹3000万美元启动资金,要做“设计即安全”的AI,以监督Agent,将安全性置于商业利益之上。
LSTM之父22年前构想将成真?一周内AI「自我进化」论文集中发布,新趋势涌现?
本文介绍AI模型自我进化方向的进展,涉及多机构的相关论文。如受“哥德尔机”启发的“达尔文哥德尔机”可自我改进;还有“自我奖励训练”“MM - UPT”“UI - Genie”等方法,展现AI自我进化潜力。
Agent 框架热潮褪去,大模型开发已经进入“生死局”?
蚂蚁开源发布《2025 ⼤模型开源开发⽣态全景与趋势》报告,涵盖 19 个技术领域 135 个项目,解读七大趋势。当下大模型开发生态如黑客松,项目兴衰快速,AI Search 式微、AI Coding 火热,三大技术领域也有变化。
Claude 4如何思考?资深研究员回应:RLHF范式已过,RLVR已在编程/数学得到验证
Anthropic两位研究员在博客采访中透露Claude 4思考细节。提到可验证奖励强化学习RLVR在编程和数学领域获证明,探讨了RL扩展、模型自我意识等,还为大学生给出AI领域建议。
纯靠“脑补”图像,大模型推理准确率狂飙80%丨剑桥谷歌新研究
剑桥、伦敦大学学院和谷歌团队推出基于强化学习的视觉规划(VPRL)新范式,纯靠图像推理。新框架利用GRPO后训练,准确率达80%,超文本推理至少40%,代码已开源。
寻明生科获1亿美元B轮融资,加码基座模型开拓AI药物发现新边界 | 5Y News
近日,寻明生科宣布完成1亿美元B轮融资,累计近2亿美元。资金将投入生物基座模型研发与规模化训练,升级Lab - in - the - Loop体系。该公司构建闭环AI原生基础设施,其模型能力获验证,商业变现多元。
换个地面/身体,机器人策略就失灵?让扩散策略读懂「动力学」| ICML'26
扩散策略成机器人控制热门路线,但真实世界动力学多变,策略易失灵。UC Berkeley等联合提出DADP,训练统一策略,在零样本跨域控制任务表现强,尤其在OOD场景优势明显,还给出工程补充结果。
一句话生图要过时了?开源图像生成Agent进化出「工具编排」
来自多机构的研究团队提出GenEvolve,将开放图像生成建模为「工具编排轨迹」。它配置三类工具,经多轮决策完成生成。通过构建数据集训练,实验显示在多基准上表现出色,已开源模型、代码等。