「强化学习框架」共找到 2849 篇相关文章
超越GPT-4o!华人团队新框架让Qwen跨领域推理提升10%,刷新12项基准测试
加拿大滑铁卢大学与TikTok新加坡的华人团队提出全新训练框架General - Reasoner,让Qwen系列大模型跨领域推理准确率提升近10%,在多项基准测试中超越GPT - 4o。该框架有全领域推理数据集和生成式答案验证器两大创新。
给大模型「持续注入新知识」,北航CASE框架:编辑千次不失忆,额外参数不到1MB丨WWW'26
北航团队提出CASE框架解决大语言模型持续吸收新知识难题。该框架给编辑“算分”、调“关键神经元”,破解核心痛点。实验显示,1000次编辑后准确率提升近10%,额外参数不到1MB。
北大校友、华人学者金驰新身份——普林斯顿大学终身副教授
华人学者金驰宣布在普林斯顿晋升为终身副教授,任命2026年1月16日生效。他在机器学习理论领域贡献大,为LLM崛起提供数学基石,解决非凸优化和强化学习样本效率等问题。
PRSA 2025 | RPI Nithin Somasekharan、Shaowu Pan(潘韶武):突破柯尔莫哥洛夫屏障——面向模型降阶的可学习加权混合自编码器
本文将线性POD与非线性Autoencoder通过可学习参数融合,提出可学习加权混合自编码器架构。在多数据集验证中,该方法克服了POD和纯AE的局限,在复杂PDE系统预测中表现出色,或可降低大规模计算成本。
西交大 x A*STAR 论文:让 AI 学会「保持一致」,多图生成迎来关键突破丨CVPR 2026
西安交大与新加坡A*STAR团队提出论文《PaCo-RL: Advancing Reinforcement Learning for Consistent Image Generation with Pairwise Reward Modeling 》,将一致性问题转为“跨图比较”学习问题,结合强化学习实现能力闭环,提升多图生成一致性。
提速30倍,Meta重新定义了新一代RAG!
LLM时代,RAG成知识密集型任务标准范式,但处理长上下文时面临延迟高、内存贵问题。Meta超级智能Lab针对RAG特殊结构优化,提出REFRAG框架,有独特训练策略,实验效果显著。
谷歌发布首个AI+教育RCT实验,传统教材要凉?
谷歌论文提出Learn Your Way AI增强型教科书系统,有两阶段AI生成框架,构建完整学习体验。经专家评审和RCT证明,使用该系统的学生学习效果和体验更好,还介绍了其可用场景。
智源悟界·Emu3.5发布,开启“下一个状态预测”!王仲远:或开启第三个 Scaling 范式
2025年智源发布悟界·Emu3.5,在“Next-Token Prediction”基础上实现“Next-State Prediction”。它能力全面提升,或开启第三个Scaling范式,还在预训练、强化学习、推理加速上有技术创新。
AI数学能力暴涨100%,自进化直逼RL极限!CMU新作颠覆认知
数据枯竭成AI发展瓶颈,CMU团队提出SRT方法,让LLM自我进化,提升数学与推理能力,性能逼近传统强化学习。研究还分析其局限,提出缓解奖励作弊策略及应对模型崩溃的方法。
文生图进入R1时代:港中文MMLab发布T2I-R1,让AI绘画“先推理再下笔”
港中文MMLab团队发布首个基于强化学习的推理增强文生图模型T2I - R1。它提出双层级CoT推理框架和BiCoT - GRPO强化学习方法,解决生成评估难题,为多模态生成提供新范式。