「量子纠错算法」共找到 716 篇相关文章
量子位专访楼天城:AI是匹脱缰野马,Harness是这个时代最关键的能力
量子位专访小马智行CTO楼天城,他认为AI如脱缰野马,Harness是关键能力。小马智行发布PonyWorld世界模型2.0,人类不再是中心,AI成总教练,能自我诊断和定向进化,还探讨了诸多自动驾驶及AI相关问题。
LLM内部竟藏着众多策略模型?自所&腾讯团队首次揭示大模型RL新机制
中国科学院自动化研究所与腾讯AI Lab团队,从可解释性分析出发,发现LLM内部含多个可采样内部策略,揭示不同模型推理熵模式,提出BuPO算法,在复杂推理任务上表现优于传统算法。
GAIR Paper 105|离线强化学习新突破——ROMI:破解对抗式模型学习「过保守、训不稳」深层困局|ICLR 2026
本文聚焦基于模型的离线强化学习,指出RAMBO算法存在保守性难控和训练不稳问题。为此提出ROMI方法,引入鲁棒价值感知框架与隐式可微自适应加权机制,在多基准任务上超越基线算法。
AI 写代码老出错?Code Rabbit 来给 Cursor 当“纠错教练”,边写边改。
Cursor的AI Agent写代码虽强但易出错,Code Rabbit可当“纠错教练”。它本用于审查GitHub PR和commit,现推出VS Code、Cursor等插件,能分析代码改动、提建议,与Cursor配合可减少bug。
LLM内部竟藏着众多策略模型?自所&腾讯团队首次揭示大模型RL新机制
中国科学院自动化研究所、腾讯AI Lab团队从可解释性分析出发,发现LLM内部含多个可采样内部策略,揭示不同模型推理熵模式,提出BuPO算法,在复杂推理任务上性能显著优于传统算法。
LLM内部竟藏着众多策略模型?自所&腾讯团队首次揭示大模型RL新机制
中国科学院自动化研究所与腾讯AI Lab团队从可解释性分析出发,发现LLM内部含多个可采样内部策略,揭示不同模型推理熵模式,提出BuPO算法,在复杂推理任务上性能显著优于传统算法。
8块钱跑通一次强化学习全流程,潞晨云重塑微调赛道:1名算法工程师=1支Infra团队
大模型下半场,后训练特别是强化学习成核心战场。潞晨云微调SDK上线,它是国内首个全面开放、且兼容Tinker范式的Serverless微调平台,为强化学习提供低成本解法,在易用性和成本上有优势。
AAAI2025、POF | 西湖大学冯浩东、范迪夏等:如何在不准确物理信息和部分观测下利用物理信息建模流体力学系统
此文章聚焦在不准确物理信息和部分观测下利用物理信息建模流体力学系统问题。提出RPLPO与PIPO算法,前者解决部分观测模型泛化性,后者解决不准确物理信息在部分观测中的应用,实验验证了算法有效性。
告别「利用率崩溃」:GIPO开启大模型强化学习高效训练新方法 | ICML 2026
树根科技与三一集团团队联合提出 GIPO 算法,在机器人操控及大语言/视觉动作模型强化学习训练中,缓解了策略滞后痛点,改善了 PPO 硬截断引发的‘利用率崩溃’问题。介绍了 GIPO 算法原理、优势及实验结果。
AI操作有了“紧急刹车”!通义&自动化所AI决策诊断模型,GUI智能体纠错正确率SOTA
阿里通义实验室与中科院自动化所推出GUI - Critic - R1模型,能在GUI智能体操作执行前诊断决策,避免错误。介绍了其动机、方法、数据集及实验,证明该模型在生成判断和提建议方面有效。