「AI强化学习」共找到 10312 篇相关文章
VDC+VBench双榜第一!强化学习打磨的国产视频大模型,超越Sora、Pika
复旦大学等机构将强化学习引入视频生成领域。提出的Cockatiel方法在VDC榜单夺冠,IPO方法在VBench登顶,超越Sora、Pika等模型,优化后视频生成效果在多方面显著提升。
AI 落地实录:我们如何重构业务流程与组织协作
InfoQ《极客有约》X AICon 直播栏目邀网易蓝师师、腾讯张瀚元、国际头部 ERP 企业吴云,探讨 AI 重塑业务价值与提升效能。分享各行业 AI 提效实践、业务重塑案例,还讨论 AI 应用方向及落地挑战等。
模力工场 032 AI 应用榜:桌面 Agent 强势来袭,阶跃登顶本周榜首
模力工场032周AI应用周榜出炉,25款应用上架。本期用户讨论最高的是桌面Agent形态,AI从“对话框助手”走向“接管桌面执行者”。还精选十款应用解读行业风向,反映AI正进入执行与交付阶段。
突发!腾讯AI Lab副主任、首席科学家俞栋传出离职
2025年AI竞争白热化,多方消息显示腾讯AI Lab首席科学家俞栋或已启动离职流程。他在腾讯任职8年,推动数百篇论文与百项专利落地。其离开折射AI顶级人才加速流动,腾讯AI将进入新阶段。
AI教父Hinton诺奖演讲首登顶刊!拒绝公式,让全场秒懂「玻尔兹曼机」
2024年12月8日,诺贝尔物理学奖得主Hinton发表《玻尔兹曼机》演讲,内容于8月25日登APS期刊。他介绍‘霍普菲尔德网络’,分享创新应用,提出‘玻尔兹曼机学习算法’,后有受限玻尔兹曼机等成果,‘玻尔兹曼机’曾催化深度学习革命。
UniSteer用机械臂「拼豆」:让人类指导进入VLA噪声空间强化学习
视觉 - 语言 - 动作模型(VLA)是机器人操作重要基础模型,但复杂任务成功率低,真机强化学习成本高。微软等机构研究者提出 UniSteer,将人类纠正转换成噪声监督,在多任务测试中提升了成功率。
微软 CEO 纳德拉:离了 AI 软件开发没法想!编程如诗都是“压缩”。社区:必须拥抱变化。
微软CEO纳德拉在访谈中表示,如今软件开发离不开AI,AI编程已成标配。他强调AI本质是赋能人类的工具,还提及AI普及挑战,同时保持对AI局限性的清醒认知,分享领导哲学与诗意展望。
强化学习的进化:从PPO到MaxRL,LLM推理训练的算法演进史
本文概述2024 - 2026年推理LLM的强化学习进展,从REINFORCE和PPO讲起,介绍GRPO、RLOO等多种算法。指出critic模型非必需,标准差归一化有副作用,损失聚合很关键,信任域是优化切入点,还提出几个未解决的挑战。
Meta-Think ≠ 记套路,多智能体强化学习解锁大模型元思考泛化
上海交通大学等团队提出ReMA框架,将复杂推理解耦为元思维和推理智能体,通过迭代强化学习协作。在单轮实验中,ReMA在多基准测试表现优;多轮实验虽有提升但不稳定,需进一步探索。
AI时代,这些人已经掉队
AI时代存在两类人,一类用落后AI,认为其是骗局;另一类用先进AI,兴奋于其进步。前者因‘消费者心态’陷入‘跟我无关’和‘不值得付费’陷阱,已掉队。