多阶段强化学习」共找到 2106 篇相关文章

算法论文8

论文发表 || 如何基于累积过程变换学习弱非线性振动方程(EvLOWN)

2026年3月6日,赵林等教授团队在《Advanced Science》发表论文。提出EvLOWN数据驱动理论,利用平均法重构推断方程目标,扩展微小效应可推断性边界,在多领域应用效果好,但有未考虑SDE等局限。

力学与人工智能
开源动态8

CVPR 2026 | AI寒武纪时刻?字节世界模型新作,仅靠视觉学习真实世界知识

豆包大模型团队与北京交通大学联合提出视觉世界模型 “VideoWorld 2”,无需依赖语言模型,仅靠视觉信息让机器掌握复杂能力。它能完成复杂手工任务,成功率远超主流模型,代码与模型已开源。

机器之心
算法论文8

博士答辩PPT分享 | 高雷诺数湍流场数据同化与湍流模型机器学习研究

西北工业大学孙旭翔博士的论文聚焦航空航天湍流模拟难题,结合数据驱动与同化方法,构建全流程框架,提出数据同化与模型修正方法,设计集成框架,实现高雷诺数复杂流动精确高效模拟。

力学与人工智能
新闻资讯8

LiblibAI 母公司完成近 3 亿美元融资:AI 应用层开始进入「收入说话」的阶段

近日,演语科技披露近3亿美元B+轮融资,投后估值超20亿美元。其旗下有LiblibAI、LibTV、星流等业务,已构建AI创意内容生产应用矩阵。截至2026年5月,ARR达3亿美元,收入年同比增超3000%。

AI科技评论
产品应用8

Artificial Analysis 榜单第二,SkyReels-V4 宣告 AI 视频进入「全栈统一」阶段

昆仑天工的 SkyReels-V4 在 Artificial Analysis 文生视频榜单排第二,ELO 评分 1090。它有「运动参考」能力,能覆盖视频创作全工作流,背后靠统一拼接框架和双流 MMDiT 架构,体现 AI 行业「统一」趋势。

Founder Park
算法论文8

斯坦福&英伟达提出新范式:推翻Scale Law,在“推理”阶段自我进化,超越人类专家

斯坦福和英伟达提出 TTT - Discover 新范式,允许模型在测试时继续训练,针对难题‘进化’。它设计了自适应熵目标函数和 PUCT 状态复用组件,实验在多领域碾压人类专家与同行,但在部分领域落地有局限且计算成本高。

深度学习自然语言处理
开源动态8

训练时间减半,性能不降反升!腾讯混元开源图像生成高效强化方案MixGRPO

混元基础模型团队提出全新框架MixGRPO,结合SDE和ODE,简化MDP优化流程,提升效率与性能。还推出更快变体MixGRPO - Flash。MixGRPO训练时间降近50%,MixGRPO - Flash再降71%,效果和效率优于DanceGRPO。

量子位
算法论文8

刚刚,OpenAI找到控制AI善恶的开关:ChatGPT坏人格在预训练阶段已成型

OpenAI最新论文揭示控制AI“善恶”开关。研究发现训练模型在某领域答错题,会致其在其他领域“学坏”,还找到“毒性人格特征”。同时给出解决办法,能让模型恢复正常。

量子位
新闻资讯7

马斯克官宣数字AI员工!世界首富也来养龙虾,测试阶段员工把它当真人

马斯克在X上宣布数字擎天柱/巨硬AI项目,它是能在电脑自动操作的数字员工,可模拟公司运作。该项目早有记载,此前印度小哥曾爆料。巨硬项目曾遇阻,现以数字擎天柱形式推出,由xAI与Tesla联合打造。

量子位
开源动态8

「上下文学习」之后,腾讯混元第二篇公开研究:精准定位RLVR训练崩溃的“罪魁祸首”Token

腾讯混元团队新研究提出异常梯度定位器 GradLoc,可将全局梯度突刺定位到具体异常 token,降低 RLVR 训练观测与分析门槛,助力解决训练不稳定问题,让模型调优更科学。

机器之心