「贝叶斯自适应强化学习」共找到 760 篇相关文章
ICML 2026 | 华为GTS提出AI训练数据新方法,Amazon/Google作者团队「光速跟进」:难度自适应训练正在成为新范式
华为GTS研发部AI数据团队提出EDCO方法,将样本难度估计与动态课程编排引入领域大模型微调。该方法用推理熵动态编排训练课程,让模型面对最有学习价值的样本,已被ICML 2026接收。
JCP | 浙江大学边鑫等:基于 PINNs 的非结构自适应网格细化:面向稳态流动的残差驱动 AMR 新方法
本文提出利用控制方程残差引导网格细化的启发式策略,用物理信息神经网络(PINNs)整合粗网格数据与控制方程。通过解决流动问题并与传统方法对比,显示该策略能平衡计算精度与成本,但有额外计算开销。
ICLR 2026|在「想象」中进化的机器人:港科大×字节跳动Seed提出WMPO,在世界模型中进行VLA强化学习
香港科技大学 PEI - Lab 与字节跳动 Seed 团队提出 WMPO 新范式,可让具身智能在‘想象中训练’,解决传统 VLA 训练瓶颈,目前论文、代码与模型均已开源。
泛化性暴涨47%!首个意图检测奖励范式,AI工具爆炸时代意图识别新解法
随着大模型和工具增长,AI 助手意图识别遇新挑战。腾讯 PCG 团队用强化学习等方法,提升模型泛化能力,还从多方面剖析优势,最后提出未来研究方向。
突发!姚顺雨后,清华95后庞天宇加入腾讯,任混元「首席科学家」
继OpenAI大神姚顺雨之后,95后清华博士庞天宇入职腾讯,任混元首席研究科学家,负责多模态强化学习。腾讯AI战略从跟随转向进攻,人才、技术、架构都有新动作。
国务院关于深入实施“人工智能+”行动的意见
国务院发布意见深入实施“人工智能+”行动,推动其与各行业领域融合。提出到2027年、2030年和2035年的目标,部署重点行动,强化基础支撑能力,明确组织实施要求。
OpenAI、Anthropic、DeepMind联手发文:现有LLM安全防御不堪一击
OpenAI、Anthropic、Google DeepMind 联手发文,研究语言模型安全防御评估。指出现有防御评估有缺陷,提出通用自适应攻击框架,成功绕过 12 种防御机制,多数攻击成功率超 90%。
18K+标星!视觉AI驱动的浏览器自动化,告别XPath,无惧网页改版!
网页自动化常遇页面更新脚本报废等难题,而开源工具Skyvern不走传统XPath/DOM路子,用视觉+大语言模型理解网页,能自适应改版,功能丰富,安装运行简单。
清华开源了一个真的会和你互动的AI课堂,同学老师都是AI,500学生已经验证....
清华大学开源OpenMAIC,这是多智能体驱动的交互式AI课堂。它模拟真实课堂,有多种场景,内置自适应引擎。经500学生验证,数据佳。支持多模型,部署方式多,还集成OpenClaw。
刚刚,Anthropic紧急换帅!新任CTO执掌算力命脉,直面OpenAI千亿赌局
Anthropic宣布任命前Stripe CTO Rahul Patil为新任CTO,原CTO Sam McCandlish转任首席架构师。此次换帅是为强化AI基础设施,应对Claude产品压力及OpenAI、Meta的竞争。