经验学习」共找到 1809 篇相关文章

算法论文8

给GRPO加上运筹外挂让7B模型比肩GPT-4!Li Auto团队发布多目标强化学习新框架 | ICASSP 2026

文本摘要质量评估需兼顾多维度,但开发者优化时易顾此失彼。Li Auto团队提出HVO,基于GRPO框架,让7B模型在摘要任务媲美GPT - 4,且生成内容更简洁,成果被ICASSP 2026接收。

量子位
算法论文8

Agentic RL训练:它不是单一 RL 算 法,而是一整套环境建模、学习信号、异步数据流、策略优化和基础设施的协同系统

文章指出Agentic RL训练不是单一算法,而是协同系统。它与传统RL不同,有四个训练变化。理解它要围绕三个不变量,还从环境建模等八个方面阐述,强调其竞争在于环境、信号、分布与系统的协同闭环。

深度学习自然语言处理
算法论文8

ICLR 2026|在「想象」中进化的机器人:港科大×字节跳动Seed提出WMPO,在世界模型中进行VLA强化学习

香港科技大学 PEI - Lab 与字节跳动 Seed 团队提出 WMPO 新范式,可让具身智能在‘想象中训练’,解决传统 VLA 训练瓶颈,目前论文、代码与模型均已开源。

机器之心
算法论文8

腾讯混元 x MBZUAI 港中文新研究:将纠错纳入策略空间,Search-R2 重构搜索增强推理学习方式

过去大语言模型能力提升靠参数和数据扩张,但在真实任务中此路径有局限。腾讯混元、MBZUAI、港中文联合团队提出Search - R2,将纠错纳入策略空间,抑制错误传播,在多跳推理任务中优势显著。

AI科技评论
新闻资讯8

OpenAI 也把工程师经验“蒸馏”进 skill 了!Harness 爆文作者曝内部玩法:一个百万行代码系统,全程零人工编码和审核

OpenAI的Ryan Lopopolo分享Frontier团队工作方式,他们维护超百万行代码库,零人工编码和审核。实验产出Symphony,推动coding agent成“队友”。还探讨模型使用、构建速度、人类角色等问题,认为人成瓶颈,软件要适配模型。

InfoQ
新闻资讯6

科技赋能 未来已来 | 人形机器人训练中心探秘 @首钢园

文章探秘首钢园的人形机器人数据训练中心,提及机器人学习的情况,还列出了相关参考资料,展现科技赋能下人形机器人领域的发展。

首钢园
产品应用8

AI开始接管实验室了!玻尔·跃迁实验室:试剂、设备、数据一个入口搞定,1800+设备即插即用

深势科技推出玻尔·跃迁实验室,解决传统实验室设备割裂、经验依赖、数据离散、部署低效等痛点,围绕计算 - 实验 - 数据 - 计算无缝闭环底层重构,与传统 ELN/LIMS 不同。

量子位
开源动态8

7.3K Star!港大开源神作,集问答、可视化、出题于一身的 AI 超级导师!

香港大学 HKUDS 开源的 DeepTutor 是爆火的个人学习助手,集文档问答、可视化讲解、智能出题、深度研究于一体,解决自学痛点,还给出了快速入手步骤。

开源星探
算法论文8

物理-数据双驱动的大迎角非定常气动力建模 | 航空学报CJA

现代飞行器大迎角机动时,气动力复杂,现有建模方法面临两难。论文提出DEM - LSTM混合框架,结合专家经验与数据驱动,解决小样本、强非线性挑战,经算例验证性能优势明显。

力学与人工智能
推荐文章7

当面试官说「回去等通知」时,他们到底在等什么?

Chip Huyen的开源书《Machine Learning Interviews》被热议,其用200+道题拆解机器学习面试真相,指出多数人挂在三环节。书还摊开不同岗位考察点,建议关注解题路径,还给出资源指路。

AI工程化