强化学习框架」共找到 2849 篇相关文章

算法论文8

微小目标漏检只是因为小?从数据到代码:一文读懂 AI-TOD-R 与 DCFL 如何解决旋转微小目标检测

此文指出旋转微小目标检测存在数据空白、学习偏差、特征易丢失等难题,提出AI-TOD-R数据集、全检测范式基准和DCFL框架。DCFL可缓解偏差,在8个数据集达SOTA,还给出实战代码案例。

机器学习AI算法工程
算法论文8

人形机器人控制新突破!敏捷稳定两不误,一个策略让人形机器人完成叶问蹲和跳舞|港大&英伟达&清华

港大、NVIDIA和清华联合团队提出AMS统一人形机器人全身控制框架,首次在单一策略实现动态运动跟踪和极限平衡控制。通过异构数据源、混合奖励机制和自适应学习策略,解决数据限制和优化目标冲突问题。

量子位
新闻资讯8

刚刚,DeepSeek论文登上Nature,更多细节披露!

9月17日,梁文锋担任通讯作者的DeepSeek - R1推理模型研究论文登《Nature》封面,它是全球首个经同行评审的主流LLM。不靠人工标注,靠强化学习激发推理能力,学会‘自我反思’,在多任务上优于传统模型。

PaperAgent
算法论文8

Agent学会自己「长」Skill了!从失败里长出经验,比人类写的更好用|ICML 2026

ICML 2026接收论文提出EvolveR,让Agent从自身成败轨迹自动蒸馏“经验”,经闭环生命周期形成“认知Skill”,维护经验库,用强化学习让其学会“使用经验”,在多跳问答表现优。

量子位
算法论文8

冗长响应缩减80%,DeepSeek GRPO获得颠覆性改进,微软GFPO问世

微软研究员曝出颠覆性强化学习算法 GFPO,能削减推理多余 token 长度达 80%。它基于 DeepSeek 的 GRPO,可同时优化多响应属性,团队还提出自适应难度变体,实验显示 GFPO 在多方面表现出色。

机器之心
推荐文章8

北大校友、OpenAI前安全副总裁Lilian Weng关于模型的新思考:Why We Think

北大校友Lilian Weng更新博客《Why We Think》,回顾利用测试时计算研究进展,探讨激励模型思考方式,介绍思维链、并行采样、序列修订等策略,还提及强化学习、外部工具使用及未来研究方向。

Founder Park
算法论文8

仅需10%思维链标注,等同全量性能!中科院发布推理监督新范式

中科院计算所团队提出新框架PARO,让模型学习固定推理模式自动生成思维链,只需标注1/10数据就能达全量人工标注性能,适合规则清晰领域,为推理监督提供新思路。

新智元
产品应用8

全球1100万台出货,追觅打造最聪明的扫地机

追觅扫地机将AI打造成完整链路,实现从感知到决策的闭环。其X60 Pro采用超广角双目灵动导航避障技术,提升感知能力,引入强化学习优化决策,全球出货超1100万台,营收增长显著。

AI科技评论
算法论文8

最火、最全的Agent记忆综述,NUS、人大、复旦、北大等联合出品

多所顶级学术机构联合发布百页综述《Memory in the Age of AI Agents: A Survey》,为‘Agent Memory’梳理技术路径。提出三角框架,辨析与其他概念差异,还探讨记忆形式、功能、运转机制,展望未来发展方向。

机器之心
开源动态8

超越GPT-5.2和Gemini-3-Pro!商汤多模态搜索、推理模型开源

商汤开源多模态自主推理模型SenseNova - MARS(8B/32B双版本),它通过强化学习整合工具,在多模态搜索与推理测试中超越Gemini - 3 - Pro与GPT - 5.2,还采用创新算法稳定训练,构建新基准评测。

AIGC开放社区