「强化学习训练框架」共找到 3127 篇相关文章
Multi-Agent 的灵活编排之路
文章从Copilot 3.0架构规划模块出发,结合DeepSeek R1强化学习训练实践,探讨多智能体架构下大模型编排智能体解决问题。分析Copilot 2.0局限并介绍3.0升级,指出难点,展示效果对比及解决方案。
伯克利最强代码Agent屠榜SWE-Bench!用Scaling RL打造,配方全公开
开源软件工程模型DeepSWE横空出世,基于Qwen3 - 32B,仅用强化学习训练,以59%准确率刷新SOTA。它采用rLLM框架、R2E - Gym环境,用改良GRPO++算法,还介绍了评估策略及训练挑战的解决办法。
Kimi K2技术报告正式发布:“保姆级”深度解析,一文读懂万亿参数智能体的所有秘密
Kimi K2技术报告发布,Moonshot团队用万亿+参数稀疏MoE架构等打造接近Claude - Opus的通用大模型。围绕训练稳定性等改进,有预训练、架构设计等多方面创新,为智能体领域提供可行路径。
OpenAI去年挖的坑填上了!奖励模型首现Scaling Law,1.8B给70B巨兽上了一课
全新奖励模型「POLAR」采用对比学习范式,摆脱对海量人工标注依赖,有强大Scaling潜力。它衡量训练与目标策略「距离」作奖励信号,用自动化合成数据预训练,小模型能超越大数十倍规模对手。
ICML 2026 巡礼:注意力效率革命的九个切面
7月7日,ICML 2026进入正会第一天。雷峰网精选首日上午9篇论文,涵盖持续学习、多模态融合等方向,如MePo让预训练模型学会持续学习,HAF解决模态不平衡下的融合问题,展现AI研究前沿趋势。
推理能力再突破!蚂蚁 | 提出Agentic Deep Research新范式,可信度同步增加
尽管LLM能力提升,但复杂任务表现受静态知识限制。业界提出Agentic Deep Research系统,现存系统训练有梯度冲突和奖励稀疏问题。蚂蚁团队提出Atom - Searcher,创新推理范式,构建细粒度奖励,结合奖励训练,实验效果佳。
单条演示即可抓取一切:北大团队突破通用抓取,适配所有灵巧手本体
在灵巧手通用抓取研究中,传统强化学习面临挑战。北大及BeingBeyond团队提出DemoGrasp框架,以一次成功抓取演示轨迹为起点,通过编辑轨迹适应不同物体与姿态,提升学习效率和真机性能,实验效果出色。
入局AI Infra:程序员必须了解的AI系统设计与挑战知识
文章分享传统后台工程师技术栈和方法论如何迁移到AI系统,系统性拆解AI Infra的硬件、软件、训练和推理挑战,如硬件从CPU到GPU、软件依赖深度学习框架,还分析训练和推理面临的问题及解决办法。
L4大方向有了:理想自动驾驶团队,在全球AI顶会上揭幕新范式
在全球计算机视觉学术顶会 ICCV 2025 上,理想汽车自动驾驶高级算法专家詹锟发表演讲,阐述了‘从数据到训练’的系统化思路,提出将世界模型与强化学习闭环落地于量产自动驾驶系统的完整架构。
硬核「吵」了30分钟:这场大模型圆桌,把AI行业的分歧说透了
在WAIC 2025大模型论坛的“模型之问”圆桌中,多位行业大佬围绕大模型展开辩论,话题涉及训练范式、模型架构、数据、开闭源等核心问题,不同观点碰撞,深入探讨大模型技术演进与发展之路。