「强化学习训练框架」共找到 3127 篇相关文章
Think in Games:做一个在王者荣耀中会玩和思考的Agent
文章介绍论文《Think in Games: Learning to Reason in Games via Reinforcement Learning with Large Language Models》,指出当前AI在游戏领域面临的困境,提出TiG框架结合大语言模型与强化学习,打造既会做又会说的AI,实验验证其高效性。
万字实录:VLA 范式,具身智能的曙光与迷雾丨GAIR Live
2025年5月9日,雷峰网等举办“具身智能之VLA的实践与突破”线上圆桌沙龙。多位专家探讨VLA定义、起源、技术路线等,指出其面临推理、数据等瓶颈,还讨论了与强化学习结合、数据选择、提升泛化性、长程任务及落地场景等问题。
让大模型学会“像人一样”查证真伪
伊利诺伊大学香槟分校等校研究团队提出训练框架Veri - R1,为大模型提供“在线查证”新范式。它借助在线强化学习、精细化奖励机制和高质量数据,让模型学会像人一样查证,在多数据集上表现出色。
Qwen团队发布长上下文Reasoning模型QwenLong-L1,超越o3-mini
Qwen团队发布长上下文Reasoning模型QwenLong - L1。当前大模型处理长文本有训练效率低、过程不稳定难题。QwenLong - L1用分阶段强化学习等方法,实验中超越o3 - mini、比肩Claude,还在案例表现出色。
英伟达拟 10 亿美元砸向这家 AI 编码创企!Copilot 技术大佬带队、成立两年估值近千亿
10月30日彭博社报道,英伟达拟最高投10亿美元给AI创企Poolside,此轮融资或使其估值翻四倍。该公司由微软技术大佬带队,开发AI编码助手,创建强化学习法训练模型,从底层自研,有独特优势。
新模型亦是新 Agent,Kimi-Researcher 超大量一手实测!
2025 年被称为“Agent 元年”,月之暗面发布了端到端强化学习训练的新一代 Agent 模型 Kimi - Researcher,其基座是自研新模型。文章对其进行大量实测,与 OpenAI 等对比,并探讨了 Deep Research 的重要性及 Kimi 的不足。
Claude Code 推出学习模式,比ChatGPT更激进:甚至能给你部署作业……
Anthropic为Claude Code和Claude应用推出全新学习功能,Claude Code支持切换交流风格,Learning模式像结对编程,会留作业。Claude实现方式比ChatGPT激进,开发者反响热烈,标志其向更智能教育方向发展。
清华SageAttention3,FP4量化5倍加速!且首次支持8比特训练
清华大学陈键飞团队提出针对BlackWell架构的SageAttention3,实现5倍于FlashAttention的推理加速,首次支持8比特训练。在多种大模型上保持端到端精度,代码将分别于6、7月开源。
Claude1.7万字系统提示词全网刷屏!Karpathy锐评:LLM训练缺乏关键范式
Claude近1.7万字系统提示词在GitHub泄露,网友称是提示技术的金矿。大神卡帕西提出系统提示学习新范式,模拟人类经验积累,让LLM有‘记忆’功能,引发网友激烈讨论。
Yann LeCun最新纪录片首曝!传奇AI教父的双面人生,深度学习幕后40年
Yann LeCun新纪录片上线,回顾其深度学习四十年历程。他是深度学习开创者、Meta首席AI科学家,坚信机器应学会学习,认为AI竞争是开放与封闭之争,还对AI威胁论持务实乐观态度。