「强化学习范式」共找到 2270 篇相关文章
诺贝尔经济学奖背后的 AI 投资主线|AGIX PM Notes
本文围绕诺贝尔经济学奖与AI投资展开。以创新驱动的增长范式与AI生产力、商业模式转型相关,还介绍本周全球股市去杠杆情况及AI领域动态,如Meta等公司技术进展,最后解读ETF市场价格与净值关系及投资策略。
Tool-Integrated RL 会是 Agents 应用突破 「基模能力限制」 的关键吗?
文章聚焦AI & Robotics业内要事,探讨Tool - Integrated RL能否助Agents突破「基模能力限制」,还涉及Copilots填产业落地鸿沟、生成式AI重塑软件开发等话题,完整版通讯含多项解读与要事速递。
AutoGLM 2.0 深度解析:云端智能体的技术跃进与现实挑战
2025 年 GUI Agent 赛道升温,多数产品依赖本地执行。智谱 AI 在 8 月 AutoGLM 2.0 闭门交流会上展示新路径,其由国产模型驱动,具多能力,在 Agent 云端执行架构、训练方式等方面有突破,也面临一些挑战。
kimi 的RL end2end ON LLM
文章分享Kimi Researcher背后技术思考,采用端到端强化学习打造大模型Agent。对比传统方法,凸显其灵活通用、能力上限高、可扩展优势。还展示其在考试榜单成绩提升及智能“涌现”,介绍多应用场景。
复读一年,AI 把高考数学成绩从及格线提到 145 分!AI 数学能力发生了什么?
今年媒体让AI做高考数学题,Gemini 2.5 Pro获145分排第一。从去年到今年,AI数学能力指数级增长,这得益于推理模型。推理模型用思维链和强化学习解题,未来高考数学或难区分模型能力。
Reasoning模型可以Self-Train!
当前大模型依赖人类标注数据,成本高且扩展难。论文探讨模型自我纠错、自主进化可能,提出自我奖励训练(SRT),用投票共识代替人类标注。在数学数据集上有效果,但高难度数据集出现问题,作者给出解决办法并开源代码。
Multi-Agent 的灵活编排之路
文章从Copilot 3.0架构规划模块出发,结合DeepSeek R1强化学习训练实践,探讨多智能体架构下大模型编排智能体解决问题。分析Copilot 2.0局限并介绍3.0升级,指出难点,展示效果对比及解决方案。
RL训练总崩溃?R1-Reward稳定解锁奖励模型Long-Cot推理能力
多模态奖励模型对提升多模态大语言模型表现至关重要,但强化学习在奖励建模应用有挑战。快手等团队提出R1 - Reward,解决训练不稳定等问题,在基准上超SOTA模型,还在快手业务场景成功应用。
千问:阿里第二次“无线战争”
本文以乔布斯用 iPhone 点咖啡引出当下科技圈流行发布会点咖啡展示 AI 能力,对比过去与现在,指出数字世界核心范式从移动转向 AI。介绍阿里千问饱和式投入情况,还分析其可能借鉴拼多多、抖音策略,站在长尾对立面。
Code2Video:代码驱动、智能体协同、精准可控的教学视频生成
新加坡国立大学 ShowLab 团队提出 Code2Video,一种基于代码驱动的视频生成新范式。它以可执行代码为媒介,结合三智能体协同框架,解决了现有文生视频方法在教育场景的不足,在美学和教学效果指标上有明显提升。