端到端学习」共找到 3467 篇相关文章

开源动态8

仅靠5000+样本,全新强化学习范式让30B轻松击败671B的DeepSeek V3

传统强化学习在创意写作领域举步维艰,蚂蚁技术研究院联合浙江大学开源全新强化学习范式Rubicon,构建10000+条「评分标尺」,拓展应用至主观任务领域,其30B模型用5000样本超越671B的DeepSeek V3。

机器之心
算法论文8

快手Klear团队提出CE-GPPO:通过梯度保留协调熵,解决强化学习中的熵不稳定问题

快手 Klear 语言大模型团队提出新强化学习算法 CE - GPPO,以「熵」为核心,提出梯度保留策略,重新利用裁剪外区间低概率 token 的梯度,实现策略熵的精细调控,解决强化学习中熵不稳定问题。

机器之心
新闻资讯8

强化学习之父Richard Sutton最新演讲揭示OaK架构:通向超级智能的八步愿景

强化学习之父Richard Sutton在演讲中介绍OaK架构,认为它是通向超级智能的路径。他回顾对简单通用AI智能体架构的追求,强调从经验学习、拟合世界的重要性,还指出实现该架构需八个步骤,虽只是愿景但提供了发展路线图。

机器之心
算法论文8

奖励模型预训练新范式POLAR:突破强化学习短板,有望打通RL链路扩展“最后一环”

强化学习中奖励模型设计与训练是瓶颈,上海人工智能实验室提出奖励建模新范式POLAR。它摆脱传统“绝对偏好”限制,契合强化微调框架,通过对比学习训练,实验证明其性能和泛化性佳,有望打通RL链路扩展最后一环。

OpenMMLab
推荐文章8

Efficiency Law, 物理精确世界模型,及世界模型引擎驱动的具身智能学习新范式

2025年秋具身智能赛道火热,特斯拉、英伟达动作不断,数据问题成落地症结。跨维智能贾奎、港中大(深圳)刘桂良探讨突破具身智能学习枷锁的方法,提出Efficiency Law和GS - World世界模型引擎及新学习范式。

机器之心
产品应用7

理解归 AI,正确归引擎:从一句话一条实时数据链路(0代码搭建实时任务)

文章分享直播数据团队搭建AI辅助、指标驱动的实时数据开发系统的实践与思考。从案例介绍用户使用流程,再深入系统内部讲链路构建与演进,阐述设计方法论,最后提出未来规划。

阿里云开发者
算法论文8

比人类专家快2倍,斯坦福联合英伟达发布TTT-Discover:用「测试时强化学习」攻克科学难题

斯坦福与英伟达等机构联合提出 TTT - Discover 方法,让 LLM 在测试时强化学习。它在多任务上成绩出色,如在数学、GPU 内核等领域超越人类和其他 AI,计算成本低,或为持续学习打开新空间。

机器之心
算法论文8

AI在线强化学习“边做边学”,斯坦福团队让7B小模型性能飙升,甚至超越GPT-4o

斯坦福等团队提出新范式AgentFlow,由四个智能体组成,用在线强化学习持续提升智能体系统推理能力。以Qwen - 2.5 - 7B - Instruct为基座模型的它在多基准测试表现突出,甚至超越GPT - 4o等大模型。

量子位
新闻资讯7

从烧光现金、裁掉一半员工, ARR 9 个月破亿:Replit用“全栈平台”反杀Cursor,赌赢“每层都赚钱”模式

2024年初2025年9个月内,Replit年度经常性收入从不1000万美元破亿。其增长靠系统性战略,以AI编程代理获客,后基础设施变现。它反映AI编程工具从编辑器进化为平台的趋势。

InfoQ
算法论文8

X-SAM:从「分割一切」「任意分割」:统一图像分割多模态大模型,在20+个图像分割数据集上均达SoTA

中山大学、鹏城实验室、美团联合提出X - SAM,统一图像分割多模态大模型。它将分割范式扩展,设计通用输入输出,采用架构和三阶段训练策略,在超20个数据集达最优,为图像分割研究开辟新方向。

机器之心