机器学习专家」共找到 2008 篇相关文章

算法论文8

英伟达笑到最后!训练2000步,1.5B逆袭7B巨兽,Scaling真来了

英伟达团队提出ProRL训练法,将强化学习扩展到超2000步。用此方法训练的15亿参数模型媲美70亿参数的Deepseek - R1 - 7B,在多任务中表现出色,解决了熵崩溃和训练不稳定问题。

新智元
新闻资讯7

RLHF已死,RLVR引爆AGI革命!Claude 4核心成员万字对谈

Claude 4核心成员对谈指出,强化学习在语言模型上奏效,可验证奖励的强化学习(RLVR)比RLHF更优,模型有望从「专才」向「通才」过渡,未来AI智能体将完成白领工作,人们应做好准备。

新智元
算法论文8

真机RL杀疯了!机器人自学20分钟100分,数字孪生封神

至简动力等提出数字孪生协同强化学习框架 TwinRL,可在真机高效执行在线强化学习。它用手机构建数字孪生,让机器人先探索再真机操作,20 分钟达 100%成功率,比现有方法快 30%,还降低人类干预。

新智元
新闻资讯8

OpenClaw 走红背后:Agent、AI Coding 与团队协作的新问题

InfoQ《极客有约》X QCon 直播栏目邀请专家探讨 OpenClaw 爆火背后的问题,如 Agent 能否进入研发流程、AI 写代码边界等。专家认为 OpenClaw 并非低门槛产品,AI Coding 需解决可控问题,团队落地要平衡 SPEC 和 Vibe 模式。

InfoQ
算法论文7

deepseek-V4算法工程技术深入浅出

文章围绕deepseek V4技术报告展开,指出当前大模型训练不充分,介绍了算法层面如混合注意力机制、模型结构优化、优化器等,工程层面如细粒度专家并行、算子内核开发等,以及后训练的范式转变和领域专家网络蒸馏等内容。

Agent的潜意识
开源动态7

来了,DeepSeek又悄悄开源LPLB项目

DeepSeek 悄悄开源 LPLB 项目,该项目解决 MoE 小批量训练专家每批 token 数抖动问题。LPLB 在 EPLB 基础上,将‘冗余专家’看成带容量边的图,每批解一次线性规划,实现 token 重新路由,单节点 100µs 级求解。

PaperAgent
开源动态8

别让AI一上来就“进厂打螺丝”:智源悟界·Orca要先教模型理解世界如何变化

智源研究院悟界·RoboBrain Orca Team发布技术报告Orca,探索模型是否理解世界状态变化。Orca尝试在统一世界潜空间学习状态与规律,受海外关注。它先学世界表征,有独特学习方式,经实验验证效果良好。

量子位
算法论文8

2026,一篇不错的高效Agents技术全面综述

上海AI Lab等9所高校联合发表《迈向高效智能体(Agents):记忆、工具学习与规划综述》。文章介绍了高效智能体概念,分析其效率危机,阐述提升效率的三大战略方向,涵盖多种记忆、工具学习和规划方法。

PaperAgent
新闻资讯7

The Batch: 880 | 用 AI 学 2 小时 vs. 跟老师学 6 小时

Alpha School用AI驱动教学,将传统6小时课程替换为2小时个性化学习,让学习速度翻倍,学生考试成绩优异。但部分教育委员会拒绝其分校申请,批评者称缺乏严格证据。此外,美国多地也在进行AI教育尝试。

DeeplearningAI
开源动态8

Memento-Skills VS OpenClaw 不改模型也能进化

Memento - Skills让AI Agent自己设计自己,通过部署时学习进化,不动模型参数,将经验写进技能库。经测试,在HLE和GAIA基准测试中准确率大幅提升,与OpenClaw等定位不同,有多种部署方式,不绑定模型。

CourseAI