互补学习系统理论」共找到 2930 篇相关文章

算法论文8

SFT在帮倒忙?新研究:直接进行强化学习,模型多模态推理上限更高

学界常用「监督微调(SFT)+ 强化学习(RL)」训练大模型。但新研究发现,SFT 会引发「伪推理路径」,阻碍推理进步。相比之下,直接进行 RL 训练,模型多模态推理上限更高,该团队训练的模型还刷新了纪录。

机器之心
算法论文8

博士学位答辩PPT分享 | 基于机器学习的复杂流场预测方法研究

左奎军博士论文聚焦基于机器学习的复杂流场预测,以多种对象构建智能流场预测网络架构,发展耦合求解方法,剖析核心要素影响,提出多个创新模型和策略,还分析了不同模型在流场预测中的表现与问题。

力学与人工智能
新闻资讯8

强化学习之父Richard Sutton:人类数据耗尽,AI正在进入“经验时代”!

强化学习之父Richard Sutton在演讲中指出,人类数据耗尽,AI正进入“经验时代”,真正的AI要从与世界互动的“经验”中获取数据。他还认为创造超级智能体是好事,人类和AI繁荣应基于“去中心化合作”。

AI科技大本营
开源动态8

RL缩放王炸!DeepSWE开源AI Agent登顶榜首,训练方法、权重大公开

今天凌晨,Together.ai联合Agentica开源AI Agent框架DeepSWE,基于Qwen3 - 32B模型用强化学习训练。所有内容开源,测试中性能超所有开源Agent框架,证明强化学习训练潜力。

AIGC开放社区
开源动态7

狂揽15.9K star!!Win系统居然还有开源替代版,牛逼啊~

开源君分享开源项目`ReactOS`,它类似Windows,目标是与NT系列无缝兼容,可直接运行Windows软件和驱动。该项目始于1996年,在Github获15.9K star,有轻量、兼容等特点,安装简单。

开源先锋
新闻资讯7

Agent Token焦虑:当每次对话都在「烧钱」,技术如何破局?| GAIR Live 029期预告

GAIR Live 029 期线上圆桌将直击 Agent Token 焦虑的底层技术逻辑,邀请技术负责人从架构重构与系统优化双重视角,拆解 Claw 类产品如何从烧钱走向省钱。探讨成本解剖、架构升维、系统优化等核心议题。

AI科技评论
开源动态7

量化投资和金融科技的开源利器来了!

金融强化学习 (FinRL®) 是首个面向金融强化学习的开源框架,已发展成生态系统,有三层结构。其特点包括支持多算法、多市场环境模拟等,有完整流水线,还支持多数据源。

GitHubStore
新闻资讯8

AI教父Hinton诺奖演讲首登顶刊!拒绝公式,让全场秒懂「玻尔兹曼机」

2024年12月8日,诺贝尔物理学奖得主Hinton发表《玻尔兹曼机》演讲,内容于8月25日登APS期刊。他介绍‘霍普菲尔德网络’,分享创新应用,提出‘玻尔兹曼机学习算法’,后有受限玻尔兹曼机等成果,‘玻尔兹曼机’曾催化深度学习革命。

新智元
产品应用7

Pinterest 基于 CDC 的摄取系统将数据库延迟从 24 小时缩短至 15 分钟

Pinterest 推出新一代数据库摄取框架,突破传统批处理局限。旧系统延迟高、运维复杂,新框架基于 CDC 等构建,处理有变化记录,将数据延迟从超 24 小时降至 15 分钟,还节省成本。

InfoQ
算法论文8

豆包是如何炼成的?字节放出自研万卡训练系统ByteRobust论文

文章介绍字节跳动的LLM训练基础设施ByteRobust。它由控制和数据平面构成,关键目标是获高ETTR。该系统优先快速隔离故障、考量人为错误、控制恢复可变性,已部署超一年,效果显著。

机器之心