自主学习」共找到 1829 篇相关文章

开源动态8

英伟达&MIT等推出Long-RL,长视频训练速度翻倍

英伟达联合MIT等推出Long - RL,它是面向长序列推理和多模态强化学习的全栈训练框架,能提升RL训练数据长度上限,让训练速度翻倍。其核心MR - SP并行框架可降低训练耗时和显存,LongVILA - R1是其明星应用。

机器之心
算法论文7

大模型刷数学题竟有害?CMU评估20+模型指出训练陷阱

CMU团队评估20多个大模型,发现只有强化学习(RL)训练的模型能将数学推理技能广泛迁移到其他任务,监督微调(SFT)训练的模型迁移有限甚至无迁移。研究还探索差异原因,表明RL微调更具优势。

量子位
推荐文章7

超越 GoF:现代 AI 系统实用设计模式

文章指出AI系统需要设计模式,如GoF塑造软件设计,云计算引入新模式,机器学习社区也有相关模式。文中介绍现代AI系统的5类实用设计模式,含提示和上下文、负责任的AI、用户体验、AI - Ops和优化模式等,并举例说明。

InfoQ
8

ICML 2026 开幕,清华团队获最佳论文奖,DeepMind 经典巨作拿下时间检验奖

2026年7月6日,第43届国际机器学习大会(ICML 2026)在韩国首尔开幕,投稿规模与录用总数破纪录。会上,清华黄高团队论文获杰出论文奖,指出扩散语言模型“灵活性陷阱”;还有多篇论文获荣誉提名,另有立场论文、时间检验奖等揭晓。

AI科技评论
新闻资讯8

全球首个「百万引用」学者诞生!Bengio封神,辛顿、何恺明紧跟

Yoshua Bengio成谷歌学术首个论文引用超百万的人,Geoffrey Hinton达97万次。全球高被引TOP 10中,计算机领域占4席,均属AI领域。深度学习论文引用爆发,契合AI时代。还介绍了Bengio、何恺明等AI领域高被引作者情况。

新智元
算法论文8

华为超树HTP:不写示例、不调PDDL,AI规划约束通过率飙升62.6%

文章介绍华为超树HTP,它是完全自主、可泛化的推理新范式。能让LLM在超树结构上完成规划,不依赖人工示例和外部规划器,在复杂规划benchmark上实现SOTA准确率并降低token成本,还阐述其原理、创新点及应用实例。

CourseAI
算法论文8

MSRA清北推出强化预训练!取代传统自监督,14B模型媲美32B

微软亚洲研究院联合清北提出全新预训练范式RPT,将强化学习融入预训练,把预训练语料库重构为推理问题集。实验显示RPT-14B表现出色,在多方面媲美甚至超越32B模型,未来RL或在LLM预训练掀起风暴。

量子位
开源动态8

单卡可跑18万原子!分子模拟的“规模焦虑”该终结了

至知创新研究院UBio团队发布的UBio-MolFM v1.5,是可进行分子动力学模拟的机器学习原子间势函数。它在精度和规模上有提升,实测中表现优于经典力场,架构、数据和训练都有创新,误差降45%,速度提8倍,现已开源。

量子位
新闻资讯8

解析科大讯飞:把AI做成懂你的那一个|甲子光年

2025年中美AI发展路径分化,中国企业探索本土商业化道路。科大讯飞董事长刘庆峰提出自主可控、软硬一体、行业纵深、个性化四个关键词。其用华为昇腾芯片训练出可商用大模型,在多领域展现优势,还发布新功能和产品,为AI商业化提供“中国答案”。

甲子光年
算法论文8

Make SFT Great Again!从SFT到DFT:一权重之差,泛化之跃

大型语言模型的监督微调(SFT)简单高效,但泛化能力弱于强化学习(RL)。本文直击 SFT 核心缺陷,揭示其泛化瓶颈源于隐含的“病态奖励结构”,并提出仅需单行代码修改的动态微调(DFT),实验表明其效果显著。

深度学习自然语言处理