「语境学习能力」共找到 4250 篇相关文章
kimi 的RL end2end ON LLM
文章分享Kimi Researcher背后技术思考,采用端到端强化学习打造大模型Agent。对比传统方法,凸显其灵活通用、能力上限高、可扩展优势。还展示其在考试榜单成绩提升及智能“涌现”,介绍多应用场景。
交互扩展时代来临:创智复旦字节重磅发布AgentGym-RL,昇腾加持,开创智能体训练新范式
强化学习之父指出人工智能迈入「经验时代」,在此背景下,复旦、创智、字节研究者发布 AgentGym - RL 框架。它是全新端到端 RL 框架,提出 ScalingInter - RL 方法,7B 模型经训练追平顶尖商业模型,为 AI 发展注入动力。
4B小模型数学推理首超Claude 4,700步RL训练逼近235B性能 | 港大&字节Seed&复旦
香港大学NLP团队联合字节跳动Seed、复旦大学发布Polaris强化学习训练配方,让4B模型数学推理能力超商业大模型,且Polaris-4B可在消费级显卡部署,相关内容已全部开源。
梁文锋执笔的R1论文登上Nature封面!首次回应外界三大质疑
9月17日,DeepSeek创始人梁文锋通讯作者名义发表的DeepSeek - R1论文登《自然》封面。该模型借助强化学习自主形成推理能力,在Hugging Face下载量破1090万次。新版论文回应质疑,披露训练细节,虽有不足但引发学界关注。
以孔子命名,超越Claude 4.5 Opus,Meta发布工业级自我进化AI软件工程师CCA
Meta与哈佛联合推出工业级软件工程师CCA,它是一套让AI在工业级代码库协作的方法论,解决长上下文推理等难题。其三维解耦设计、精细记忆机制、自我进化能力获数据验证,还适合引入强化学习。
从deepseek v4的受限流线型超链接mHC谈架构优化
文章围绕DeepSeek v4的受限流线型超链接mHC探讨架构优化。指出过去十年深度学习重扩展层内计算,忽视层间通信。介绍多种层间通信改进方法,提出用检索替代累加,还提及深度注意力机制及混合深度注意力的成果。
AI首胜人类博士,顶会论文秒变代码!港大90后开源刷爆8k星
香港大学黄超团队开源的DeepCode,能分析论文、生成可运行代码。在四大基准测试中全面领先,首超人类专家,还优于现有AI Coding。它有三大核心能力,采用三阶段框架实现代码自动转换。
RL特训出「押题大师」?破解模型微调中的多样性危机与灾难性遗忘
近年来,基于可验证奖励的强化学习(RLVR)成为提升大语言模型推理能力的重要路径,但许多经RL微调的模型出现‘越训越单一’问题。复旦大学等团队聚焦长期被忽视的KL散度项,提出DPH - RL方法,可缓解多样性坍塌。
Scaling时代终结了,Ilya Sutskever刚刚宣布
Ilya Sutskever 在访谈中称「Scaling 时代已终结」,指出当前模型存在能力参差不齐、泛化不足的问题。他认为人类情绪类似价值函数,人类学习效率高。未来 AI 发展将进入研究时代,他还分享了 SSI 战略及对 AI 对齐等问题的看法。
算力成本大降!马尔可夫思考机来了,LLM推理成本直接降为线性
用强化学习让LLM具备推理能力耗费颇高,计算量会二次级增长。Mila和微软研究院等团队提出马尔可夫式思考机,重构强化学习形式,让计算量呈线性,实验效果显著,还能与先进模型兼容。