「训练系统」共找到 3629 篇相关文章
Meta提出StepWiser,让模型学会“反思”自己的推理过程
Meta提出StepWiser解决大语言模型推理逻辑正确性问题。它训练生成式评判模型,通过强化学习在线训练,能解释推理步骤好坏。实验显示其远超传统方法,为构建可靠AI系统提供新思路。
模拟大脑功能分化!北大与港中文发布Fast-in-Slow VLA,让“快行动”和“慢推理”统一协作
北大与港中文研究团队发布 Fast-in-Slow(FiS-VLA)全新双系统视觉 - 语言 - 动作模型,将快速执行模块嵌入预训练视觉 - 语言模型,实现快慢系统一体化。该模型在多平台表现优异,控制频率大幅领先。
性能提升84%-166%!L-Zero仅靠强化学习解锁大模型探索世界的能力 | 已开源
招商局狮子山人工智能实验室团队用RLVR让模型“自学”,构建L0系统,含NB - Agent框架和端到端强化学习训练流程,开源相关内容。测试显示L0显著提升模型性能,展现强大泛化能力。
让推荐学会思考:用强化学习激活大模型的序列推理能力
文章指出推荐系统曾未紧密结合大模型能力,如今正靠近其训练范式。作者基于用户行为序列,用强化学习训练大模型理解序列关系,以预测用户下一个可能点击的资讯,并通过实验验证了该方法的可行性,还探讨了不同数据库中BM25算法的差异。
通用AI Agent系统AI Manus
AI Manus是通用AI Agent系统,支持在沙盒环境运行工具。文中给出使用示例,介绍环境要求、部署与开发指南,推荐用Docker Compose部署,还提及项目地址、交流群等信息。
微软 Agentic 组织:下一代 AI 系统
微软研究院提出全新推理范式AsyncThink,让LLM从单打独斗进化成带团队的项目经理。它把并发控制转为纯文本协议,经两阶段训练,实验中全方位碾压传统方法,还具跨领域泛化能力。
The Batch: 869 | 编码助手的训练数据
研究人员开发自动生成编码助手训练数据的流程。斯坦福等高校及阿里团队提出 SWE - smith 方法,从 128 个 Python 仓库入手合成漏洞、验证并生成修复样本,成果免费开放,有望改进 AI 辅助编程模型。
突发!OpenAI紧急暂停GPT-6训练
OpenAI奥特曼官宣暂停下一代旗舰模型强化学习训练两周,原因是确保安全等标准跟上能力水平。触发因素有Hugging Face事故和Astra达安全红线,后续将让AI监管AI,加固三道安全防线。
阿里WebDancer:训练类DeepReaserch的Agentic Model
来自阿里巴巴通义实验室的研究员推出WebDancer,这是一个原生信息检索的Agentic Model,能自主浏览网页、思考和决策。它基于ReAct框架,经多阶段训练,在信息检索基准测试中表现出色,为解决复杂检索问题提供新思路。
快手AgentX:推荐系统开始自我迭代
过去十年推荐系统核心在‘建模’与‘工程’,但日常迭代瓶颈在研发生产方式。快手 AgentX 团队提出 Agent 驱动研发闭环,在快手 App 业务部署中跑通完整闭环,提升效率与业务收益。