「互补学习系统理论」共找到 2930 篇相关文章
一篇95页最新80种Deep Research系统全面综述
浙大研究深度研究系统领域,分析自2023年以来80多个相关实现,提出4维度分层分类法,全面分析4种实现架构,还阐述各维度演变进步。
从 Serverless 到 Agent:Cube 系统的一些设计思考
本文从 Serverless 面临的挑战出发,介绍 Cube 系统设计,包括分布式调度、资源池化等。还探讨其在 Agent 场景应用,如极速代码执行、高并发 Agentic RL 等,最后展望向行业开源,助力 Agent Infra 发展。
一篇95页最新80种Deep Research系统全面综述
浙大研究深度研究系统领域,分析自2023年以来80多个实现,提出4维度分层分类法,全面分析4种实现架构,涵盖基础模型、工具利用、任务规划、知识综合等方面的演变与进步。
Karpathy:强化学习「有点问题」,突破还需新算法
前特斯拉AI总监、OpenAI创始团队成员Karpathy发文称,强化学习虽能带来更多收益,但机制「可疑」,不像人类解决智能任务的方式。他提出新算法框架,还指出当前存在诸多待解决的问题。
免费开源低成本的3D动作捕捉系统
FreeMoCap是无标记点3D动作捕捉系统,用普通USB摄像头就能实现研究级全身动作捕捉,支持单/多相机模式,输出3D骨骼数据,可导入Blender等工具,具有低成本、开源可扩展等优势。
一篇95页最新80种Deep Research系统全面综述
浙大研究深度研究系统领域,分析自2023年以来80多个实现,提出4维度分层分类法,全面剖析4种实现架构,如单体、流水线、多智能体和混合架构,并阐述各维度演变与进步。
ROLL:面向大规模语言模型的高效强化学习框架
本文介绍阿里推出的ROLL强化学习框架,专为LLM训练优化。它设计灵活,不同用户可用其满足业务、探索或线上指标需求。在多任务训练中性能出色,还采用创新机制提升效率,支持自定义操作,适合学术和业务场景。
One RL to See Them All?一个强化学习统一视觉-语言任务!
国内初创公司 MiniMax 提出 V-Triune 系统,可让 VLM 单一训练流程学视觉推理和感知任务。它含三个组件与动态 IoU 奖励机制,基于此的 Orsta 模型在多项测试中性能提升显著,凸显统一 RL 方法有效性和可扩展性。
语言反思>强化学习:伯克利新架构碾压传统RL
大型语言模型下游任务优化依赖强化学习,但计算成本高。伯克利等机构论文提出GEPA新型优化器,将LLM执行轨迹转化为诊断信号,用语言反馈替代标量奖励,仅用传统方法1/35计算量,性能最高提升19%。
张小珺对话OpenAI姚顺雨:生成新世界的系统
OpenAI研究员姚顺雨在播客访谈中分享诸多新颖观点。他认为创业公司机会在设计新交互方式,未来或产生超越ChatGPT的超级应用;还指出语言是实现泛化的工具,强化学习有泛化趋势,智能边界由不同超级应用共同定义。