「强化学习系统」共找到 2987 篇相关文章
ICML 2025 | 给AI装上「智能升级插件」!阿里安全-清华大学D-MoLE让模型在持续学习中动态进化
近日,阿里巴巴集团安全部 - 交互内容安全团队与清华大学联合研究成果被 ICML 2025 收录。他们提出 D - MoLE 框架应对多模态大模型持续学习挑战,实验显示其性能优、训练快,还能用于提升阿里安全审核模型适应力。
基于大模型(LLM)的自选股智能分析系统,让AI帮你盯盘,每天自动推送分析报告
daily_stock_analysis是基于LLM的自选股智能分析系统,免费零成本运行,获6.3万Star。它多市场覆盖、聚合多源数据,自动生成决策报告并推送。有零成本运行等五大亮点,还给出上手步骤、适合人群。
他们从四家顶尖AI实验室辞职,打造能自己跑实验的AI系统,目标是让科学家实现Vibe Research
2026年初,Harsh Mehta和Behnam Neyshabur离开Anthropic,在旧金山注册Mirendil,6月25日公司亮相并完成2亿美元种子轮融资。团队来自四家顶尖机构,目标是构建自主处理AI研发问题的系统,降低AI研发门槛。
当前的上下文方案,本质是暴力破解!DeepMind 创始人:忽强忽弱的 AI,才是真正的灾难,突破在记忆系统
在播客《20VC》中,谷歌 DeepMind 创始人德米斯·哈萨比斯与主持人探讨 AI 未来。他认为 AGI 五年内大概率实现,规模和速度超工业革命;算力是瓶颈,软件记忆系统等突破也重要;还谈及开源、监管、能源等问题。
泛化性暴涨47%!首个意图检测奖励范式,AI工具爆炸时代意图识别新解法
随着大模型和工具增长,AI 助手意图识别遇新挑战。腾讯 PCG 团队用强化学习等方法,提升模型泛化能力,还从多方面剖析优势,最后提出未来研究方向。
突发!姚顺雨后,清华95后庞天宇加入腾讯,任混元「首席科学家」
继OpenAI大神姚顺雨之后,95后清华博士庞天宇入职腾讯,任混元首席研究科学家,负责多模态强化学习。腾讯AI战略从跟随转向进攻,人才、技术、架构都有新动作。
机器人搬冰箱成了!洗碗之后又一痛点,网友:解放我的髋关节
波士顿动力最新人形机器人Atlas能搬动几十公斤重冰箱。它定位为干重活,动作模拟人类搬重物,训练靠强化学习,经参考轨迹、奖励函数、仿真训练、真机测试迭代。
测试时也能RL,英伟达等提出全新范式:TTT-Discover
近日,斯坦福、英伟达、Together AI 等联合开源全新测试时新范式 TTT - Discover,在测试阶段用强化学习微调模型,以刷出 single best 结果,用几百美元就刷新诸多领域 SOTA。
鹅厂员工怎么看Agent自动持续进化?
落地一个Agent容易,但让其自动持续优化很难。文章分享了9位鹅厂同事对“Agent如何自动持续进化”的看法,如建立评估体系、记录真实任务反馈、结合强化学习等。
「重要性采样」并不「重要」?快手清华ASPO攻克重要性采样权重错配
快手与清华合作团队发现大语言模型结果监督强化学习中,重要性采样机制“失灵”,存在权重错配现象。为此提出算法ASPO,在多基准测试中展现优势,训练更稳定。