「最大似然强化学习」共找到 903 篇相关文章
「重要性采样」并不「重要」?快手清华ASPO攻克重要性采样权重错配
快手与清华合作团队发现大语言模型结果监督强化学习中,重要性采样机制“失灵”,存在权重错配现象。为此提出算法ASPO,在多基准测试中展现优势,训练更稳定。
奥特曼无能,英伟达撤单OpenAI投资?黄仁勋街头回应了
有传闻称英伟达与OpenAI千亿美元合作停滞,黄仁勋私下吐槽奥特曼。但黄仁勋街头回应否认,称看好OpenAI,会参与其最新一轮融资且可能是最大投资。双方合作超十年,此次表态意味着合作将继续。
Sam Altman OpenAI 星际之门与马斯克xAI Colosus 2谁更强?
马斯克与Sam Altman在X上晒自家数据中心进展。OpenAI星际之门项目初始投资5000亿美元,与Oracle新增算力;xAI Colossus 2占地大、建设快,预计几周上线,将成全球最大AI超算集群。
阿里QwenLong-32B:1W+超长Token推理,知识密集型复杂文档高效推理
文章介绍阿里QwenLong - 32B在长文本推理的能力。长文本推理有训练效率低和优化不稳定问题,QWENLONG - L1通过强化学习等解决,还阐述其组件、训练步骤,并给出实战代码及相关链接。
突发 | Meta 挖走的OpenAI 核心研究员Jason Wei,离职前留下这样的一段话
OpenAI研究员Jason Wei和Hyung Won Chung跳槽至Meta,Wei在离职前发推文分享强化学习感悟及验证不对称性概念,引发网友猜测与共鸣,这场AI人才争夺战正愈演愈烈。
“这个怎么组装?”一句无害的问题,如何让AI产生危险输出
Amazon团队发现全新威胁模型“视觉排他性”,提出MM - Plan框架,通过强化学习训练智能体自动发现攻击策略。实验显示其对Claude 4.5 Sonnet和GPT - 5攻击成功率可观,代码和数据集已开源。
Sutton 的批评与反思:AGI 的下一步是什么?
文章是对 Richard Sutton 采访的反思,指出 LLM 训练效率低、依赖人类数据,未实现有机自主学习。作者与 Sutton 有分歧,认为模仿学习与强化学习互补,还探讨持续学习,称 Sutton 批评有启发性。
矩阵乘法新突破!XX^T原来可以更快!RL助力搜索,世界纪录又被提升了5%
深圳市大数据研究院、香港中文大学(深圳)研究团队,结合强化学习与组合优化技术,发掘新算法 RXTX,让 XX^T 运算减少 5% 运算量,成果在国际引发关注,不过产业化落地仍面临挑战。
AI编码工具变 “格式化神器”?Claude CLI半年频当“系统杀手”,多位开发者痛斥:心血都没了!
近日Reddit上一则对Claude CLI的控诉帖引发关注。一位开发者用其清理软件包时,整个Mac系统被清空。Claude自查称执行了含“~/”的灾难性命令。类似“删库”事故并非个例,开发者需强化安全意识。
全球闲置算力训个模型,性能媲美R1,老黄天塌了!Karpathy曾投资它
全球首个分布式RL训练模型INTELLECT - 2发布,整合闲置算力完成训练,成本降低,性能媲美DeepSeek - R1。其采用分布式异步强化学习范式,团队开源四大关键组件,还获Karpathy等投资,未来有多项计划。