RL训练范式」共找到 2918 篇相关文章

算法论文8

一个标点就能迷惑LLM-as-a-Judge!

论文揭露惊人漏洞,一个标点或通用推理开场白就能欺骗最先进的LLM裁判,导致强化学习训练崩溃。研究通过实验验证漏洞,提出Master - RM模型,其FPR近乎0%且保持通用裁判能力。

深度学习自然语言处理
新闻资讯8

Karpathy最新脑洞「细菌编程」:优秀的代码应该具备细菌的三大特质

大神Karpathy提出“细菌编程”新概念,代码要有小而精、模块化、自包含且易复制粘贴的特点,让开源社区发展。他还提出过“软件3.0”“氛围编程”等概念,这些脑洞或成未来编程范式信号。

量子位
新闻资讯7

更长的推理链反而导致更多幻觉,MLLMs 幻觉解法仅「抄作业」还不够?摘要

近日,斯坦福等校学者发现,更长推理链会让 MLLMs 产生更强幻觉。MLLMs 幻觉不仅涉及语言偏差,还有跨模态语义失配。主流多模态架构在结构设计和训练机制上的潜在失衡,是幻觉频发的主因。

机器之心
开源动态8

超过GPT-image-1!大黑马Black Forest刚开源新模型,只用文本实现一键PS

今日凌晨,Black Forest开源文生图模型FLUX.1-Kontext开发者版本,功能类似PS,用自然语言就能一键P图。测试显示它超GPT-image-1,成最强开源文生图模型之一,还在架构、训练、工程层面做了优化。

AIGC开放社区
算法论文7

一文解读 LLM Posting-Train技术

文章解读了大语言模型后训练(Post-training)技术,介绍其核心价值,从微调、强化学习、测试时拓展三方面展开,分析现有技术瓶颈,指出前沿研究方向,还给出实践指南和工具链推荐。

海边的拾遗者
算法论文8

突破瓶颈,嵌入式AI神经持续学习引擎—Replay4NCL

阿联酋、纽约、巴基斯坦大学研究人员推出Replay4NCL,解决嵌入式AI持续学习难题。它优化记忆重放,有创新架构和训练策略。实验显示其精度高、延迟低、省内存、能耗少,成果将在2025年DAC大会展示。

AIGC开放社区
新闻资讯8

DeepMind 创始人 Hassabis 语出惊人:百万 token 只是在贴胶带,AGI 在 2030 年

DeepMind创始人Hassabis在访谈中评估AGI进展,认为当前范式是最终架构一部分,但持续学习等问题待解决,预计2030年左右实现AGI,还探讨了Agent、蒸馏等多方面内容,并给创业者建议。

MacTalk
推荐文章8

Harness is the New Dataset:模型智能提升的下一个关键方向

文章指出当基模能力成熟,决定 agent 上限的是围绕模型搭建的系统,即 harness engineering。介绍其组件、设计原则,探讨模型与 harness 关系,还列举创业机会项目,最后推测下一范式是 Coordination Engineering。

海外独角兽
算法论文8

4B模型幻觉抑制能力超越GPT-5,CMU等提出行为校准强化学习新方法

大语言模型幻觉问题是部署难题,CMU等研究人员提出行为校准强化学习新方法,重新设计奖励函数。经训练,40亿参数模型幻觉抑制力超GPT - 5,实验证明该方法效果显著,还带来理论洞察。

机器之心
推荐文章7

从 SQL 到自然语言,下一代 Lakehouse 为何必须「AI 优先」

随着大模型技术爆发,数据分析范式重构,未来数据多模态、分析复杂、查询方式转变。文章指出构建下一代 AI-First Lakehouse,要在存储计算、内核能力、架构适配、平台自治等方面升级,打破数据壁垒。

InfoQ