「带可验证奖励的强化学习」共找到 1552 篇相关文章
从自己出题到自己选题:耶鲁新方法让大模型 Self-Evolution 又进一步
本文解读了耶鲁、斯坦福等多机构联合提出的INFUSER大模型自进化新方法,针对现有方法仅以难度筛选训练数据的缺陷,提出用影响力分数筛选高价值训练题,实现双模型协同动态进化,实验验证效果显著。
Claude两个新模型实测流出!空间推理封神,算力直接榨干了
Claude两款新模型“棉花糖”和“甜瓜”实测流出,在3D强化学习和建筑空间布局上性能强大,还能直接理解并生成复杂3D坐标和空间关系。它们对算力吞噬疯狂,引发对其身份的猜测。
把事实核查嵌入诊疗流程:MedGuard给「诊疗安全」当守门人
蚂蚁AI安全实验室与厦门大学团队联合提出MedGuard,将医学事实核查嵌入诊疗流程。它是医疗安全基础设施,在诊疗意见等形成前验证事实,在评测和临床评价中表现突出,能准确判断风险边界,可嵌入医疗流程。
别让AI一上来就“进厂打螺丝”:智源悟界·Orca要先教模型理解世界如何变化
智源研究院悟界·RoboBrain Orca Team发布技术报告Orca,探索模型是否理解世界状态变化。Orca尝试在统一世界潜空间学习状态与规律,受海外关注。它先学世界表征,有独特学习方式,经实验验证效果良好。
社区供稿丨35B参数科学性能比肩万亿参数模型,『书生』科学大模型Intern-S2-Preview开源
5月15日,上海AI实验室开源新一代大模型预览版Intern - S2 - Preview,参数35B,多领域比肩万亿参数模型。它深化与昇腾算力生态协同,探索‘通专融合’,强化科学及智能体能力,‘算法 - 系统 - 算力’协同提升训推效率。
ChatGPT正式上线广告主平台,AI产品从今天开始走向分裂。
今日凌晨,OpenAI更新ChatGPT,上线非推理模型GPT - 5.5 Instant,还官宣向企业主全量上线广告平台。此前广告已在部分地区测试,付费和未成年用户无广告,免费用户可选择关闭但功能受限。投放端向美企开放,出价高,这或成AI产品宿命。
Pipeline MinerU真快不行了
文章聚焦Infinity-Parser,指出它把OCR从‘做识别’推进到‘做结构’。它采用layoutRL强化学习框架,结合真实与合成数据构建Infinity-Doc。跑分强且复杂结构表现优,透露Document AI向结构化生成转变趋势。
Agent RL 总是训练崩?UCLA 这篇论文给了救命稻草!
这篇解读UCLA和威斯康星大学麦迪逊分校论文《ARLArena: A Unified Framework for Stable Agentic Reinforcement Learning》的文章指出,Agent RL训练易崩溃,原因在于多轮交互任务带来奖励稀疏等问题。论文建“竞技场”,提出SAMPO算法提升稳定性,还给出从业者建议。
0.3B参数,600MB内存!腾讯混元实现产业级2Bit量化,端侧模型小如手机App
腾讯混元团队推出面向消费级硬件的“极小”模型HY-1.8B-2Bit,参数量仅0.3B,内存占用600MB。它基于产业级2Bit端侧量化方案,生成速度提升,还通过多种方法提升能力,未来将探索新技术缩小与全精度模型差距。
测试时Scaling或是最大错觉,Google:R1/O1强推理另有原因
Google 112 页论文实证,OpenAI 的 o 系列等模型推理能力提升并非仅因计算时间延长,而是源于对复杂互动的隐式模拟。通过三重验证表明推理能力跃迁或因‘吵得更凶’,而非‘算得更久’。