可验证过程奖励」共找到 1293 篇相关文章

算法论文8

西交大 x A*STAR 论文:让 AI 学会「保持一致」,多图生成迎来关键突破丨CVPR 2026

西安交大与新加坡A*STAR团队提出论文《PaCo-RL: Advancing Reinforcement Learning for Consistent Image Generation with Pairwise Reward Modeling 》,将一致性问题转为“跨图比较”学习问题,结合强化学习实现能力闭环,提升多图生成一致性。

AI科技评论
算法论文8

显存暴降92%!哈工大为线性注意力开辟了新道路

哈尔滨工业大学等团队发现线性注意力性能不足根源是查询范数丢失等。基于此提出NaLaFormer,在ImageNet - 1K准确率最高提7.5%,超分任务峰值内存降92.3%,为线性注意力发展开辟新道路。

AIGC开放社区
算法论文7

Anthropic 新研究:AI出错是“热混乱”

Anthropic研究团队发现AI可能无一致目标,只是瞎搞。他们将AI错误分类,测试发现推理越久越混乱,大模型复杂任务易失控。此发现改变对AI风险的认知,论文已在arXiv发布。

AI工程化
开源动态8

EmbodiChain开源,用100%生成式数据自动训练具身智能模型

跨维智能开源EmbodiChain,它是通往GS - World的基石,重构具身智能学习范式。其以100%生成式仿真数据训练机器人,突破数据瓶颈,还对比了不同路线,测试显示其模型效果佳。

机器之心
开源动态7

最强开源0.9B级OCR模型!PaddleOCR-VL本地一键部署!

作者分享本地部署PaddleOCR-VL的经历,包括踩坑过程、解决办法及启动指令。该模型识别速度快,支持OpenAI API格式,可轻松接入Fastgpt、Dify、n8n等平台。

开源星探
新闻资讯8

强化学习之父:大语言模型走错了路,不符合「苦涩教训」精神

2024 年图灵奖得主、强化学习创始人之一 Richard Sutton 在播客中批评 LLM 发展方向,认为其无真正智能,违背「苦涩教训」原则,缺乏持续学习能力,仅模仿人类,未理解世界。此观点引发 AI 社区激烈讨论。

AGI Hunt
算法论文8

英伟达发布 Jet-Nemotron 系列小模型,理论最大加速比 56 倍

英伟达发布 Jet - Nemotron 系列小模型,在多项基准测试中表现出色,实现高吞吐量加速和高准确率。其训练采用 PostNAS 方案,对既有模型针对性优化,展示了在小模型优化上的可行技术路径。

AI科技评论
产品应用7

AIGCode宿文:我就是要自训练大模型,直接做「L5」| AI产品十人谈

AIGCode宿文坚信Coding是培育大模型的最佳场景,公司自训练66B基础模型,发布锡月大模型,开启AutoCoder内测。宿文认为AI Coding能解决代码供给问题,目标是实现AGI,虽面临诸多质疑,但他坚持直接做L5。

AI科技评论
开源动态7

本文关注vllm V1中管控模型分布式推理的Executor部分,介绍其类型、Executor-Workers架构及数据传输机制,对比V0架构优势,以单机多卡的MultiprocExecutor为例展开讲解,还提及不同数据量的传输方式及相关代码。

猛猿
产品应用7

Claude 5.1来了,但最强能力只向少数机构开放

9月1日,Anthropic发布Claude Fable 5.1和Claude Mythos 5.1,二者用相同底层模型,区别在安全限制和开放范围。Fable面向订阅用户和企业,Mythos仅向少数审核机构开放,此次还尝试新的开放方式。

AIGC开放社区