「可核验奖励」共找到 4198 篇相关文章
见微知著:LLM 奖励建模的「Analytic Rubric」范式全面综述
该文是对LLM奖励建模的「Analytic Rubric」范式的全面综述。介绍了Rubric概念来源,指出传统奖励模型存在对齐风险,而Rubric RM在多方面取得平衡,还阐述其工作流、各维度研究情况及面临的挑战。
Meta 悄悄开源了两个惊艳的 3D 重建模型,物体重建+人体重建!
前两天AI圈被Gemini 3 Pro刷屏,Meta却悄悄开源了两个“硬核”项目:SAM 3D Objects可从一张照片重建任意物体,SAM 3D Body能从一张照片重建人体网格模型,二者结合可构建完整3D场景,且全部开源、可商用。
4K-Agent:可将低分辨率图像提升至4K高清智能体
图像超分辨率技术在多种视觉任务中重要,但传统方法泛化能力有限。德克萨斯A&M等大学研究人员推出4K Agent,其多智能体架构能将低分辨率图像提至4K高清,在多领域测试表现出色。
北大腾讯突破奖励模型瓶颈!让AI理解人类偏好,泛化能力比肩GPT-4.1
北京大学知识计算实验室联合腾讯等机构提出RewardAnything,突破奖励模型瓶颈。它让奖励模型理解自然语言评判原则,降低成本,泛化能力比肩GPT - 4.1,还能用于定制AI行为模式。
Agent Team 实践与架构设计:在约束下构建可演进的一个人开发团队
作者结合构建的Routa,探讨在Token、流程、工具选择等约束下构建可演进的多Agent系统。介绍了Routa架构、原则,如跨Agent通信、状态外置等,还阐述了各设计要点及示例,强调系统可演进性。
超越免训练剪枝:LightVLA引入可微分token剪枝,首次实现VLA模型性能和效率的双重突破
文章介绍LightVLA框架,它是用于提升VLA推理效率和性能的视觉token剪枝框架。针对VLA模型计算开销大、推理延迟高问题,提出两大创新,在LIBERO实验中性能超经典模型,还实现推理加速。
GPT5.5 + Codex 如何跑一整夜,编程的下一步,不是辅助编程,是可托管执行单元
文章指出GPT - 5.5在Codex里展现出强大自主性,能处理长时程任务。还介绍让其跑长任务的方法及面临的问题,强调长任务需状态机、证据链等,社区也在构建相关工作流层。
开源白嫖!微软这个开源 Agent,让 AI 帮你点按钮、填表格、跑多步流程(还可跨设备)
微软开源智能自动化框架 UFO,主线是 UFO³(Galaxy 多设备编排)+ UFO²(Windows 桌面 AgentOS)。能将多步任务拆分执行,解决跨应用、多步骤甚至跨设备任务难题,有多种功能亮点。
Andrej Karpathy:AI本质是「软件2.0」,并非电力或者工业革命
Andrej Karpathy分享AI影响经济的思考,认为应将AI视为“软件2.0”,提出预测AI自动化能力的“可验证性”指标,回顾软件1.0,阐述软件2.0,指出“可验证性”决定AI进展的“锯齿状”前沿。
突破通用领域推理的瓶颈!清华NLP实验室强化学习新研究RLPR
现有基于可验证奖励的强化学习(RLVR)应用范围局限,清华自然语言处理实验室提出 RLPR 技术,通过 Prob - to - Reward 提高概率奖励质量,有领域无关等特点,相关代码等已开源。