可验证过程奖励」共找到 1293 篇相关文章

推荐文章7

AI 领导力:像管理团队一样管理 AI

本文整理自腾讯专家工程师揭光发演讲,介绍以高效方式管理 AI 如管理团队,探讨“AI 领导力”四大支柱。还分享 Vibe Coding、Vibe Working 应用,阐述 AI 对行业冲击及人才结构变化。

InfoQ
算法论文8

微软 & UT Dallas 联手揭秘:从 SFT 到 RL 的进阶之路

微软与 UT Dallas 合作论文揭秘大模型做漏洞检测从 SFT 到 RL 的后训练流程,构建 C/C++ 漏洞数据集跑通全流程,总结六大‘避坑’指南,还开源整套框架、数据集和模型。

深度学习自然语言处理
产品应用7

Anthropic重磅更新skill-creator:创建skill全面告别“草台班子”时代

Anthropic升级skill - creator,让普通人创建skill更友好且有效。将测试等机制引入创作,能验证skill有效性。还支持多智能体并行测试、A/B测试,优化触发描述,为未来自然语言定义skill过渡。

AI寒武纪
开源动态8

多模态Deep Research,终于有了「可核验」的评测标准

俄亥俄州立大学与 Amazon Science 等联合发布 MMDR - Bench,将多模态 Deep Research 评估拉到可核验标准。它含 140 个专家任务,覆盖 19 领域,把评估拆成 3 段管线、12 指标,强调过程证据链。

机器之心
新闻资讯7

震撼!0人类,16个Claude全自主开发,2万美元十万行代码成功运行Linux

Anthropic研究员用Claude Opus 4.6智能体团队自主编写超十万行代码的C语言编译器,能运行《毁灭战士》、编译Linux内核。团队用拉夫循环等机制让Claude自主开发,虽有局限但全自动软件开发时代已提前降临。

AIGC开放社区
算法论文8

治好多模态近视和走神!上海大学去偏干预显著提升模型性能

多模态大模型存在“近视”和“走神”问题,总是过度关注图像底部而忽略核心内容。上海大学与南开大学研究团队用两条数学公式去偏干预,无需增加计算成本,却能显著提升主流模型视觉理解能力。

AIGC开放社区
产品应用8

Agent当上群主后,群聊变成办事大厅了

文心APP内测“多人、多Agent”群聊功能,像微型“办事处”,能替人办事、支招,效率高。百度文心团队提出Group - MAS攻克技术难关,此功能是全栈技术验证,还将有新玩法。

量子位
算法论文8

字节跳动李航博士新作:AI智能体的通用框架

字节跳动李航博士在JCST发表观点论文,提出涵盖软件和硬件智能体的通用框架。该框架以完成任务为目标,依赖LLM,用强化学习构建。文章还探讨了与大脑机制关联、未来研究方向等。

机器之心
产品应用7

Qwen3满血版上线,第一件事就是把搜索按钮干掉了。

Qwen3-max满血版发布,去掉搜索按钮,因模型能力提升无需手动控制。它具备自适应工具调用能力,能自行判断何时使用搜索等工具,思考过程结构化,跑分接近一线模型。

探索AGI
算法论文8

AMS | 西工大向锦鹏、宋述芳等:一种用于伴随方程求解的物理约束图神经网络

伴随方法用于高维优化问题,但求解伴随方程代价大。本文提出物理约束图神经网络(ADJ - PCGN),构建流场解与伴随向量映射模型,有精度和泛化性,能加速优化,方便嫁接求解器。

力学与人工智能