奖励函数」共找到 324 篇相关文章

算法论文8

告别多奖励跷跷板:Flow-OPD将多教师OPD带入图像生成

中国科学技术大学等机构团队提出Flow - OPD,这是首个将OPD引入流匹配模型的统一多任务后训练框架。它解决了流匹配模型后训练对齐中多任务的梯度冲突等问题,效果良好,未来有多个拓展方向。

机器之心
算法论文8

告别纯奖励试错!二次尝试+反思蒸馏,复杂任务提升81%

美国南加州大学和宾夕法尼亚大学团队提出新训练范式ERL,将「经验学习」引入强化学习,通过二次尝试和反思蒸馏,在复杂任务中性能显著提升,为构建长期自主智能体提供新思路。

新智元
新闻资讯7

字节即梦张楠:帮人类提升创造力,才是更有意义的「目标函数

在极客公园IF 2026创新大会上,张鹏与字节跳动即梦张楠探讨人与AI等内容。还放映AI短片《老妈的心愿》,全程由AI创作。张楠介绍合作计划,谈及创作挑战、AI与人关系、Sora与抖音差异等内容。

Founder Park
开源动态8

开源AI真人级互动老师,多Agent+可视化画布,函数/思维导图实时作图!

本文介绍开源项目ChatTutor,它是可视化互动式AI老师,能边说边画。有数学画布、思维导图等功能,未来将支持代码、物理等画布,可用于解题、备课等,已上线chattutor.app。

开源星探
算法论文8

AI「上班流」首次完整曝光!不点鼠标,只写代码,PPT也当函数

CMU与斯坦福研究团队追踪AI工作过程,发现其用编程方式处理问题,执行方式与人类不同。AI速度快成本低,但存在伪造输出、工具误用等问题。人类虽慢,但在规范细节和实践判断上有优势,未来人机可按任务可编程性分工。

新智元
产品应用8

从 Computer Use到 Datacenter Use:如何让 AI Agent 像调用函数一样驱动数据中心?

本文整理自 QCon 2026 北京站演讲,探讨如何让 AI Agent 驱动数据中心。指出 Agent 发展有 Multi - Agent 和 Datacenter Use 趋势,介绍 AKernel 基础设施,包括架构、技术支柱、部署方式等,还提及其实践落地与未来演进。

InfoQ
算法论文8

泛化性暴涨47%!首个意图检测奖励范式,AI工具爆炸时代意图识别新解法

随着大模型和工具增长,AI 助手意图识别遇新挑战。腾讯 PCG 团队用强化学习等方法,提升模型泛化能力,还从多方面剖析优势,最后提出未来研究方向。

机器之心
算法论文8

CNSNS|西工大曹文博、张伟伟:克服优化求解器中的损失条件数瓶颈:一种良性损失函数

基于优化的偏微分方程求解方法受关注,但实际慢于经典迭代求解器。本文从条件数角度审视效率瓶颈,指出标准MSE损失导致条件数平方放大、减缓收敛。提出稳定梯度残差损失SGR,在收敛速度与稳定性间建立平衡,实验验证其有效性。

力学与人工智能
新闻资讯7

全球人工智能创新创业大赛即将启幕!杭州拱墅全力打造AI创新高地

2025年6月,‘智汇运河·智算未来’全球人工智能创新创业大赛将启幕。大赛由杭州市拱墅区等联合主办,聚焦前沿领域,面向全球征集项目,设千万扶持奖励,助力拱墅打造AI创新应用示范区。

量子位
新闻资讯7

让Agent真正“行动”起来,Agent Skill开发者大赛火热报名中!

人工智能下半场聚焦‘行动’,Agent Skill成关键桥梁。Agent Skill开发者大赛今日启动,由AIGC开放社区与算泥社区联合主办,设双赛道,有官方支持和丰厚奖励,报名通道已开启。

AIGC开放社区