人类反馈强化学习」共找到 1976 篇相关文章

产品应用8

第一个同时为人类和Agent设计的AI视频产品,它叫,LibTV。

Liblib推出的AI视频产品LibTV,是首个为人和Agent共同设计的产品,用优雅姿态解决兼顾专业与普通用户的难题。它面向人类的是无限画布,功能强大;面向Agent的是简单的Skills。

数字生命卡兹克
7

AI女歌手攻占美榜!格莱美天后崩溃:人类嗓音不值钱了

近日,AI歌手Xania Monet登上Billboard电台榜单,签300万美元合约,引发争议。格莱美天后SZA等抵制,认为其贬低音乐;也有歌手觉得可接受。AI降低创作门槛,但也带来版权等问题,其艺术性存争议。

新智元
算法论文7

直播预约 | 强化学习训练能否不依赖外部知识优化模型的弱点?

论文提出 SwS 框架,针对强化学习场景,利用模型自我感知弱点驱动自动化问题生成,合成针对性训练数据。还对其进行多项扩展,在多个基准测试集和模型上验证有效,性能提升显著。

深度学习自然语言处理
算法论文8

谷歌最新发表的Science论文,颠覆了人类对ASI的想象

谷歌等机构研究者在《科学》发文,提出真正智能爆炸已发生,是多元、社会性且与人类深度缠绕。推理模型内部涌现‘思想社会’,当下人机协作进入‘半人马时代’,还探讨了AI扩展、对齐及治理问题。

新智元
开源动态8

用多模态LLM超越YOLOv3!强化学习突破多模态感知极限|开源

华中科技大学、北京邮电大学等多所高校研究团队共同推出纯多模态开源LLM——Perception-R1,该模型用强化学习优化视觉感知,目前论文和代码均已开源,其在视觉任务上表现出色,为后续研究提供强大baseline。

量子位
产品应用7

实测完“灵光”,我意识到人类对 AI 助手的开发不足1%

作者实测蚂蚁集团的AI应用「灵光」,它是面向普通人的零门槛全模态AI助手,能30秒生成可互动小应用。作者测试其三大功能,认为人类对它的开发不足1%,它或成探索世界的伙伴。

AI科技评论
产品应用8

吴恩达来信:DeepLearning.AI Skill Builder工具隆重上线!

DeepLearning.AI发布Skill Builder工具,可根据用户AI项目经历给出个性化反馈和提升建议,从初学者到高级用户都适用,完全免费,还会生成总结报告,Pro会员有更详尽反馈

DeeplearningAI
开源动态8

给机器人一个会预测未来的Critic,VLA强化学习直接起飞

OpenMOSS团队开源的World Critic Model(WCM),解决了视觉 - 语言 - 动作模型强化学习(VLA - RL)中批评家模型(Critic Model)仅依赖单帧观测打分的问题。WCM让Critic学习预测执行动作后的潜在状态,代码等全开源,验证效果显著。

机器之心
算法论文8

突破通用领域推理的瓶颈!清华NLP实验室强化学习新研究RLPR

现有基于可验证奖励的强化学习(RLVR)应用范围局限,清华自然语言处理实验室提出 RLPR 技术,通过 Prob - to - Reward 提高概率奖励质量,有领域无关等特点,相关代码等已开源。

机器之心
产品应用7

训练世界模型,开始从人类的肌肉和脑子里偷师了

具身智能数据竞争进入新阶段,第一视角视频虽缓解数据量问题,但未记录人行动的原因及大脑身体实时修正。FaceMind提出Ego - NeuroLoop数据范式,配套NeuroMatrix和NeuroBooster,将训练数据从“行为库”推向“闭环库”。

量子位