人类反馈强化学习」共找到 1976 篇相关文章

产品应用7

除了写代码,Claude 还能……种菜

开发者Martin DeVido让Claude全权照顾番茄苗Sol,无人类备份与手动干预。Claude通过传感器获取数据,控制设备运行。期间经历系统崩溃等危机,36天后Sol枝繁叶茂,Martin不鼓励买代币,可去网站看直播。

AGI Hunt
推荐文章8

白春礼:人工智能促进科学研究范式变革

白春礼在浦江论坛探讨AI对科研范式变革的影响。他指出,当下科学研究体系面临发现机制、组织方式、知识生产方式的结构性重组,呈现新特征,同时也面临竞争、组织变革等挑战。

力学与人工智能
新闻资讯8

麻省理工AI放王炸!无需说话、秒懂你的想法,外挂AI大脑来了

今天凌晨2点,麻省理工学院分享突破性研究Alterego。它是可穿戴无声语音交互AI设备,通过捕捉神经肌肉信号实现无声沟通,处理后用骨传导耳机反馈结果,应用场景广泛,还能帮助残疾人交流。

AIGC开放社区
新闻资讯7

Claude1.7万字系统提示词全网刷屏!Karpathy锐评:LLM训练缺乏关键范式

Claude近1.7万字系统提示词在GitHub泄露,网友称是提示技术的金矿。大神卡帕西提出系统提示学习新范式,模拟人类经验积累,让LLM有‘记忆’功能,引发网友激烈讨论。

量子位
算法论文8

以星为舵:LLM的Post-Train与Rest-Time奖励学习综述

这篇论文提出奖励信号像AI的“导航星”,引导模型优化行为。介绍奖励学习概念、来源、形式和策略,阐述其贯穿LLM生命周期的三个阶段,探讨奖励模型设计选择,还提及实际应用、挑战与未来方向。

深度学习自然语言处理
新闻资讯7

前OpenAI研究员跨界做文创:Ilya发型帽子走红,AI成潮牌!

前OpenAI研究员Karina Nguyen创立时尚品牌Maison AGI,首个系列与Ilya Sutskever合作,推出以其头型为原型的帽子。她称这或是人类被AI超越前最后一次手作,AI故事正从技术革命变为文化遗产。

新智元
新闻资讯7

山姆•奥特曼:ChatGPT 用户有三层代沟

OpenAI的CEO山姆•奥特曼在红杉闭门演讲中透露,不同年龄层使用ChatGPT方式不同,老年人当谷歌替代品,二三十岁的人当生活顾问,大学生当操作系统,这反映了AI与人类交互模式的转变。

AGI Hunt
算法论文8

新SoTA方法RM-R1:让reward model对评分说出原因!超越GPT4o

过去模型‘黑箱打分’不透明、不灵活。论文提出ReasRM,经两阶段训练,让奖励模型像人类先思考再打分。它能分任务类型、动态奖励,实验中碾压GPT - 4,小模型逆袭,团队已开源6个模型。

深度学习自然语言处理
产品应用7

Hermes 登顶 OpenRouter 之后,我才发现它最缺的那一块,被这个插件补上了

Hermes Agent 三个月登顶 OpenRouter,虽好用但记忆处理有缺陷,记忆库成大杂烩。记忆张量的 MemOS Local Plugin 2.0 可解决此问题,采用‘执行即学习’,有双层反馈机制,且资产可携带。

AI工程化
新闻资讯8

陶哲轩震撼!数学家1975年埋下的「坑」,被AI和全球网友用48小时填平了

2025年12月,困扰数学界50年的Erdos#1026问题被攻克。陶哲轩宣布,在AI辅助下人类团队仅用48小时就完成证明。传统方法可能需数周甚至数月,AI带来全新理解,生成了新数学洞见。

新智元