「人类反馈强化学习」共找到 1981 篇相关文章
Nature重磅发文:深度学习x符号学习,是AGI唯一路径!
大模型虽惊艳,但权威认为仅靠神经网络难达人类级智能。符号AI曾被边缘化,如今‘神经–符号融合’升温。神经网络与符号算法各有利弊,业界探索出不同融合路径,不过对其能否通往AGI仍存争议。
一群年轻人,正在训练AI宠物的灵魂 | 甲子光年
文章讲述了芯宠工场团队训练AI伴宠Lito的过程。通过各种试验,Lito能做出预设外反应,其‘灵魂’在与人类互动中生长。团队面临功能与情感的抉择,市场上也有其他创业者挖掘AI情感陪伴赛道。
14万一台家务机器人!斯坦福华人博士具身创业首款产品亮相,用户还能买回去自己教
斯坦福华人博士赵子豪与迟宬创业推出家务机器人Memo,售价2万美元。它能完成多项家务,依赖ACT - 1具身模型,该模型用技能捕捉手套采集人类数据训练,用户还能教它新本领,预计2026年正式推出。
下一代目标检测模型:3B参数MLLM Rex-Omni首度超越Grounding DINO,统一10+视觉任务
IDEA研究院团队用3B参数的Rex - Omni打破MLLM目标定位精度僵局。它统一视觉任务,结合坐标编码与强化学习,在多项检测基准超Grounding DINO等,解决定位和行为缺陷,为MLLM成下一代检测模型提供方案。
RL成本降幅超90%!Meta提出Agent训练新范式DreamGym
传统强化学习(RL)训练LLM Agent面临成本高、任务多样性不足等挑战。Meta团队提出DreamGym框架,以经验合成为核心,通过三大组件协同工作,在多种任务和模型上提升性能,为通用Agent训练开辟新路径。
LSTM之父Jürgen再突破,「赫胥黎-哥德尔机」让AI学会自己进化
LSTM 之父 Jürgen Schmidhuber 对 2003 年提出的哥德尔模型进行新尝试,构建赫胥黎 - 哥德尔机(HGM)。它能在 SWE - Bench Lite 媲美最佳人类设计智能体,还在多基准测试中超越现有方法,展现强大迁移能力。
汪军对话 Rich Sutton:大模型在一定程度上分散了我们对智能理解的注意力
在RL China 2025开幕式上,汪军与图灵奖得主Richard Sutton对话。Richard认为大模型缺乏目标和奖励,分散对智能理解的注意力。他强调RL核心是从经验学习,智能原则含梯度下降等,建议将目标解读为“奖励”。
刚刚,Thinking Machines Lab首次发长文,揭开LLM推理不确定性真相
Thinking Machines Lab发长文《克服LLM推理中的不确定性》,指出大语言模型推理不确定性的真正元凶是缺乏批次不变性,还解释核函数计算中数字加法顺序问题,介绍使核具有批次不变性的方法并给出实验结果。
刚刚,OpenAI前CTO Mira Murati公司Thinking Machines Lab发文,揭开了大模型不确定性的真相
OpenAI前CTO Mira Murati创立的Thinking Machines Lab推出研究博客Connectionism,首篇文章聚焦LLM推理的非确定性问题。研究发现真正原因是批次不变性缺失,提出实现批次不变内核的方案,实验效果显著。
李国杰院士:AI4S里程碑式重大成果综述
本文由李国杰院士撰写,对AI for Science近年里程碑式突破做全面综述,涵盖数学、物理、化学等多领域成果,如李雅普诺夫函数构造、AI辅助核聚变等,还探讨了AI4S潜力与挑战。