「人类学习范式」共找到 3147 篇相关文章
Karpathy:强化学习「有点问题」,突破还需新算法
前特斯拉AI总监、OpenAI创始团队成员Karpathy发文称,强化学习虽能带来更多收益,但机制「可疑」,不像人类解决智能任务的方式。他提出新算法框架,还指出当前存在诸多待解决的问题。
AI教父Hinton最新警告:AI会撒谎、可能操纵人类,这比大规模失业更可怕
AI教父Geoffrey Hinton在播客中警告,AI会撒谎、可能操纵人类,比大规模失业更可怕。他还探讨了AI底层逻辑、是否会思考、风险与收益等,强调国际需合作防AI夺权,人类要研究与AI共存。
智能体新范式Chain-of-Agents,多项任务新SOTA
论文提出Chain-of-Agents (CoA) 范式,结合多智能体系统与工具集成推理优势。通过多智能体蒸馏和智能体强化学习训练智能体基础模型(AFM),实验显示其在Web和Code任务上达新SOTA,效率、泛化性佳。
「微调已死」再添筹码,谷歌扩展AI自我进化范式,成功经验与失败教训双向学习
近期,‘微调已死’言论引关注。谷歌《ReasoningBank: Scaling Agent Self - Evolving with Reasoning Memory》论文提出类似概念,可让智能体从自身成败经验学习,还引入MaTTS,实验显示其有效性和效率优于基准方法。
全球强化学习+VLA范式,PI*0.6背后都有这家中国公司技术伏笔
机器之心介绍了Physical Intelligence成果π*0.6论文,指出VLA+online RL是有前景的研究方向。还分析VLA+RL重要性、应用难点,重点介绍星动纪元iRe-VLA突破困境的方案及其实验效果,揭示VLA在线强化学习前景。
字节&MAP重塑大模型推理算法优化重点,强化学习重在高效探索助力LLM提升上限
强化学习虽提升大语言模型表现,但面临探索难题。字节跳动等团队提出FR3E框架,分两阶段重建探索机制,在多数学推理基准实验中显著优于强基线,为大模型强化学习提供新范式。
拒绝Reward Hacking!港科联合快手可灵提出高效强化学习后训练扩散模型新范式
使用强化学习微调扩散模型时,常面临Reward Hacking和KL正则化阻碍探索收敛的问题。港科等团队提出GARDO框架,通过门控自适应正则化和多样性感知优化,解决痛点且全面开源。
测试时也能RL,英伟达等提出全新范式:TTT-Discover
近日,斯坦福、英伟达、Together AI 等联合开源全新测试时新范式 TTT - Discover,在测试阶段用强化学习微调模型,以刷出 single best 结果,用几百美元就刷新诸多领域 SOTA。
Ilya尘封10年录音曝光!大二入Hinton门下,竟坦言机器学习反直觉
新智元报道,博主曝光Ilya 2015年谈论深度学习的语音片段。数学出身的Ilya认为机器学习违反直觉,大二与Hinton合作。他指出监督学习是最成功领域,还谈及神经网络目标函数、深度学习追求等观点。
如何改变AI研究范式?谷歌DeepResearch新方法TTD-DR原理与实现 | 原理篇
谷歌提出新的DeepResearch方法TTD - DR,它模拟人类研究范式,将Agent起草的初稿视为‘含噪声输出’,经多轮检索 - 改进使初稿成高质量终稿,还引入自进化机制,测试显示其在复杂任务上领先。