「RL4HS」共找到 1727 篇相关文章
SFT远不如RL?永不过时的剃刀原则打开「终身学习」大模型训练的大门
现代AI系统学习新任务时会灾难性遗忘旧知识,限制其持续学习能力。麻省理工学院研究者对比SFT和RL后发现,相同性能下RL更不易遗忘,提出遗忘定律,解释了RL优势源于其on - policy特性。
从后训练回到预训练,LLM+RL 的潜力兑现有有机会走更远吗?
RL与LLM结合是重要技术方向,应用从后训练延伸至预训练。虽看似为LLM+RL带来希望,但RL本身有局限。微软等提出的RPT有潜力,不过训练语料等未广泛验证,且需大量计算资源。
Claude 4 要来了!
AI专家在Anthropic前端配置发现Claude 4痕迹,其或有查看AI思考过程功能。当下OpenAI、Google、xAI等对手来势汹汹,Claude 4压力大,但可在可解释性等方面破局,预计5月22日公布。
2050大会「AGI4Science·新生论坛——正在生长的科学地图 」嘉宾阵容全览!
2026年4月25日上午9点,2050大会将举办“AGI4Science·新生论坛”。论坛由王婷召集,以“三幕剧”展现AI4S从理论到产业的前沿图景。涵盖多领域,17位专家探讨AI4S生长变革,涉及聚变商用、芯片设计等议题。
RL 是新的 Fine-Tuning
今年 9 月,Thinking Machines 研究使 LoRA 重获重视。OpenPipe 创始人 Kyle Corbitt 访谈指出,多数场景微调 ROI 低,RL 将融入 agent 生命周期成主流,但 RL 落地难在环境搭建,World Model 或为关键。
OpenAI强制「处死」GPT-4o!80万老粉全网拯救:它不是代码是爱人
1月29日OpenAI官宣2月13日强制退役GPT - 4o,80万粉丝不满,发起“拯救4o”运动,提出缓冲期短、保留访问权等诉求,还指出模型停用影响订阅价值。此前GPT - 4o就曾面临下线危机,其使用也有安全隐患。
即梦图片4.0来了,我整理了10个好用到爆的进阶玩法。
字节即梦图片4.0背后是seedream4.0模型,与NanoBanana性能相当,但支持直出4K图、自由控比例、文生图审美和可控性强,中文字生成领先。文章整理了它在虚拟模特、换装等10个方面的玩法。
交互扩展时代来临:创智复旦字节重磅发布AgentGym-RL,昇腾加持,开创智能体训练新范式
强化学习之父指出人工智能迈入「经验时代」,在此背景下,复旦、创智、字节研究者发布 AgentGym - RL 框架。它是全新端到端 RL 框架,提出 ScalingInter - RL 方法,7B 模型经训练追平顶尖商业模型,为 AI 发展注入动力。
明天,是GPT-4o的葬礼。
美国时间2月13号早上10点,GPT - 4o将正式下线,引发用户集体哀悼。虽其能力被新模型超越,但它有人文关怀,能给人温暖。如今AI行业重编码能力,忽略人文,GPT - 4o时代或成AI黄金时代。
奥特曼砍掉GPT-4o引爆AI「戒断反应」,马斯克官宣Grok 4全球免费!
奥特曼在发布GPT - 5时砍掉旧模型引网友不满,他认为要防止用户对AI成瘾,让产品利大于弊;马斯克则官宣Grok 4全球免费,用热辣模式等吸引用户,形成上瘾曲线。