推荐文章8
快手GAVE:出价算法新SOTA
王喆的AI笔记
AI 摘要
王喆介绍快手GAVE出价模型,它结合生成式与强化学习。回顾PID、MPC、RL等算法不足后,阐述GAVE创新点。其经多验证效果好,已提升快手广告收入,未来有望催生出价大模型。
阅读原文 · 王喆的AI笔记
出价算法新SOTA——快手首提生成式强化学习出价
文章介绍快手新提出的生成式强化学习出价模型GAVE,回顾出价算法发展历程。GAVE结合生成式与强化学习优势,有Score-based RTG等创新,经竞赛、实验验证效果佳,为出价技术带来新方向。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
算法论文8
具身智能:告别通用模型,走向异构编排
当VLA、WAM等机器人控制策略在各自任务中表现出色,如何为子任务匹配合适策略成完成复杂长时序任务关键。RoboHarness解决异构策略协同难题,通过协同调用策略提升成功率。
机器之心
产品应用7
Cursor:每家应用公司都应训自己的模型
今年5月,Cursor推出Agentic编程模型Composer 2.5,相比前代能力更强、成本效率更高。Cursor研究负责人认为最强大的RL环境就是自己的产品,文中还介绍了Composer 2.5训练方式、面临的挑战及解决办法等。
Founder Park
算法论文8
DYPO:让SFT与RL协同提升大模型推理
在大模型推理能力增强研究中,SFT和RL两种后训练范式难有效融合。研究团队提出DYPO动态策略优化方法,先判断样本学习阶段再匹配优化路径,在多场景实验中表现出色,不过有实验边界。
量子位
新闻资讯8
AI Spot 分享会聚焦 ICLR 2026 深度推理
当大模型走向深度推理,ICLR 2026 汇聚全球顶尖成果。OpenMMLab 等联合发起 AI Spot ICLR 2026 学术分享会,5 月 14 日 19 点直播,聚焦模型‘慢思考’,嘉宾将解读四大核心技术。
OpenMMLab