「RL for LLM」共找到 1173 篇相关文章
推荐文章8
为什么说多模态是推荐系统破局的关键?来自饿了么一线的实战复盘
文章围绕多模态推荐展开,从传统推荐算法演进到多模态表征技术,结合饿了么场景实践,还探索生成式推荐。介绍多模态推荐挑战与代表性工作,梳理表征技术发展,详述饿了么系统设计与训练,分析生成式推荐方案及业界路线。
阿里云开发者
新闻资讯8
靠AI把股价干涨735%,这家公司开始成批裁掉可替代岗,全员招聘须CEO点头
AppLovin联合创始人兼CEO Adam Foroughi分享公司发展历程。他曾借钱60亿美元回购股票获600亿美元回报,押注AI使股价涨735%。公司经历人员结构调整,清退老高管和可被LLM自动化岗位,招聘须他亲批,超80%代码由大语言模型生成。
AI前线
算法论文8
10步优化超越强化学习,仅需1条未标注数据!后训练强势破局
无监督的熵最小化(EM)方法仅需一条未标注数据和约10步优化,就能显著提升大模型在推理任务上的表现,甚至超越依赖大量数据和复杂奖励机制的强化学习(RL)。EM为大模型后训练提供了更高效简洁的新思路。
新智元