过程奖励」共找到 538 篇相关文章

算法论文8

Make SFT Great Again!从SFT到DFT:一权重之差,泛化之跃

大型语言模型的监督微调(SFT)简单高效,但泛化能力弱于强化学习(RL)。本文直击 SFT 核心缺陷,揭示其泛化瓶颈源于隐含的“病态奖励结构”,并提出仅需单行代码修改的动态微调(DFT),实验表明其效果显著。

深度学习自然语言处理
开源动态7

AMD跑GLM 5.2,成本只要英伟达一半

推理优化公司Wafer公布数据,用AMD的MI355X芯片跑GLM 5.2,单节点吞吐达2626 tok/s,单流吞吐213 tok/s,成本不到英伟达B200的一半。该公司详述部署过程,还提及AMD软件生态的变化及英伟达面临的挑战。

量子位
算法论文8

AI「上班流」首次完整曝光!不点鼠标,只写代码,PPT也当函数调

CMU与斯坦福研究团队追踪AI工作过程,发现其用编程方式处理问题,执行方式与人类不同。AI速度快成本低,但存在伪造输出、工具误用等问题。人类虽慢,但在规范细节和实践判断上有优势,未来人机可按任务可编程性分工。

新智元
算法论文8

10步优化超越强化学习,仅需1条未标注数据!后训练强势破局

无监督的熵最小化(EM)方法仅需一条未标注数据和约10步优化,就能显著提升大模型在推理任务上的表现,甚至超越依赖大量数据和复杂奖励机制的强化学习(RL)。EM为大模型后训练提供了更高效简洁的新思路。

新智元
推荐文章8

Agent 一年半开发复盘:大家对 Agent 的理解有错位,有效的「认知流程」很关键

本文是作者对一年半AI开发过程的复盘,指出大家对Agent理解有错位,强调有效「认知流程」的关键作用。通过高考、学霸成长等例子阐述Agent核心,对比Chatbot与Agent,还从理论视角解释其有效性,最后点明开发者角色转变及面临的挑战与前沿探索方向。

Founder Park
推荐文章7

“光靠人盯不住了”!拆解上万张晶圆,这家公司靠AI将芯片良率提升数个百分点

喆塔科技创始人赵文政称国内跑通AI的半导体工厂少,工业AI尚处发展阶段。喆塔将DeepSeek接入自研大模型,提升训练效率。还分享了团队实例,强调工业AI决胜点在行业知识。此外,介绍了喆塔切入AI领域的过程、应用成果、面临挑战及未来策略等。

AI前线
6

ASO是什么意思?ASO目标与工作内容,ASO常见误区(基础篇)

ASO(应用商店优化)的精髓在于通过对产品特性的分析与用户群体标签的判断,挑选相关度高的关键词,提升App的覆盖、曝光、转化,从而获取更多用户。它不仅包括关键词搜索排名优化,还涉及榜单排名、转化率、推荐位等优化,提升App在应用商店的自然下载量。

孔学长
8

右兔短视频去水印工具正式上线!

右兔去水印工具,一键解析全网短视频,无需广告,免费下载,支持高清原画质。

孔学长
上一页54 / 54下一页