RL后训练」共找到 3841 篇相关文章

推荐文章8

刚刚!北大校友Lilian Weng最新博客来了:Why We Think

北大校友Lilian Weng更新博客《Why We Think》,回顾利用测试时计算的研究进展,探讨让模型“思考更久”的方法。文中介绍了思维链、潜变量建模等策略,还提及多种提升生成质量的策略,如并行采样与序列修订,以及强化学习提升推理能力等内容。

机器之心
6

新站上线一周,一天从谷歌获取2.85万点击是什么体验。

新网站上线,如何快速获得谷歌的曝光和点击?哥飞和良辰美通过新词新站理论,实现了网站流量的大幅提升。但排名波动和曝光点击数的差异,背的原因究竟是什么?

哥飞
8

ART:构建可靠智能体的强化学习新框架

现有AI智能体在真实场景表现不稳定,阻碍其应用走向生产。ART开源强化学习框架诞生,通过分离“前端”与“端”、兼容OpenAI推理端点等创新化解困境,还给出使用方法,在案例中展现强大效能与经济性。

AI工程化
开源动态8

低调霸榜全球最难SQL榜单超两月,国产AI这次选择高调开源!

蚂蚁数科低调霸榜全球最权威SQL榜单超两月高调开源Agentar - SQL系列。其核心思想是让AI赋能生产,在金融场景验证能力外溢到多领域,还采用按效果付费模式,展现强大竞争力。

量子位
新闻资讯7

LennyBot背:一个价值1600万美元的"高级FAQ"

著名播客主Lenny Rachitsky推出LennyBot,可就其节目内容聊天并导流,背公司Delphi获红杉1600万美元A轮融资。作者体验认为它是高级FAQ,分析Delphi商业模式,指出赛道类似千播大战,红杉赌的是时间窗口。

AI产品黄叔
推荐文章7

中学生就能看懂:从零开始理解LLM内部原理【十】| “过拟合” 与 Dropout

文章围绕神经网络过拟合问题展开,介绍了过拟合的概念、危害及产生原因,阐述了缓解过拟合的正则化方法,重点介绍了Dropout随机失活,还指出其局限性及在大模型中的应用策略。

AI大模型应用实践
算法论文7

The Batch: 931 | 统一视觉媒体的单一分词器

Apple团队开发多维分词器AToken,可将图像、视频、3D对象映射到共享token空间,统一处理视觉媒体。它由预训练编码器和解码器组成,经多阶段训练,在多任务上达或接近先进水平,为视觉模型带来通用性。

DeeplearningAI
新闻资讯8

汪军对话 Rich Sutton:大模型在一定程度上分散了我们对智能理解的注意力

RL China 2025开幕式上,汪军与图灵奖得主Richard Sutton对话。Richard认为大模型缺乏目标和奖励,分散对智能理解的注意力。他强调RL核心是从经验学习,智能原则含梯度下降等,建议将目标解读为“奖励”。

AI科技评论
开源动态8

秋招超强助攻:零基础1小时上手GPT微调!全流程教程免费开源

新一年秋招季,岗位对AI能力要求提升。OpenAI发布新开源大模型GPT - OSS,博主Lorentz Yeung开源本地部署和微调训练GPT - OSS的教程,助零基础者上手,还介绍环境搭建、代码和训练效果对比。

新智元
算法论文7

管你模型多大,250份有毒文档统统放倒,Anthropic:LLM比想象中脆弱

Anthropic等联合研究打破传统观念,只需250份恶意文档就能在参数规模从6亿到130亿的LLM中植入门,且与模型规模及训练数据量无关。研究还测试了特定门攻击,评估了多种训练配置。

机器之心