「后训练课程」共找到 3798 篇相关文章
突破多模态奖励瓶颈!中科院清华快手联合提出R1-Reward,用强化学习赋予模型长期推理能力
多模态奖励模型(MRMs)对提升多模态大语言模型表现至关重要,强化学习理论上可引入长期推理能力,但现有RL算法用于训练MRM会不稳定。中科院、清华等团队推出R1 - Reward模型,在多模态奖励模型benchmark上有显著提升。
震惊海外开发者!BOSS直聘3B小模型比肩80B,怎么做到的?
BOSS直聘楠北阁团队发布3B轻量端侧小模型Nanbeige4.1-3B,性能震惊海外开发者。团队从多方面改进,如优化推理和偏好对齐,重构训练数据,采用多种强化学习算法,使其性能比肩大模型。
腾讯LLM团队:对下一个 Token 预测的深入剖析,多样性 or 精准度?
最新研究证实RL能增强LLM推理,但成效受限预训练token分布。腾讯LLM部把交叉熵重写成单步策略梯度,用超参压熵,为RL打造‘低熵高信号’起点,经实验验证低熵模型优势明显。
4倍速吊打Cursor新模型!英伟达数千GB200堆出的SWE-1.5,圆了Devin的梦!实测被曝性能“滑铁卢”?
Cognition推出全新AI编码模型SWE-1.5,专为软件工程任务设计,运行速度快,在基准测试中成绩良好。它基于GB200芯片训练,有定制编码环境,开发有新战略,还与Cursor新模型Composer对比引发关注。
逼近5万亿美元!英伟达GTC深夜爆拉市值,Vera Rubin超级芯片首露面
昨夜英伟达GTC大会上,黄仁勋演讲后股价涨4.98%,市值增2300多亿美元达4.89万亿逼近5万亿。他介绍了Vera Rubin超级芯片等,还宣布多项技术成果,如AI原生6G协议栈、NVQLink等。
维基百科,终结了!马斯克开源版上线,用AI重写「真相」
马斯克发布开源版「维基百科」Grokipedia V0.1,称其足以秒杀维基百科。它收录超88万篇文章,通过Grok核查事实,支持交互、申报错误。但上线后遭质疑抄袭,也有好评,维基百科受AI搜索冲击,需翻身。
华人团队终结Token危机:扩散模型数据潜力超自回归三倍
最新研究发现,token数量受限下,扩散语言模型数据潜力超自回归模型三倍多。一个1B参数的扩散模型用1B tokens训练,在基准测试取得不错准确率,且未现性能饱和。
图像界的DeepSeek!12B参数对标GPT-4o,5秒出图,消费级硬件就能玩转编辑生成
Black Forest Labs开源旗舰图像模型FLUX.1 Kontext[dev],专为图像编辑打造,能在消费级芯片运行。12B参数少、推理快,性能媲美闭源模型。有诸多特点,经优化训练,在KontextBench基准表现优。
13 年苦熬到 170 亿市值,一夜间被用户抛弃!一封“AI吹”全员信让网友“不喷不行”
Duolingo是热门教育应用,市值达170亿美元。CEO宣扬“AI优先”,引发网友不满,大量用户抗议。Duolingo早期靠志愿者产出高质量内容,后用AI生成,在小语种上问题频发,公司还试图用搞笑视频化解危机。
开源Agent模型榜第一名,现在是阿里通义DeepResearch
阿里开源首个深度研究Agent模型通义DeepResearch,在多权威评测集上超越多个Agent模型。它采用多阶段数据策略,有两种推理模式,革新训练流程,已赋能高德出行Agent和通义法睿等应用,且模型等均已开源。