一致性蒸馏训练」共找到 2334 篇相关文章

算法论文8

华为发布如何利用RL训练强大的Deep Research Agent综述!

华为技术团队发布综述论文,首次系统性梳理利用强化学习(RL)训练强大的深度研究代理。论文指出传统SFT和DPO方法有局限,RL优势明显,还在数据构建、算法设计等方面给出进展与路线图。

深度学习自然语言处理
算法论文8

谢赛宁与Jaakkola团队重磅研究:无数据Flow Map蒸馏

麻省理工学院Tommi Jaakkola和纽约大学谢赛宁团队联合研究,提出无需数据、仅从先验分布采样实现flow map蒸馏的新方法。该方法可规避“教师 - 数据不匹配”风险,在ImageNet实验中表现出色。

机器之心
新闻资讯7

GPT-5-Thinking新训练方法公开:让AI学会忏悔

OpenAI提出忏悔训练Confessions,让ChatGPT自己“坦白从宽”。在GPT - 5 - Thinking上实验有效,模型犯错后多会坦白,且更诚实,不影响原任务表现。还介绍了训练方法、实验结果及局限性。

量子位
算法论文8

训练数据枯竭怎么办?首篇「数据价值密度」综述理清思路

上海交通大学与上海人工智能实验室团队发布首篇「数据价值密度」综述。提出“数据价值密度”概念并定义,建立分类框架梳理现有工作,还指出该领域面临的挑战,为大模型训练提供指南。

机器之心
算法论文7

「Next-Token」范式改变!刚刚,强化学习预训练来了

微软新研究提出「强化预训练(RPT)」新范式,将下一个 token 预测任务重新定义为推理任务,可利用海量文本数据进行通用强化学习。该方法有可扩展性、低风险等优点,实验显示其提升了语言建模能力。

机器之心
算法论文8

何恺明等降维打击!彻底颠覆AI生图,无需预训练一步到位

何恺明团队推出生成模型MeanFlow,它跳脱传统训练范式,无需预训练等,仅一次函数评估就能完成生成。在ImageNet 256×256上表现优越,缩小了一步与多步模型性能差距。

新智元
产品应用8

人物一致性新王Nano Banana登基,AI图片编辑史诗级升级。

Nano Banana是神秘的AI绘图新模型,大概率出自Google。它生图一致性超强,在人物一致性、背景替换等多方面测评中完胜GPT - 4o等模型。虽仅在LMArena盲测随机出现,仍值得一试。

数字生命卡兹克
推荐文章7

清华叉院教授手把手教你用强化学习训练智能体

在大模型智能体时代,智能体强化学习训练通用智能体很关键。ASearcher 是相关项目,AReaL 有交互次数和代码设计优势。本次吴翼教授将带团队成员,以多轮搜索智能体为例,教用最少代码实现训练

机器之心
新闻资讯7

爱思唯尔把Meta告了:拿Sci-Hub盗版论文训练大模型

学术出版巨头爱思唯尔等多方原告起诉Meta,指控其未经授权获取、复制受版权保护的学术论文训练Llama大模型,数据源于Common Crawl和盗版平台。Meta以‘合理使用’抗辩,AI版权合法性尚无明确判例。

量子位
新闻资讯7

五角大楼计划将绝密数据喂给AI,训练军事特供版模型

《麻省理工学院技术评论》称,五角大楼正讨论为生成式人工智能公司建安全环境,用机密数据训练军事特定版本模型。美国军方重构战略,推动先锋项目,还筹备用绝密数据训练模型,引发安全担忧。

AIGC开放社区