自蒸馏」共找到 1156 篇相关文章

推荐文章8

AI越用越聪明,主+进化是关键拼图丨盛大邓亚峰EverMind@AIGC2026

在AIGC2026峰会上,盛大集团邓亚峰指出,AI范式从Chat转向Agent,未来AI需“主”与“进化”,长期记忆是关键。EverMind团队基于此研发相关技术,成果显著,还提出个人记忆主权等观点。

量子位
开源动态8

Meta视觉基座DINOv3王者归来:监督首次全面超越弱监督,商用开源

Meta推出并开源视觉基础模型DINOv3,采用监督学习,首次全面超越弱监督,可生成高质量高分辨率视觉特征。它在多任务表现出色,参数和数据量提升,还构建模型家族,已在多领域产生实际影响。

机器之心
新闻资讯7

Meta CEO X 微软 CEO 对话解读:「蒸馏工厂」为何成为开源的魅力之源?

Meta CEO Mark Zuckerberg 和微软 CEO Satya Nadella 在 LlamaCon 2025 闭幕会议对话,探讨AI对技术平台等影响,如使文档、应用和网站界限模糊,还谈及开源与闭源模型战略价值及‘蒸馏工厂’概念。

机器之心
算法论文8

训练提速5倍,响应缩短50%:动态感知能力,重塑高效LLM Reasoning范式

大型语言模型“思维链”技术有冗余,传统优化方案存在静态先验与动态能力错配问题。论文提出的DR.SAF框架赋予模型动态感知能力,通过三模块协作,实现推理“精准瘦身”,解决根本冲突。

深度学习自然语言处理
新闻资讯8

首家央企AI独角兽浮出水面!背靠研大模型,4家国家队资本背书

中电信人工智能科技(北京)有限公司成为央企首家AI独角兽,完成首轮增资,引入四家国家级战略投资方。其靠研“星辰”系列大模型,在多领域突破,实现技术与市场认可闭环,有望推动AI产业落地。

量子位
算法论文8

扩散语言模型真的会比回归好?理论分析结果可能恰恰相反

北京大学和蚂蚁集团研究表明,扩散语言模型虽理论上有并行生成优势,但实践中在某些任务推理成本更高。研究通过实验对比,分析了扩散与回归模型在不同评估指标下的效率,指出选择模型要视任务需求。

机器之心
算法论文8

数据集蒸馏,连发两篇顶会!10%样本实现全量性能,鲁棒不失真

数据集蒸馏能让模型高效节能,WMDD和GUARD两项研究分别解决保留原始数据特性、提升模型对抗扰动能力问题。WMDD用Wasserstein度量保留几何特性,GUARD平滑损失景观获对抗鲁棒性。

新智元
新闻资讯8

直击WAIC:萝卜快跑入选「国家队」,AI数字人技术升级,百度全栈研杀疯了

在世界人工智能大会 WAIC 上,百度成果亮眼。萝卜快跑入选「国家队」,出海进展快,还与 Uber 合作;数字人技术升级,发布 NOVA。百度靠全栈研技术体系支撑,目标是打造数百万个超级应用。

机器之心
产品应用7

养虾时代终结?免部署、7×24小时在线、进化的“赛博骡子”来了!

全球首个进化个人AI——MuleRun(骡子快跑)正式发布,免部署、7×24小时在线、可主进化。它适配个体需求、实现群体智慧共享,能完成多类任务,还保障安全、提供售后。

量子位
开源动态8

Thinking Machines 发布又一神作「在线策略蒸馏」 ,LLM后训练效率飙升50-100倍

Mira的THINKING MACHINES开源「在线策略蒸馏」LLM后训练方法,结合两种主流后训练范式优点,提升训练效率50 - 100倍,成本降低9到30倍,可用于数学推理、模型个性化等场景。

AI寒武纪