自蒸馏微调」共找到 1410 篇相关文章

开源动态8

吞下17亿图片,Meta最强巨兽DINOv3开源!重新定义CV天花板

Meta训出70亿参数「视觉巨兽」DINOv3并完全开源。它用监督学习,无需人工标注,可生成强大图像特征,在多任务超专用方案,NASA已用其探索火星,还能推动多行业进步。

新智元
算法论文8

数学推理热潮下的冷思考!如何训练真正"全能"的推理模型?

论文评估20余个开源推理模型在多领域表现,发现多数模型数学成功难迁移。揭示微调方法(RL vs SFT)决定能力泛化,SFT像‘填鸭’,RL似‘思维健身’,为构建通用推理智能体提供新路径。

深度学习自然语言处理
新闻资讯7

牛芯半导体完成UB协议IP互通验证

近日,牛芯半导体搭载研控制器IP的原型验证平台,与万里眼标准UB网络测试仪完成对接,标志其研UB控制器IP在协议一致性上迈出关键一步,为生态伙伴开展兼容性验证提供范本。

芯师爷
算法论文7

OpenAI和Anthropic费尽心机加密的思维链,竟然能被轻松提取?

围绕大模型蒸馏争议已久,此前外部团队难获闭源模型完整推理。8 月 10 日研究者公开方法,可让弱模型读取旗舰模型密文并输出推理,还发现公开智能体轨迹存在隐私泄露问题,不过未为蒸馏指控提供决定性证据。

DeepTech深科技
新闻资讯7

Claude半个月连崩7次!全球宕机3小时,强制实名精准封号

Claude半个月内7次大规模故障,全球宕机3小时,开发者破防。原因是Anthropic算力储备告急,为救拟研芯片。此外,Anthropic还通过改定价、加闸、实名验证等措施控制成本。

新智元
算法论文8

无需训练的LLM对齐方法综述

大型语言模型应用引发担忧,传统微调方法有短板,免训练对齐(TF Alignment)应运而生。本文是首篇系统综述TF对齐技术的论文,提出三阶段分类框架,实验显示TF方法优势明显,还指明未来研究方向。

深度学习自然语言处理
推荐文章7

AutoResearch-LLM:让 Agent 接手 LLM 训练优化

本文是 LLM 微调 AutoResearch 落地实战。作者将电商场景 Qwen3 微调流水线沉淀成 Agent 驱动的三阶段框架,还分享踩坑经验。思路方法与平台无关,可类比到外部环境,适合关注 AI Coding 等的同学。

阿里云开发者
新闻资讯8

中国人能飞!杭州发布全球首款站姿载人飞行器

杭州酷飞发布站姿个人飞行器Urban、坐姿个人飞行器Dream及研NA80飞控系统。产品操作简便,已获海外近百台定金订单,还构建了安全防护体系并补齐保险。两款飞行器定位不同,核心是研飞控。

量子位
产品应用7

深度体验DeepSeek Harness,我原谅它涨价了

本文深度体验了DeepSeek Harness,它已发布并开源代码。其一切如模型、工具等皆为可插拔积木,官方内置超百个插件。介绍了安装方法、使用特点,还对比了与Codex差异,认为它是Agent时代的安卓,有望推动进化。

量子位
新闻资讯7

独家|RoboScience 机器科学完成10亿元融资,资金将用于强化 VLOA 大模型与本体

AI科技评论独家消息,RoboScience机器科学近日完成10亿元A轮融资,将深化VLOA大模型技术,推进研机器人本体工程化与量产。其VLOA大模型有创新性架构,能实现通用泛化,还将发布研机器人本体。

AI科技评论