自蒸馏微调」共找到 1410 篇相关文章

算法论文8

DeepMind揭示Reasoning内在机制

近年来大型推理模型在复杂任务表现出色,但推理机制成谜。本文提出用推理图解码其‘思考轨迹’,分析环状结构、直径大小和小世界特性,发现蒸馏模型等特点,为理解AI推理及模型优化指明方向。

深度学习自然语言处理
开源动态8

没想到,最Open的开源新模型,来小红书

向来低调的小红书昨日开源首个研大模型 dots.llm1,它是中等规模的 MoE 模型,在较小激活量下性能良好。其开源力度堪称行业最大,还介绍了数据处理、训练优化等多方面技术细节。

机器之心
新闻资讯7

朱啸虎投的第一个AI硬件公司,又完成一轮融资

AI眼镜创业公司Gyges Labs完成Pre A+轮融资,此前由朱啸虎的金沙江创投领投。其CEO邓旭东提出“Glass First”理念,以研技术DigiWindow实现极致外观,还以“功能减法”换“体验加法”,未来将布局可穿戴设备。

量子位
开源动态8

中科院联合清华等发布视觉语言行动推理模型VLA-R1,让机器人先思考再行动

中科院动化所、清华和GigaAI联合发布视觉 - 语言 - 行动模型VLA - R1,让机器人先思考再行动。它通过构建数据集教模型思维链,结合监督微调与强化学习提升性能,经多场景测试表现出色。

AIGC开放社区
算法论文8

X-Actor 惊艳登场!长时唇动+情感同步人像动画生成

字节提出 X - Actor,一个音频驱动回归扩散框架,能通过一张静态参考图像和一段音频生成逼真、富有情感表达的人像动画视频。其核心是两阶段解耦生成流程,实现长时间唇形同步与情感音频一致性。

带你学AI
新闻资讯7

小米小爱同学:资源受限下,实现端侧大模型的高性能推理

InfoQ对话小米小爱同学端侧AI负责人杨永杰,探讨大模型端侧部署难题。团队研推理框架,实现180 tokens/s推理速度,采用共享基座架构支持多业务。未来端侧大模型突破依赖硬件提升与架构演进。

AI前线
开源动态7

实时交互式长视频生成

文章提出用于实时交互式长视频生成的帧级回归框架 LongLive,解决了长视频生成在效率和质量方面的挑战,具备长视频生成、实时推理、高效微调等亮点,还给出安装、推理、训练等步骤。

GitHubStore
产品应用7

5万人抢光「阶跃龙虾」:3分钟一键部署,「养虾」终于变简单了

3月12日「阶跃龙虾」上线,提供5万个免费体验名额。此前阶跃星辰研的Step 3.5 Flash模型在OpenRouter平台霸榜。其一键部署功能简化养虾流程,且云端版本支持7×24小时在线,国产厂商正推动AI Agent使用范式转变。

机器之心
产品应用8

最高能效比!他又死磕“存算一体”2年,拿出全新端边大模型AI芯片

后摩智能CEO吴强在今年WAIC期间发布业界能效比最高的存算一体端边大模型AI芯片后摩漫界®M50。它搭载第二代存算一体技术,全栈研实现软硬件协同优化,还配套系列产品,构建端边智能新生态。

量子位
开源动态8

500美元刷新SOTA!训练成本砍到1/200,华人团队重构视频生成范式

香港城市大学等团队发布图像 - 视频生成模型Pusa V1.0,在基础大模型上引入VTA机制,用3860对视频 - 文字数据、约500美元微调,在I2V超越Wan - I2V - 14B实现SOTA,还解锁零样本任务能力。

量子位