自蒸馏微调」共找到 1410 篇相关文章

算法论文8

Meta打碎Transformer 8年铁律!改写AI最底层规则,模型首次冒出潜意识

Meta推出「由Transformer」新模型,打破2017年以来GPT模型核心规则,在解码器引入潜在随机变量Z,增加“潜意识”。仅增约3%计算开销,在多测试中超越大规模模型,或开启后回归时代。

新智元
算法论文8

钉钉DeepResearch, 0.008元/1k Token击穿地板价

阿里为7.5亿钉钉用户推出Dingtalk - DeepResearch,解决企业办公AI化痛点。系统采用“三横一纵”架构,有多阶段强化学习等三种解法及DingAutoEvaluator纵向飞轮,实现模型进化、纠错。

CourseAI
算法论文8

大模型Agent的下一阶段:可我进化的AI-Agent

在人工智能飞速发展下,研究者探索让AI我反思改进。本文作者构建我进化AI智能体系统,设计四层渐进式架构,经《卡坦岛》实验,证明我进化能力,不同模型表现有差异,代码级进化潜力惊人。

AINLPer
开源动态7

装完Hermes Agent玩了一圈,我觉得龙虾已死!

Hermes Agent势头正猛,被视为龙虾以来首个真正的竞争对手。它让Agent己做Harness Engineering,己写、用、改Skill,还能我迭代。文章介绍了安装使用方法,对比了与其他项目的差异。

探索AGI
算法论文8

DeepMind 颠覆机器人学习范式:让机器像人一样 “由成长”

谷歌DeepMind受大模型微调中强化学习阶段启发,提出面向机器人学的两阶段后训练方法,含监督微调我提升。实验显示该方法让机器人主习得新技能、广泛泛化,但研究也存在标注成本高等局限。

AI科技评论
算法论文8

ACL'25最佳论文解读 | 大模型也会‘弹簧回弹’?揭秘 LLM 对齐的脆弱根源

本文分享 ACL 2025 最佳论文,指出预训练大模型存在‘抗对齐’的 Elasticity 现象,即对齐微调只是暂时拉伸,后续微调会让其迅速弹回预训练分布。研究量化该概念,用‘压缩理论’刻画对齐并实验验证。

PaperAgent
产品应用8

人形机器人放无人机,还能上天入海!有点过于赛博了吧

中国电信TeleAI团队推出具身智能组合,包括首款研人形机器人TeleBot - M和全研空海跨域具身智能体TeleAqua - Bee。其智传网(AI Flow)解决具身智能协同与传输问题,适用于抢险救援等危险场景。

量子位
算法论文8

Make SFT Great Again!从SFT到DFT:一权重之差,泛化之跃

大型语言模型的监督微调(SFT)简单高效,但泛化能力弱于强化学习(RL)。本文直击 SFT 核心缺陷,揭示其泛化瓶颈源于隐含的“病态奖励结构”,并提出仅需单行代码修改的动态微调(DFT),实验表明其效果显著。

深度学习自然语言处理
算法论文8

浙大提出Translution:统一Self-attention和Convolution,ViT、GPT架构迎来新一轮性能突破

近日,浙大与新加坡国立大学提出新型深度神经网络基础操作Translution,融合Self - Attention与Convolution优势,实现二者统一。基于它构建的网络在ViT和GPT架构下性能提升,但对算力要求更高。

AI科技大本营
推荐文章7

AI Agent的上下文工程:构建Manus的经验教训

上下文工程是AI智能体的“系统一”,决定其速度、恢复力与扩展边界。Manus通过试错与用户验证,给出可复用经验,如利用大模型“上下文学习”能力、关注KV - cache命中率等。

PaperAgent