「自蒸馏策略优化」共找到 2064 篇相关文章
ICLR 2026|在「想象」中进化的机器人:港科大×字节跳动Seed提出WMPO,在世界模型中进行VLA强化学习
香港科技大学 PEI - Lab 与字节跳动 Seed 团队提出 WMPO 新范式,可让具身智能在‘想象中训练’,解决传统 VLA 训练瓶颈,目前论文、代码与模型均已开源。
Qoder 发布首个自进化的智能体:看 Quest 如何重构了 Quest
Qoder 发布首个自进化智能体 Quest,它能自主完成重构自身长程任务执行逻辑等任务。Quest 从上下文管理、工具选择、Agent Loop 三方面优化架构,还具备自主进化能力,正探索自主编程新可能。
年入103万美元!AI 独立开发者天花板!普通人应如何实践?
2026年初,法国独立开发者Marc Lou晒出2025年103万美元收入,他靠一人开发产品,利用AI工具快速迭代。他采用多产品矩阵、交叉推广等策略,也分析了中国独立开发者状况,给出入局建议。
Who’s Adam?最逆天的NeurIPS评审出炉了
这两天大家收到NeurIPS 2025评审结果,网上现逆天评审意见,把Adam优化器当成拼写错误。投稿量飙升致审稿质量难保证,AI评审成普遍现象,还推荐了写反驳意见的博客。
ACL 2025 | AI字幕慢半拍,不知道大家在笑什么?新方法让同传性能直逼离线翻译
香港中文大学、字节跳动Seed和斯坦福大学团队提出SeqPO - SiMT框架解决同声传译“质量 - 延迟”权衡问题。该方法将同传建模为序贯决策过程,优化决策序列,实验显示其性能直逼离线翻译。
11Labs 增长负责人:搞营销要学着做视频,但创始人出镜会有点自恋
AI语音独角兽ElevenLabs增长迅猛,估值超30亿美元。其增长负责人Luke Harries分享独特策略,如分业务单元管理、重视视频营销、多渠道推广等,还给出团队搭建、产品发布等实用建议。
SGLang Team:在 96 个 H100 GPU 上部署具有 PD 分解和大规模专家并行性的 DeepSeek
本文介绍 SGLang 团队在 96 个 H100 GPU 上部署 DeepSeek 的方法。利用 PD 分解和大规模专家并行性,SGLang 实现高吞吐量,成本低。博客探讨并行设计、优化方法,所有组件开源,也指出了当前局限与未来方向。
AI浪潮之下:存储来到聚光灯下
AI浪潮下,行业对存储设备重视上升。其根因是AI业务刺激,数据量增长且推理业务有新需求。信通院报告显示我国存力结构优化,国内厂商迎来机会,平头哥镇岳510主控芯片表现出色,生态建设也在推进。
让离线强化学习从「局部描摹」变「全局布局」丨ICLR'26
现有生成式离线强化学习方法在复杂连续任务长程规划中易陷入局部合理但全局偏航的窘境。厦门大学和香港科技大学提出MAGE算法,采用自顶向下策略,实验显示其多任务表现出色、推理效率高。
刷榜多元时序预测,性能波动0%!打破CI/CD二元对立 | ICLR'26
在多元时间序列预测领域,长期存在通道依赖(CD)与通道独立(CI)路线之争。浙江财经大学团队提出CPiRi框架,结合时空解耦架构与置换不变正则化策略,解决范式矛盾,取得优异效果。