「零开销逐层权重卸载」共找到 295 篇相关文章
万帧照片级仿真,打通视觉机器人学习的感知与物理鸿沟:国产仿真器GS-Playground入选RSS 2026
清华大学等联合提出高通量视觉高保真仿真器GS - Playground,被RSS 2026录用。它解决现有仿真器渲染开销高、资产制作依赖人工、Sim2Real迁移鸿沟大等问题,是全栈重新设计的仿真基础设施。
小模型用不好Skill?新范式让模型学会Skill的底层逻辑,3B模型推理token省5倍,性能反超
浙江大学联合美团龙猫团队、清华大学推出SKILL0,提出技能内化思路。它在训练中引入关键机制,让小模型把技能内化到参数里。实验显示,其效果出色,token效率高,为小模型成领域专家提供新方向。
The Batch: 939 |在推理阶段学习长上下文
大型语言模型处理长上下文时通常准确性降低、速度变慢,研究人员提出TTT - E2E方法,通过推理时训练模型将上下文压缩到transformer权重中,还展示了其运作方式、测试结果等。
重要!LiteLLM 供应链攻击:你的 API 密钥可能已经泄露
3月24日,LiteLLM的PyPI发布页面出现恶意版本,1.82.7和1.82.8被嵌入恶意代码。恶意代码会收集敏感文件、外传信息、进行横向移动。文章还给出检查、处理方法,此事件给开发者提了醒。
The Batch: 907 | 小而高效模型的“制作”方法
Mistral AI发布Ministral 3系列模型权重,结合剪枝与蒸馏技术,用级联蒸馏法构建。该系列参数规模有140亿、80亿和30亿,在部分测试中表现佳,训练成本低于传统方式。
清华刘知远团队论文:最小化结构改动,短文本到长文本丝滑升级 | ICLR 2026
大语言模型发展中,上下文长度成关键瓶颈,主流架构计算开销大。清华刘知远团队提出《InfLLM-V2: Dense-Sparse Switchable Attention for Seamless Short-to-Long Adaptation》,提出可切换注意力框架,为长上下文研究提供新思路。
刚刚,DeepSeek梁文锋入选Nature年度十大人物!被称为「科技颠覆者」
《自然》评出2025年度十大科学人物,DeepSeek梁文锋入选,被称为「科技颠覆者」。他的公司发布的R1模型功能强大、价格低廉,训练成本低,还开放权重,为研究者提供经验,其成果已融入国人生活。
1.58bit不输FP16!微软推出全新模型蒸馏框架,作者全是华人
微软推出蒸馏框架BitNet Distillation,实现几乎无性能损失的模型量化。它含三阶段,经实验在多下游任务表现近全精度模型,降内存开销、提推理速度,作者全是微软研究院华人。
让YOLO飞起来:从CPU到GPU的配置指南
文章指出默认安装的YOLO用CPU计算,处理大量图像或实时检测任务效率低。详细介绍将YOLO从CPU模式切换到GPU模式的步骤,对比性能,还给出常见问题解决办法,能显著提升运行效率。
突破Agent长程推理效率瓶颈!MIT&新加坡国立联合推出强化学习新训练方法
AI Agent处理复杂任务时显存、算力问题凸显,MIT和新加坡国立大学联合提出MEM1框架。它基于强化学习,让智能体学会管理记忆,实现近似常量级显存开销,在多方面表现超越大模型。