开源动态8
Qwen3训练秘籍及新功能曝光
量子位
AI 摘要
Qwen3技术报告公布,采用双模式架构,训练分多阶段,还“大带小”蒸馏数据。其融合思考与非思考模式,按问题复杂程度分配算力。此外,Qwen Chat全量上线深度研究功能。
阅读原文 · 量子位
Qwen3家族训练秘籍公开:思考/非思考融进一个模型,大模型蒸馏带动小模型
Qwen3技术报告揭晓8款模型关键技术,采用双模式架构,训练和微调分段进行,还“大带小”蒸馏数据。其融合思考与非思考模式,训练分多阶段,Qwen Chat还全量上线深度研究功能。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
算法论文8
华为IJCAI 2026论文:从规模转向设计
IJCAI 2026将召开,AI算力成本高,参数扩张边际收益低,技术创新逻辑转向‘用得更省’。华为四篇被收录论文,用精巧架构和训练策略,在四方向展现系统化工程能力,提供技术转型路径。
AI科技评论
算法论文8
单层RL训练超越全参数训练
明尼苏达大学、北大和亚马逊团队研究发现,RL收益集中在中间层,训练单层可超全参数训练。他们提出层贡献度指标,经多模型、算法、任务实验验证,还给出三种训练优化策略。
机器之心
推荐文章7
AutoResearch-LLM:Agent 接手 LLM 训练优化
本文是 LLM 微调 AutoResearch 落地实战。作者将电商场景 Qwen3 微调流水线沉淀成 Agent 驱动的三阶段框架,还分享踩坑经验。思路方法与平台无关,可类比到外部环境,适合关注 AI Coding 等的同学。
阿里云开发者
开源动态8
英伟达等开源TriAttention,大模型推理内存降10倍
英伟达、MIT、浙大华人研究者联合推出TriAttention,核心是在pre - RoPE空间用Q/K三角集中度估计KV token重要性,保留关键部分。它使内存消耗降10倍,吞吐量提2.5倍,还提供vLLM集成和MLX实验性支持。
新智元