算法论文7
Qwen3改造出30B参数扩散语言模型RND1
机器之心
AI 摘要
Radical Numerics团队改造Qwen3推出RND1-Base,30B参数创开源扩散语言模型规模纪录。研究系统性探究A2D转换关键因素,成果表现佳,还提出简单转换法和训练策略,展示不重训探索新范式的高效。
阅读原文 · 机器之心
Qwen3 变身扩散语言模型?不从零训练也能跑,30B参数创纪录
扩散语言模型(DLM)潜力大但训练难,Radical Numerics团队改造Qwen3-30BA3B,推出30B参数的开源扩散语言模型RND1-Base。该研究系统性研究A2D转换关键因素,成果超现有部分模型,还提出简单方法及训练策略。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
算法论文8
人大蚂蚁团队发布LLaDA MoE v2及扩展定律
中国人民大学高瓴人工智能学院与蚂蚁集团合作,首次系统刻画混合专家扩散语言模型扩展定律,据此训练LLaDA MoE v2,实现扩展效率与智能双重突破,将推动其迈向规模化时代。
机器之心
推荐文章7
AutoResearch-LLM:Agent 接手 LLM 训练优化
本文是 LLM 微调 AutoResearch 落地实战。作者将电商场景 Qwen3 微调流水线沉淀成 Agent 驱动的三阶段框架,还分享踩坑经验。思路方法与平台无关,可类比到外部环境,适合关注 AI Coding 等的同学。
阿里云开发者
开源动态8
英伟达等开源TriAttention,大模型推理内存降10倍
英伟达、MIT、浙大华人研究者联合推出TriAttention,核心是在pre - RoPE空间用Q/K三角集中度估计KV token重要性,保留关键部分。它使内存消耗降10倍,吞吐量提2.5倍,还提供vLLM集成和MLX实验性支持。
新智元
算法论文8
何恺明团队新作ELF,连续扩散效果佳
何恺明团队提出ELF模型,将扩散过程置于连续向量空间,只在最后翻译成词。它用一个网络实现去噪和解码,引入自条件机制。实验显示,ELF用不到其他方法十分之一数据,生成质量全面领先。
机器之心