「两阶段推理」共找到 3127 篇相关文章
英伟达、港大等发布创新KV缓存,实现扩散模型无训练加速
多数开源扩散语言模型推理效率不如自回归模型,英伟达、港大、麻省理工研究人员联合提出Fast - dLLM。它用近似KV缓存机制减少冗余计算,还提出基于置信度的平行解码策略,测试显示能加速且保持生成质量。
华为盘古首次露出,昇腾原生72B MoE架构,SuperCLUE千亿内模型并列国内第一
当前传统 MoE 有专家激活不均衡问题,华为盘古团队提出 MoGE 解决。基于此架构的盘古 Pro MoE 大模型在昇腾集群高效训练,推理性能强,在 SuperCLUE 榜单千亿内模型并列国内第一,赋能业务落地。
刚刚,Qwen3.8-Flash震撼发布,我们看到了Qwen4的骨架
8月大模型厂商多上调API价格或收缩免费额度,因推理需求增长跑赢算力供给。阿里发布Qwen3.8-Flash并开源,成绩亮眼且价格低。它是Qwen4架构预演,有四大技术创新,提升了模型效率。
AI短片节创作者招募:带着故事来崇礼|甲子光年
「Future Now/未来此刻」2026夏季崇礼论坛将启幕,设立「Chongli AI Film Lab」专场论坛并发起AI短片节。面向全球AI创作者征集作品,有两大创作方向,Vidu AI全程支持,对作品有要求,还有入围惊喜。
OpenAI资深研究科学家、Transformer联合作者Łukasz Kaiser领衔,2026 奇点智能大会·北京站正式官宣
2026年,Sam Altman等四位AI界大佬称已进入奇点。11月20 - 21日,奇点智能大会北京站将举行,两大核心会议同期举办。OpenAI资深科学家Łukasz Kaiser将演讲,会议汇聚专家探讨AI前沿与底层技术。
ICML 2026 | 拒绝盲目猜token,阿里x浙大将投机解码带入弹性预算时代
随着大模型参数规模扩大,推理成本成核心瓶颈。投机解码在高并发下有问题,阿里与浙大学者提出 ECHO,将投机树构造建模为预算调度问题,通过稀疏门控和弹性预算调度提升系统收益。
编程智能体的隐藏bug,被上交IPADS团队用数学逻辑给揪出来了
上海交通大学 IPADS 研究团队打造 FM - Agent,实现大规模系统全自动正确性推理。它能从顶尖编程智能体生成的大规模系统中找出隐藏 bug,还提出新规约生成方法,在绝对严谨与工程可用间找到平衡。
Meta 143亿挖角后的首个作品:Alexandr Wang 推出闭源模型,杨立坤点赞
沉寂9个月后,Alexandr Wang带队的Meta发布新一代模型Muse Spark。它是原生多模态推理模型,性能媲美Gemini Pro和GPT 5.4,在多领域有应用潜力。不过闭源引争议,且在部分领域有短板。
黄仁勋,开启智元(Token)时代
全球大模型进入千万亿智元(Token)时代,OpenRouter年化智元用量突破一千万亿,对应推理支出约10亿美元。黄仁勋在GTC大会提出「智元(Token)经济学」,智元成AI时代核心经济标尺,重塑产业规则。
一文读懂DeepSeek-V3.2核心技术DSA:API疯狂降价性能不减的背后
DeepSeek发布实验模型DeepSeek V3.2,引入自研稀疏注意力机制DSA,API价格最高降75%。DSA先筛选后计算,含闪电索引器和稀疏多潜在注意力两组件,分四步工作,权衡了精确性与速度。