「Flash - MoE」共找到 269 篇相关文章
Gemini 3.1 Flash-Lite Preview发布:Google完成AI模型分层布局
Google发布Gemini 3.1 Flash-Lite Preview,针对企业和开发者场景优化,速度快,有‘思考级别’功能。基准测试表现不错,价格比Claude 4.5 Haiku便宜,但开发者社区反应复杂,面临市场定位问题。
Google 最新的 Gemini 2.5 Flash-Lite 原型能动态生成软件界面
Google最新的Gemini 2.5 Flash - Lite原型能动态生成软件界面。它打破传统预设框架,通过‘UI宪法’等设计保证风格与适应性,响应速度快,还解决了生成界面可能带来的混乱问题,或重塑人机关系。
DeepSeek低价风暴打服硅谷!海外平台争相倒贴V4 Flash
DeepSeek V4 Flash掀起价格风暴,全球开发者为之疯狂。海外平台如Nous Portal、Cline等纷纷补贴,其能力大幅提升,价格却极低,让开发者更愿尝试开源模型,AI应用层或迎转机,且DeepSeek Code可能将至。
DeepSeek开源MoE新利器LPLB:基于线性规划,专攻训练动态负载不平衡
DeepSeek在GitHub开源LPLB,这是基于线性规划的并行负载均衡器,用于优化MoE模型专家并行工作负载分配。它通过动态重排序、副本构建等机制实现动态负载均衡,支持多种拓扑结构,但也存在成本估算等局限性。
华为 | MoE推理「王炸」组合:昇腾原生盘古推理,性能狂飙6-8倍!
华为团队推出昇腾平台原生Pangu Pro MoE 72B模型,经系统级软硬协同等优化,推理性能提升6 - 8倍。还提出分层混合并行等策略,打造融合算子,设计推理算法,在昇腾不同平台展现卓越性能。
刚刚,Qwen3.8-Flash震撼发布,我们看到了Qwen4的骨架
8月大模型厂商多上调API价格或收缩免费额度,因推理需求增长跑赢算力供给。阿里发布Qwen3.8-Flash并开源,成绩亮眼且价格低。它是Qwen4架构预演,有四大技术创新,提升了模型效率。
清华&巨人网络首创MoE多方言TTS框架,数据代码方法全开源
清华与巨人网络联合首创 DiaMoE-TTS 多方言 TTS 框架,数据、代码、方法全开源。它基于 IPA 体系,有 MoE 架构和低资源适配策略,在多语种验证,为方言语音合成提供低成本、可扩展方案。
刚刚,美团开源 SOTA 推理模型 LongCat-Flash-Thinking,性能逼近 GPT5-Thinking
美团宣布开源高效推理模型 LongCat-Flash-Thinking,性能逼近 GPT5-Thinking,是国内首个结合多种推理能力的大语言模型。它采用新方法提升性能,已在多平台开源,API 平台免费开放,还兼容主流 API 格式。
谷歌推出“神经操作系统”原型,Gemini 2.5 Flash驱动,UI即时生成无需编码
谷歌开发者博客展示由大模型驱动的“神经操作系统”研究原型,由Gemini 2.5 Flash - Lite驱动,屏幕由大语言模型即时生成。介绍了实现UI即时生成等的核心技术理念,虽为原型但应用前景好。
DeepSeek-V4-Flash正式版发布并开源,全面超越V4-Pro预览版
DeepSeek-V4-Flash正式版发布并开源,这一304B轻量级模型经后训练,性能远超V4-Pro预览版,与Claude Opus-4.8接近。模型权重开源后上Huggingface趋势榜第二,性价比高,实测表现佳。