超稀疏 MoE」共找到 2279 篇相关文章

新闻资讯8

Meta华人新秀毕树,重磅爆料下一代LLM路线!RL+预训练直通AGI

OpenAI前研究员、Meta成员毕树在哥大演讲指出,AGI需高质数据、好奇驱动探索与高效算法,Scaling Law有效,规模决定智能,终身学习是重点,还探讨了AGI面临的诸多问题与挑战。

新智元
新闻资讯7

Manus被收购前最后一次访谈:季逸还不知道Meta即将来敲门

这是Manus被收购前,联合创始人季逸的访谈。他回顾从猛犸浏览器到Manus的创业路,谈GPT - 3冲击,还评价搭档肖弘。访谈后不久,Meta宣布全资收购Manus。

花叔
新闻资讯7

英伟达都摁不住了!内存疯涨,AI服务器被曝涨价15%

搭载英伟达AI芯片的服务器将在2027年初涨价15%,但这次并非英伟达主导,而是代工厂。真正原因是内存价格疯涨,三星、SK海力士和美光掌控近九成市场,有定价权。

新智元
算法论文8

华为多路径推理破解大模型数学瓶颈,准确率97%|ICML 2025

大模型处理复杂问题常“翻车”,华为诺亚方舟实验室提出思维森林(FoT)框架,借鉴人类认知方式,打破线性推理范式。FoT在多个数学推理任务表现出色,准确率先进模型,将在ICML 2025开源。

量子位
算法论文8

142 TFLOPS 的差距:为什么在 Blackwell 上 FP4 MoE 算子工程至关重要

文章对三种主流MoE后端在Blackwell B200 GPU上做基准测试,发现SGLang与vLLM有142 TFLOPS差距,小batch时SGLang快1.84×。差异源于kernel融合、面向Blackwell的CUTLASS schedule及自适应grid sizing等优化。

GiantPandaLLM
产品应用8

今年TRAE写的代码:100000000000行!50%程序员每天在按Tab键

2025年末TRAE发布年度产品成绩单,一年写1000亿行代码、50%用户高频用Tab键。其Cue功能助行业进入人机共生,SOLO模式让开发者成指挥者。它历经三阶段,指标优、构建生态,是中国AI IDE领域领先者。

量子位
新闻资讯8

刚刚,迪士尼与OpenAI达成史诗级合作!10亿美元入股,200角色授权

迪士尼与OpenAI达成里程碑式协议,迪士尼将10亿美元入股,200角色授权。Sora获海量IP许可,2026年初上线相关创作功能;双方在多方面深度合作,还披露首批角色阵容。

AI寒武纪
算法论文8

Attention Sink产生的起点?清华&美团首次揭秘MoE LLM中的级专家机制

清华和美团研究聚焦MoE LLM,首次发现级专家子集。通过多模型实证分析,揭示其分布规律、重要性及对注意力机制的影响,开发识别工具,为模型压缩提供新方向。

机器之心
开源动态8

百度开源文心4.5系列10款模型,多项评测结果DeepSeek-V3

今日百度正式开源文心大模型4.5系列10款模型,涵盖不同参数规模。该系列模型在多文本和多模态基准测试达SOTA,多项评测Qwen3、DeepSeek - V3,还具备三大关键创新,获开发者关注。

Founder Park
算法论文8

破解MoE模型“规模越大,效率越低”困境!中科院自动化所提出新框架

大模型参数量飙升却陷入‘规模越大,效率越低’困境,中科院自动化所研究团队提出统一框架,直击MoE底层运作模式,让专家‘组队学习’,实现参数量、负载方差降低,达成三重优化。

量子位