专家混合」共找到 669 篇相关文章

新闻资讯8

MiniMax M2 发布即爆,拿下开源模型第一名

10月27日,MiniMax发布新一代文本大模型M2及由其驱动的MiniMax Agent。M2是专家混合模型,参数达230B但激活仅10B。它在开源模型评测中夺冠,能低成本、高速度支撑工作流,开发者评价高。

MacTalk
推荐文章7

为什么 DeepSeek 大规模部署很便宜,本地很贵

文章探讨了DeepSeek-V3大规模服务便宜但本地运行贵的原因。指出推理服务存在吞吐量和延迟的权衡,受批处理大小影响。还分析了不同模型需大批次的原因,如专家混合模型、大型管道模型等。

AI前线
开源动态8

MiniMax M2.5:230B参数仅激活10B,开源模型首次逼近Claude Sonnet,成本仅十分之一

MiniMax推出新一代开源模型M2.5,官方称其为‘为现实世界生产力设计的开源前沿模型’。性能逼近Claude Opus 4.6,采用混合专家架构,成本低。已在内部大规模部署,定位为‘AI员工’。

AI工程化
算法论文8

揭示扩散语言模型扩展定律,人大高瓴团队与蚂蚁集团发布LLaDA MoE v2

中国人民大学高瓴人工智能学院与蚂蚁集团合作,首次系统刻画混合专家扩散语言模型扩展定律,据此训练LLaDA MoE v2,实现扩展效率与智能双重突破,将推动其迈向规模化时代。

机器之心
开源动态8

阿里Qwen3技术报告核心要点解读!

阿里Qwen3技术报告发布,披露模型架构、预训练及后训练等技术细节。其有密集与混合专家两种模型架构,预训练数据量和语种增多,后训练采用强到弱蒸馏提升性能,各模型表现优异。

PaperAgent
推荐文章8

从DeepSeek-V3到Kimi K2:八种现代 LLM 架构大比较

文章对比了DeepSeek-V3、Kimi K2等八种现代LLM架构。介绍各模型独特技术,如DeepSeek V3的多头潜在注意力和混合专家技术,OLMo 2的后归一化策略,Gemma 3的滑动窗口注意力等,探讨架构改进与突破。

PaperAgent
推荐文章8

AI Coding 之后,如何让 Agent 进入企业研发全链路?得物推荐的 Harness 实践

得物资深技术专家白忠魏在AICon大会分享实践。团队目标是将AI Coding扩展为全链路方法,介绍了PDCA循环、全链路前提、七阶段护栏等探索,还提及用知识体系和混合Agent架构解决问题,已有阶段性成果。

InfoQ
开源动态8

开源大模型SOTA又刷新!中国MiniMax M2全球排名第五,开源榜一

中国AI独角兽MiniMax发布模型M2,刷新开源SOTA。它采用混合专家架构,平衡了智能、速度和成本。在多个权威测试中表现优异,价格仅为Claude 3.5 Sonnet的8%,还提供多种部署方式和限时免费服务。

AIGC开放社区
产品应用8

VC、品牌顾问、编剧,正在批量把自己做成AI

AI发展中普通人使用门槛抬高,供需错配。5月19日袋袋(Profy)上线,专家说出经验就能封装成“数字专家”。它有四层能力和独特架构设计,让判断力独立流通,赋能普通用户。

量子位
新闻资讯8

世界经济论坛:AI、机器学习专家,成增长最快职业

世界经济论坛《2025年全球未来就业报告》分析未来五年劳动力市场转型。AI成重塑核心,技术岗位增长,传统岗位衰退。各地区情况有别,报告给出政策与企业应对建议。

AIGC开放社区