盘古 Pro MoE」共找到 561 篇相关文章

算法论文8

Attention Sink产生的起点?清华&美团首次揭秘MoE LLM中的超级专家机制

清华和美团研究聚焦MoE LLM,首次发现超级专家子集。通过多模型实证分析,揭示其分布规律、重要性及对注意力机制的影响,开发识别工具,为模型压缩提供新方向。

机器之心
算法论文8

破解MoE模型“规模越大,效率越低”困境!中科院自动化所提出新框架

大模型参数量飙升却陷入‘规模越大,效率越低’困境,中科院自动化所研究团队提出统一框架,直击MoE底层运作模式,让专家‘组队学习’,实现参数量、负载方差降低,达成三重优化。

量子位
推荐文章7

17.6K Star跨平台逆向工程神器!免费替代IDA Pro,支持插件扩展!

在二进制文件分析或软件逆向工程中,专业工具如IDA Pro界面复杂、学习成本高。文章推荐开源跨平台逆向工程平台Cutter,它基于rizin核心引擎,功能完善,可降低使用门槛。

开源星探
新闻资讯8

GPT-5.2果然反超谷歌Gemini 3 Pro!北大数院校友核心贡献

OpenAI在成立十周年推出GPT - 5.2,相比GPT - 5.1在多实用领域更强,视觉理解等能力提升。ARC - AGI测试中得分超谷歌Gemini 3 Pro。拆解其多方面能力,还介绍核心团队多为数学专业新面孔。

量子位
产品应用8

产品经理起飞!Google AntiGravity升级Nano Banana Pro,AI编程真的牛逼了

作者用Google新发布的AntiGravity生成海报,其升级增加Nano Banana Pro能力后效果惊人。作者展示了用它生成高保真原型图、用户故事地图、用户旅程地图等案例,还提及更多应用场景及使用建议和限制。

AI产品黄叔
新闻资讯8

Gemini 2.5 Pro强势更新并霸榜,Claude 3.7首次遭遇全方位碾压!

Google DeepMind推出的Gemini 2.5 Pro在LMArena各大排行榜全面登顶,实现文本、视觉、Web开发全方位霸榜,编码能力也大幅升级。虽有质疑,但短期内难有对手,还引发对Google I/O大会更多惊喜的期待。

AGI Hunt
新闻资讯8

梁文锋突袭马斯克!DeepSeek V4 Pro对战Grok 4.6,首测夯爆了

梁文锋凌晨发布DeepSeek V4 Pro正式版,马斯克推出Grok 4.6,二者在多项评测中表现出色,直逼OpenAI和Anthropic顶尖模型,还降低了前沿智能价格。首测中,二者在真实任务场难分伯仲。

新智元
产品应用7

Gemini 2.5 Pro 再升级!竞技场分数创新高+思考预算,更强 Kingfall 在路上?

谷歌更新Gemini 2.5 Pro模型预览版,几周后成正式稳定版用于企业级应用。它在多个竞技场分数创新高,编码能力强,还新增“思考预算”功能控成本,价格有竞争力,谷歌还将推更强“Kingfall”。

AI进修生
新闻资讯7

一个Skill让DeepSeek V4 Pro超越Fable 5?热门插件被锤了

前两天J-Space凭夸张测试结果刷屏,宣称一份Skill接入Agent环境,能让V4 Pro在多基准大幅提升,部分成绩超Fable 5。但社区复测结果相反,作者未公开完整评测记录,还删质疑帖,引发公开打假。

机器之心
开源动态8

阿里AI 重磅第4发:电影级MOE 视频模型Wan2.2正式开源!

阿里通义团队开源电影级视频生成模型Wan2.2,将光影、色彩、镜头语言装进模型,支持60多参数自由组合。它是业界首个用MoE架构的视频生成模型,推理省计算资源,性能超主流模型,获国外网友盛赞。

AGI Hunt