MoE层」共找到 452 篇相关文章

算法论文8

腾讯混元TurboS技术报告首次全公开:560B参数混合Mamba架构,自适应长短链融合

腾讯公开混元TurboS技术报告,该模型是超大型Hybrid Transformer - Mamba架构MoE模型,融合Mamba与Transformer架构优势,有自适应长短思维链机制,激活参数56B。在多评测中表现佳,推理成本低。

AI前线
新闻资讯7

英伟达半数打工人身家过亿!难怪离职率低

一份调查显示英伟达约半数员工身家超2500万美元,超78%超百万美元。管理富翁数字更惊人,公司离职率仅3.7%。其造富源于员工持股和限制性股票计划,近期又宣布芯片量产。

量子位
新闻资讯7

AIEC 2026:今天起,Agent开始成为企业里的「新员工」

AIEC 2026人工智能+生态大会在北京召开,聚焦AI从战略部署到产业实践。大会指出大模型发展风向已变,落地竞赛开启,未来AI将成企业员工,还探讨了Agent落地关键及人与AI关系等问题。

机器之心
开源动态8

刚刚,杨植麟亲自开源Kimi K2.5!国产大模型打架的一天

今天国产大模型热闹非凡,Kimi更新至K2.5版本。它是万亿参数的MoE基础模型,开源且在多项评测表现佳,视觉与编码能力强,还引入Agent Swarm功能,实测展示其解决各类复杂任务能力。

机器之心
算法论文8

让Agent画思维导图稳固长期记忆:新框架实现稳定长期学习,准确率提升38%

中国电信人工智能研究院研究团队提出TeleMem框架,从数据结构重新设计Agent记忆组织方式,使记忆可检索、累积、回溯和演化。该框架解决了传统RAG在长期记忆管理和持续学习方面的瓶颈,准确率提升38%。

量子位
新闻资讯7

Agent规模化落地前夜,AI Infra的难题全都暴露了

随着AI Agent大规模落地,中国云服务市场结构转变,AI基础设施角色改变。InfoQ联合腾讯云发起「InfraTalk」直播,探讨AI Infra能力框架等。还解析其核心能力、难题、价值闭环标准及未来竞争焦点。

InfoQ
开源动态8

刚刚,美团开源全模态龙猫模型,和 ChatGPT 大战 100 回合打得难解难分

美团发布开源全模态 MoE 模型 LongCat-Flash-Omni,参数 560B 激活 27B。它有真正全模态能力,采用创新架构和训练范式,基准测试表现亮眼,部分指标超 Gemini-2.5-Flash,引发网友热议。

AGI Hunt
产品应用8

从 “可用” 迈向 “好用”:详解火山引擎智能视频云的三架构升级|甲子光年

2025年AI关键在多媒体领域,智能多媒体落地有变革也面临挑战。火山引擎提出智能视频云三架构升级,即基建、平台、应用升级,助企业实现低成本、高效率规模化应用,多行业已基于此打造能力。

甲子光年
新闻资讯7

Muon作者仅用一篇博客,就被OpenAI看中了

Keller Jordan 2024 年 12 月 8 日发布博客提出用于神经网络隐藏的优化器 Muon,能提升训练速度。他未发论文,称只信速通。其案例显示 OpenAI 重能力。博客对前沿指标描述或过时,Muon 有诸多实证成果。

机器之心
新闻资讯7

AI Pin 们折戟后,第二代 AI 硬件闷声发了大财

过去两年,第一代AI硬件喊出‘杀死智能手机’口号,赚足目光。当下,创业者不再将取代手机作为目标。第二批AI硬件‘边界感’强,专注细分场景,同时,科技巨头正布局全新AI,‘隐形OS’雏形已现。

Founder Park