「超稀疏 MoE」共找到 2281 篇相关文章
GPT-5.2果然反超谷歌Gemini 3 Pro!北大数院校友核心贡献
OpenAI在成立十周年推出GPT - 5.2,相比GPT - 5.1在多实用领域更强,视觉理解等能力提升。ARC - AGI测试中得分超谷歌Gemini 3 Pro。拆解其多方面能力,还介绍核心团队多为数学专业新面孔。
黄仁勋2025都在投啥?出手50次,32家公司覆盖产业链闭环
2025年前三季度,英伟达参与50笔AI风投超去年全年。投资覆盖基础设施、模型厂商、应用等领域。其AI俱乐部有32家公司,分三档。英伟达鲜少领投,黄仁勋不信AI有泡沫,投资能锁定硬件订单。
中科院类脑大模型SpikingBrain,2%数据,百倍速度
中国科学院自动化研究所李国齐、徐波团队发布全球首款大规模类脑脉冲大模型SpikingBrain 1.0。它处理长文本比主流Transformer模型快超百倍,训练数据仅为2%。该模型采用新架构,降低计算复杂度,还可转换现有模型,且在国产GPU完成训练。
华为盘古大模型:被芯片牵制的“千古”模型
华为盘古大模型团队员工自曝内幕,称其受芯片限制,早期算力有限、训练困难。还指出内部存在造假、套壳等问题,如135B V2套壳Qwen 1.5 110B,pangu pro moe 72B套壳qwen 2.5的14b等,导致人才流失。
扩散模型+自进化:这篇论文让Deep Researcher错误率直降70%
论文提出测试时扩散深度研究代理(TTD-DR),将报告生成建模为扩散过程,有组件自进化机制和动态闭环设计。实验显示其在多领域研究任务超现有方案,为AI研究助手落地提供新范式。
腾讯混元A13B用130亿参数达到千亿级效果,Flash Attention作者点赞
腾讯混元A13B模型仅130亿激活参数,却能和千亿级大模型竞争,获Flash Attention作者赞叹。它精准卡位性能与效率‘甜蜜点’,依托高质量预训练和结构化后训练,多方面表现突出且已全面开源。
腾讯混元 TurboS 技术报告首次全公开:560B 参数混合 Mamba 架构,自适应长短链融合
日前腾讯混元 TurboS 技术报告全公开。它是超大型 Hybrid Transformer - Mamba 架构 MoE 模型,有自适应长短思维链机制,总参 560B。在多榜单成绩亮眼,多语种和多任务处理能力强,还介绍了核心创新、训练策略等。
黄仁勋搬来华尔街5000亿,买GPU可以按揭了
8月11日,英伟达宣布与六家金融机构合作,成立算力融资平台,欲动员超5000亿美元,把算力做成可融资生意。其将英伟达全栈AI基础设施当可投资资产,客户按需付费,但英伟达股价不涨反跌,这场豪赌结果待察。
靠AI把股价干涨735%,这家公司开始成批裁掉可替代岗,全员招聘须CEO点头
AppLovin联合创始人兼CEO Adam Foroughi分享公司发展历程。他曾借钱60亿美元回购股票获600亿美元回报,押注AI使股价涨735%。公司经历人员结构调整,清退老高管和可被LLM自动化岗位,招聘须他亲批,超80%代码由大语言模型生成。
挖漏洞何必Mythos,国产智能体早跑通了
手握Mythos的Anthropic因安全问题将其锁起,引发安全圈对AI规模化挖漏洞的思考。360集团自主研发的漏洞挖掘智能体公开披露两项重大发现,影响超10亿用户,还展示了其技术路线、优势及战略意义。