「Pangu Pro MoE」共找到 558 篇相关文章
刚刚,100 美金的 ChatGPT 来了
OpenAI 推出 $100/月 Pro 档,填补 Plus 和原 Pro 间空缺,核心是 Codex,提供 5 倍 Codex 用量及 Pro 特权。Plus 用户 Codex 配额调整,旧 Pro 仍保留。与 Claude 定价锚点一致,但打法各有侧重。
ICML 2025 Spotlight|华为诺亚提出端侧大模型新架构MoLE,内存搬运代价降低1000倍
华为诺亚和北大研究人员提出端侧大模型新架构MoLE。它解决传统MoE显存开销大、传输延迟高问题,推理时将专家输入改embedding token,用查找表替代矩阵运算,实验显示性能与MoE相当,大幅降推理延迟。
苹果春季新品奔着龙虾来了!AI性能暴涨8倍,8499元起
苹果发布MacBook Pro M5系列、MacBook Air M5笔记本,8499元起,还更新了显示器。新款MacBook Pro搭载M5 Pro和M5 Max芯片,AI性能大幅提升,提示词处理速度快4倍,图像生成速度快8倍,存储、续航等方面也有优化。
0%通过率!Code神话泡沫!LiveCodeBench Pro发布!
国际算法奥赛金牌得主团队测试20个顶级大模型,在584道编程赛题上,高难度题目AI通过率为0%。论文发布LiveCodeBench Pro评测方法,揭示AI编程能力神话泡沫,指出其问题并给出提升方向。
2.8K Star!基于Nano Banana Pro的Vibe PPT神器!
GitHub上的banana - slides项目很火,近一周涨2K+ Star。它是基于Nano Banana Pro的Vibe PPT生成工具,不强调套模板,能将想法、氛围和内容结构转成幻灯片,还具备多种强大功能。
用得越多、失业越快?GitHub 大改 Copilot 规则:默认拿个人代码训练 AI,还搬出 Anthropic 挡枪!
当地时间3月26日,GitHub宣布自4月24日起,Copilot Free、Pro和Pro+用户交互数据默认用于训练AI模型,Business和Enterprise用户除外。GitHub称需更多数据覆盖编码场景,但此举遭用户吐槽。
Mythos架构被22岁小伙“逆推”开源了!MoE和注意力借鉴DeepSeek
22岁小伙Kye Gomez将Claude Mythos架构整合开源成OpenMythos,实现带MoE路由的循环深度Transformer(RDT)。该架构仅用一半参数,就能获与传统模型同等效果,吸引学界关注。
超越GPT-5.2和Gemini-3-Pro!商汤多模态搜索、推理模型开源
商汤开源多模态自主推理模型SenseNova - MARS(8B/32B双版本),它通过强化学习整合工具,在多模态搜索与推理测试中超越Gemini - 3 - Pro与GPT - 5.2,还采用创新算法稳定训练,构建新基准评测。
NVIDIA技术沙龙 《大规模EP优化:PD分离MoE并行方式》课程笔记
本文是NVIDIA技术沙龙课程笔记,介绍大规模EP优化的PD分离MoE并行方式。涵盖PD分离、大规模专家并行等五项关键技术创新,还对比多模型架构,展示推理服务架构性能特点与优化策略,以及各技术工作流程和效果。
苹果提出新型反向传播:一台iPhone 15 Pro Max就能微调LLM
苹果提出内存高效型反向传播(MeBP),可在内存使用量和计算时间上比零阶优化(ZO)有更好权衡,收敛更快、性能更优,还在iPhone 15 Pro Max验证其有效性,且公开了实现链接但目前为空。