「性能问题」共找到 4761 篇相关文章
打破视觉Token的算力诅咒,RedundancyLens如何为多模态大模型推理减负
多模态大模型的 Decoder - only 架构处理视觉 Token 有计算冗余。合合信息团队提出无需额外训练的动态计算削减方法,在不影响性能前提下降低推理成本,适用于多场景。
省下1.25倍算力!Kimi这篇论文,可能改写所有大模型的训练方式
大模型层数增多时,残差连接存在PreNorm稀释问题,导致后面层贡献被稀释。Kimi论文提出Attention Residuals方案,还给出工程解法Block AttnRes,实验显示能省算力且提升效果。
北大校友、华人学者金驰新身份——普林斯顿大学终身副教授
华人学者金驰宣布在普林斯顿晋升为终身副教授,任命2026年1月16日生效。他在机器学习理论领域贡献大,为LLM崛起提供数学基石,解决非凸优化和强化学习样本效率等问题。
全新范式—让开发不再有门槛:云赛空间开发者沙龙活动回顾
2025年10月27日,上海云赛空间举办开发者沙龙。微软MVP胡浩、张欣、徐庭等分享见解,演示AI降低开发门槛、实现人机共创等,最后还进行了圆桌讨论,探讨AI时代开发相关问题。
Meta超级智能实验室首篇论文:重新定义RAG
Meta超级智能实验室首篇论文提出REFRAG框架,重新定义RAG。它通过“压缩、感知、扩展”流程优化LLM处理外部知识方式,最高将首字生成延迟加速30倍,且性能无损。
吴恩达来信:认识新一代生成式AI应用工程师
吴恩达介绍新一代生成式AI应用工程师,指出其需具备利用AI构建模块开发应用、借助AI辅助编程能力,有产品能力是加分项,还分享面试考察内容与问题。
PD 分离推理的加速大招,百度智能云网络基础设施和通信组件的优化实践
为适应PD分离式推理部署架构,百度智能云从物理网络、网络流量、通信组件和算子层面优化,提升上层推理服务性能,展现了网络、组件与业务特征融合的重要性。
从局部最优到全局跃迁:关于企业“智慧运营中枢”模式的构建与实践思考
文章阐述企业数智化转型历程,指出转型中战略脱节、业技融合难等问题,介绍以企业架构为核心构建的“智慧运营中枢”模式,主张用大模型重塑业务价值链,强调转型是长期变革。
叶子豪、陈天奇等人开源项目FlashInfer入选,MLSys2025最佳论文奖公布
近日,MLSys 2025公布最佳论文奖,FlashInfer等入选。FlashInfer由多机构合作发起,是灵活的LLM推理内核库,优化内存访问、有可定制模板和调度机制,性能提升显著。另一获奖论文提出Negativa - ML可消除ML框架臃肿。
数学大佬在前面拓荒,AI研究员在后面捡宝,菲尔兹奖还能拿来破AI「黑盒」?
菲尔兹奖级纯数学成果落地大模型训练。佛罗里达大学团队用三维挂谷猜想解决大模型“黑盒问题”,GeoLAN加几何约束,效果显著。菲尔兹奖得主Jacob将入职OpenAI,AI在数学领域成果频出。