利用率崩溃」共找到 113 篇相关文章

推荐文章7

破局大模型推理困局!华为张君详解昇腾“融合算力”的优化秘籍

华为高级开发工程师张君在AICon大会演讲,围绕大模型推理优化,从模型、框架、算子层展开,结合案例阐述技术方案。分析大模型推理现状挑战,介绍加速技术,分享昇腾硬件算子优化实践及通算融合算子优化方法。

InfoQ
开源动态8

大部分token根本不该重复计算,不止于KVCache

斯坦福研究显示,AI Agent每次调用62%内容重复,现有前缀缓存虽有优化但天花板低,阿里云数据表明多数缓存块利用率低。LMCache将缓存管理独立,解决性能问题,其CacheBlend技术复用缓存,适配多引擎和存储后端。

AI工程化
算法论文7

拆解大模型几项核心操作背后的数学与 Infra 优化逻辑

文章拆解大模型核心操作(RMSNorm、Softmax、Causal Mask、Sampling)背后的数学与Infra优化逻辑。指出Infra优化是用数学等价变换或精度妥协换硬件利用率和推理速度,还介绍各操作原理、问题及优化方法。

腾讯技术工程
产品应用7

硅谷深夜不写一行代码!放羊大叔Ralph引爆奇点,睡一觉AI全跑通

放羊大叔Ralph Loop掀起生产力革命,无需手写代码,AI就能搞定软件开发。它把任务拆到最小颗粒度解决普通AI崩溃痛点。还介绍融入工作流的方法、运行方式及成本,强调掌握此技能的重要性。

新智元
产品应用7

AI低质代码泛滥、API经济盛行,老牌科技厂商 F5 如何应对大模型应用“后遗症”?

F5亚太区CTO Mohan Veloo指出AI编程工具带来安全、低质代码、‘黑盒子’等问题。F5调查显示企业业务AI驱动下,安全成挑战。F5推出ADSP平台应对,还发布AI Gateway、AI助手等产品。

AI前线
算法论文8

英伟达笑到最后!训练2000步,1.5B逆袭7B巨兽,Scaling真来了

英伟达团队提出ProRL训练法,将强化学习扩展到超2000步。用此方法训练的15亿参数模型媲美70亿参数的Deepseek - R1 - 7B,在多任务中表现出色,解决了熵崩溃和训练不稳定问题。

新智元
算法论文7

Reasoning模型可以Self-Train!

当前大模型依赖人类标注数据,成本高且扩展难。论文探讨模型自我纠错、自主进化可能,提出自我奖励训练(SRT),用投票共识代替人类标注。在数学数据集上有效果,但高难度数据集出现问题,作者给出解决办法并开源代码。

深度学习自然语言处理
算法论文7

Reasoning模型在RL下的探索欲望急速下降问题:探索熵机制

论文研究发现大模型经强化学习训练解题时,会出现模型探索欲望急速下降的熵崩溃现象,如训练初期策略熵断崖式下跌。对此进行规律分析、追根溯源,提出破解方法,研究对AI训练范式变革有重要意义。

深度学习自然语言处理
产品应用8

OpenAI:如何用 Codex 在 28 天内极速打造安卓版 Sora

OpenAI发布工程博客,揭秘用Codex不到一个月打造Sora安卓版应用的过程。这款应用上线首日冲至Google Play下载榜第一,24小时内用户生成超百万视频,开发过程耗约50亿tokens,崩溃率仅0.1%。

AGI Hunt
7

用豆包手机的这两周,我好像卷入了一场新与旧的战争。

作者用豆包手机两周,直播后使用微信任务致微信崩溃,遭阿里系等多家APP封禁,影响使用。互联网本质是入口之争,AI手机助手冲击超级APP利益,作者认为这是入口之争序章,建议短、长期不同对待。

数字生命卡兹克