FP8算力」共找到 1306 篇相关文章

推荐文章8

百度端侧大模型安全建设实践:在算力与保障之间找到平衡

在 QCon 全球软件开发大会上,百度李志伟分享端侧大模型安全建设实践。介绍其发展趋势、优势与应用场景,指出面临隐私、内容等安全挑战,阐述云端与端侧安全方案,通过案例展示优化效果,展望未来安全建设方向。

InfoQ
开源动态8

清华SageAttention3,FP4量化5倍加速!且首次支持8比特训练

清华大学陈键飞团队提出针对BlackWell架构的SageAttention3,实现5倍于FlashAttention的推理加速,首次支持8比特训练。在多种大模型上保持端到端精度,代码将分别于6、7月开源。

机器之心
新闻资讯7

不只是卖服务器,中兴通讯想做AI时代的基础设施商

中兴通讯将战略升级为“连接 + 算力”双轮驱动,2025 年算力业务营收大增,营收结构转变。在 2026 生态合作伙伴大会发布 Co - Claw AI 一体机等新品,启动“和合生态行动”,致力于做 AI 时代价值贡献者。

量子位
新闻资讯7

烧Token成KPI,8.5万Meta员工狂刷60万亿Token,争榜一大哥

硅谷兴起“tokenmaxxing”,将token使用量作为生产力基准和竞争指标。Meta超8.5万员工参与烧token竞赛,30天消耗超60万亿。国内阿里、腾讯也有相关动作,科技大佬推波助澜,Anthropic年化收入破300亿美元。

机器之心
算法论文8

Dense、MoE之外第三条Scaling路径:交大提出JTok模块,省1/3算力

上海交通大学与小红书Hi Lab联合团队提出JTok/JTok - M模块,作为插件挂载在Transformer层,几乎不增算力和显存开销却显著提升性能。该模块构建新scaling路径,在多任务测试中全面提分,为大模型发展提供新方向。

机器之心
推荐文章7

破局大模型推理困局!华为张君详解昇腾“融合算力”的优化秘籍

华为高级开发工程师张君在AICon大会演讲,围绕大模型推理优化,从模型、框架、算子层展开,结合案例阐述技术方案。分析大模型推理现状挑战,介绍加速技术,分享昇腾硬件算子优化实践及通算融合算子优化方法。

InfoQ
算法论文8

时空压缩!剑桥大学提出注意力机制MTLA:推理加速5倍,显存减至1/8

在大语言模型发展中,Transformer自注意力机制有计算复杂度问题且KV缓存成推理瓶颈。剑桥大学提出MTLA,结合时空压缩策略,提升推理效率,在多任务中表现出色,代码已开源。

机器之心
算法论文8

GCEA-YOLO:给油田装上"防火眼",把抽烟行为检测精度拉高 20.8%

油田抽烟事故损失大,传统检测方法有局限,深度学习模型也面临难题。作者基于YOLOv11n构建GCEA - YOLO网络,含ADown、CSP - EDLAN、GFPN、EfficientHead四个模块,检测精度显著提升,还验证了泛化与稳定性,并给出复现代码。

机器学习AI算法工程
新闻资讯7

颠覆无线电常识!新技术把干扰信号变算力,自动驾驶掉线难题有望解决

一项名为空中计算(OAC)的新技术有望颠覆无线网络系统设计标准,它能将无线信号干扰转化为计算能力,降低拥塞和能耗。目前已有原型机实现95%图像识别准确率,预计30年代走向标准化,但面临移动性等挑战。

DeepTech深科技
产品应用8

Claude最强Fable 5.1发布!8项屠榜,最高降价45%,反蒸馏机制上线

Anthropic发布Fable 5.1和Mythos 5.1,8项基准测试夺冠,价格最高降45%。展示科研成果,如蛋白质设计、生成金星地图等。上线反蒸馏机制,防止篡改上下文,还给出替代方案。

量子位