「收敛速度」共找到 680 篇相关文章
万字长文!大模型LLM推理优化技术总结
文章围绕大模型LLM推理优化技术展开,先介绍LLM推理各阶段、批处理、KV缓存等概念及内存需求,再阐述模型并行、注意力机制优化、模型优化和模型服务等技术,如Pipeline并行、MQA、量化、动态批处理等。
深度洞察:AI带来的产业发展趋势
文章指出AI正以极快速度改变世界,趋势已成。探讨软件业从以应用为中心到以模型为中心的变革,还将阐述从以应用为入口到以AI为入口、AI巨头发展方向及未来展望等内容。
突发,OpenAI首颗「辣椒」芯片压倒英伟达!GPT-6干崩CUDA
OpenAI首颗自研芯片Jalapeño「墨西哥辣椒」实测成绩亮眼,AI推理性能超英伟达全系,功耗仅为一半。它从设计到流片仅用九个月,得益于GPT - Astra协助。有观点认为CUDA护城河或已死,OpenAI正打造算力版图。
不用人类手写训练框架了!AI自己写代码,训出1B端侧「小钢炮」
5月25日,面壁开源端侧文本基座大模型MiniCPM5 - 1B,主打低成本部署等。它由AI编写的ForgeTrain框架参与预训练,效果与英伟达Megatron对齐且速度快10%。该模型在榜单表现优,应用边界广,部署门槛低。
5张 H800 带来 20 FPS 高保真实时虚拟人生成
传统扩散模型做视频生成速度慢、画面不稳定,难用于实时虚拟人场景。阿里Live Avatar框架将算法和系统一起设计,用TPP并行推理策略和RSFM机制等,5张H800 GPU能实现20 FPS高保真实时虚拟人生成。
小白必读:到底什么是FP32、FP16、INT8?
文章介绍FP32、FP16、INT8等数字存储格式类型。指出它们是评估算力前提,不同格式在精度、范围、内存占用和计算速度上有差异,还提及多精度与混合精度计算,以及不同硬件对格式的支持情况。
社区供稿丨MiniCPM-V 4.5 技术报告正式出炉
上个月开源的多模态模型 MiniCPM-V 4.5 广受好评,今日其技术报告出炉。报告从架构、数据和训练三方面探索高效路径,提出三大技术,使模型在多任务上突破,小参数规模下性能和推理速度佳。
刚刚,高盛发布26页深度 AI 报告:谁将为GPU的饥渴买单?
高盛发布26页《Powering the AI Era》报告指出,AI服务器农场吸电速度远超电网扩容,引发电力危机。报告分析电力供应来源、应对策略等,还提到数据中心供需缺口扩大,电力成AI最大瓶颈,中国公司或因电力等优势成劲敌。
自构建智能体:一项 LangChain4j 实验
作者将LangChain4j文档交代码助手,让其参照构建智能体,设计多智能体系统编写、测试和调试代码。实验展示了LangChain4j优势,还对比监督者和工作流两种智能体实现模式,揭示速度与自主性权衡关系。
离谱……面壁让 AI 写了个训练框架,然后它自己训出了最强的 1B 模型:MiniCPM5-1B
面壁发布 1B 参数量级最强端侧文本大模型 MiniCPM5 - 1B,其 Base Model 由 AI 编写的训练框架 ForgeTrain 训出,速度超英伟达 Megatron 10%。该模型性能出色,部署门槛低,数据治理方案对应数据集也已开源。