训练推理效率」共找到 4331 篇相关文章

开源动态7

Ultralytics & lightly-train:简化计算机视觉模型训练,无需标签

在计算机视觉领域,获取带标签数据成本高、耗时长。开源项目 lightly-train 用未标记图像和视频自监督预训练,减少标注成本与时间,可集成到现有训练管道,支持多种模型架构和应用场景。

机器学习AI算法工程
算法论文7

MoE RL 实战:统一 FP8 全流程训练

SGLang RL 团队等实现 RL 全流程 FP8 训练与采样,消除训推不一致性。介绍 FP8 硬件基础、格式等,分析训练难点,定位 KL Loss 异常源于量化原理,验证其在 MoE 模型 RL 场景优势,指出模型规模与训推不一致的关联。

GiantPandaLLM
算法论文8

庞若鸣还有苹果论文?改善预训练高质量数据枯竭困境

苹果基础模型原负责人庞若鸣在 Meta 任职期间,其在苹果参与的高价值研究仍不断发表。研究团队针对大模型训练中高质量数据枯竭问题,提出 Synthetic Bootstrapped Pretraining (SBP) 预训练流程,提升模型性能。

机器之心
算法论文7

低延迟、高吞吐,LLM优化与高效推理引擎综述

LLM计算成本高,用户要低延迟,企业要高吞吐。工程师开发优化技术,如动态批处理、KV缓存、模型量化。论文对比25款推理引擎,还探讨了多模态支持、手机端推理、新型架构支持等进化方向。

深度学习自然语言处理
开源动态7

OpenAI公开大规模稳定训练的秘密,英伟达AMD英特尔都受益

OpenAI通过OCP开放超大规模AI训练用的网络协议MRC,它能确保大规模训练环境下网络通信稳定。该协议由OpenAI联合英伟达等厂商花两年完成,从拓扑、传输、路由维度保障网络可靠性。

量子位
产品应用7

关键技术详解|腾讯一念 LLM 分布式推理优化实践

InfoQ 邀请袁镱分享《一念 LLM 分布式推理优化实践》。介绍了“一念 LLM”设计思路、推理优化挑战与突破等,还对比不同框架,指出优化方向,如先实现 PP,再推进 EP 与 PD 分离。

InfoQ
产品应用7

用 Docker 跑大模型训练,Unsloth 解决了环境配置难题

Unsloth AI 发布 Docker 镜像版本,解决本地训练大模型环境配置难题。拉镜像就能训练,依赖和示例 notebook 都打包好。使用简单,不过有暂不支持 Mac 系统等限制,单卡 NVIDIA GPU 场景较适用。

AI工程化
推荐文章7

AGI 路线图第二阶段:游戏即模型训练|AGIX PM Notes

文章围绕AGI展开,介绍AGI路线图第二阶段“游戏即训练”,指出游戏是训练agent的理想环境;还提及Dreamer系列研究进展。同时涵盖本周市场动态、多家公司AI动态及ETF复制指数的方法、优劣和影响。

海外独角兽
算法论文8

国产芯片比英伟达整体效率更高!?华为 CloudMatrix384 超节点首曝论文,跑 DeepSeek 效率超越英伟达

今年4月,网上曾争论华为芯片效率是否超国际主流。近日华为团队论文公开,阐述在CloudMatrix 384超节点部署DeepSeek大模型细节,性能指标超英伟达体系,还介绍架构、软件栈及适配优化方案。

InfoQ
产品应用7

Jina Embeddings v4 的量化感知训练

文章聚焦Jina Embeddings v4的量化感知训练。介绍量化技术可压缩向量体积、提升检索效率,对比四种主流量化方法,重点实验PTQ和Output QAT,还测试非对称量化,给出实验结果与结论。

Jina AI