「GPU训练」共找到 2443 篇相关文章
一键式训练端到端Agent,Qwen3+MCP工具集高效集成!
RLFactory是开源的端到端RL后训练框架,将环境与训练解耦,用Qwen3基座调用MCP工具集,可低代码训练端到端Agent模型。它极致易用、训练高效,还支持一键式训练,未来会更易用高效。
让YOLO飞起来:从CPU到GPU的配置指南
文章指出默认安装的YOLO用CPU计算,处理大量图像或实时检测任务效率低。详细介绍将YOLO从CPU模式切换到GPU模式的步骤,对比性能,还给出常见问题解决办法,能显著提升运行效率。
MOE RL实战:统一FP8全流程训练
SGLang RL团队等联合完成工作,实现RL中全流程FP8训练与采样。介绍FP8训练硬件基础、格式、scale选择等,指出训练难点,分析KL Loss异常归因,验证其在MoE模型RL应用效果,还探究模型规模对训推不一致性的影响。
模型、代码、数据全开源!轻松训练自己的垂类Agent!
Together AI联合Agentica推出`DeepSWE-Preview`,基于开源Qwen模型,用RL在SWE - Bench - Verified登顶。团队将模型权重、训练框架等全开源,抛弃SFT纯用RL训练,还分享训练秘籍和TTS技巧,为垂类Agent训练提供新范本。
CUDA 20年护城河一个周末崩了 !Claude独自跑通AMD新GPU
一个周末,Claude直接把自家最前沿模型跑在全新AMD MI355X机架,人类工程师没改一行代码。AMD还给AI开发调GPU的工具,ROCm.AI可让Agent自己部署操作。Agent补生态积累短板,对CUDA生态形成降维打击。
AMD新论文颠覆认知:FP4训练不稳定,原因不是随机性不足
大模型训练成本高,降低训练精度可降成本。AMD联合宾州州立大学论文颠覆认知,揭示FP4训练不稳定源于结构性微缩放误差,非随机性不足,还在原生FP4硬件完成大模型预训练。
一个月的活一周干完!英伟达世界模型训练速度飙升400%
英伟达世界动作模型 DreamZero 训练成本高、耗时长,无问芯穹与清华等推出的 RLinf 框架,从算子融合到 I/O 全链路系统级重构,使训练吞吐拉高近 4 倍,还解决多类性能瓶颈,保证训练效果。
机器狗翻了个身,国产GPU往前走了坚实一步|甲子光年
5月18日摩尔线程发布会上,机器狗“小飞”侧空翻,是业内首次基于国产硬件仿真平台训练、国产端侧芯片部署并真机验证。该司以全功能GPU打造国产具身智能基础设施,MT Lambda平台解决多方面问题。
训练即服务!让模型训练回归算法语义,150行代码跑通RL
ModelScope团队开源Twinkle框架,采用Client - Server架构,支持20余种算法组件。开发者约150行代码就能编排复杂RL训练循环,底层调度等交给框架。它兼顾易用性与灵活性,有多种特点和优势,代码已开源。
AI玩拼图游戏暴涨视觉理解力,告别文本中心训练,无需标注的多模态大模型后训练范式
在多模态大模型后训练浪潮中,现有方法多以文本为中心。MMLab@南洋理工大学提出Visual Jigsaw,将拼图任务用于后训练,让模型不依赖标注强化视觉感知与理解,在图片、视频和3D模态验证有效。