从零训练」共找到 4851 篇相关文章

算法论文7

MOE RL实战:统一FP8全流程训练

SGLang RL团队等联合完成工作,实现RL中全流程FP8训练与采样。介绍FP8训练硬件基础、格式、scale选择等,指出训练难点,分析KL Loss异常归因,验证其在MoE模型RL应用效果,还探究模型规模对训推不一致性的影响。

GiantPandaLLM
算法论文8

AMD新论文颠覆认知:FP4训练不稳定,原因不是随机性不足

大模型训练成本高,降低训练精度可降成本。AMD联合宾州州立大学论文颠覆认知,揭示FP4训练不稳定源于结构性微缩放误差,非随机性不足,还在原生FP4硬件完成大模型预训练

机器之心
推荐文章8

科普向:一文解构大模型后训练,GRPO和它的继任者们的前世今生

文章深入解读大模型后训练,先对比 PPO 与 GRPO,指出 GRPO 优势及成本问题。又介绍 GRPO 后续改进算法,如 DAPO 解决训练问题、GSPO 提升训练稳定性、GFPO 可优化多属性,还提及 GRPO 其他缺陷。

机器之心
开源动态8

训练即服务!让模型训练回归算法语义,150行代码跑通RL

ModelScope团队开源Twinkle框架,采用Client - Server架构,支持20余种算法组件。开发者约150行代码就能编排复杂RL训练循环,底层调度等交给框架。它兼顾易用性与灵活性,有多种特点和优势,代码已开源。

量子位
算法论文8

Anthropic让AI先读员工手册再上岗:失控率54%降到7%

Anthropic最新研究「模型规范中期训练」(MSM)显示,相同训练数据配不同行事原则,模型表现不同。MSM在预训练和对齐微调间加中间阶段,让模型读规范文档理解准则,在特定实验中,将Agent失控率54%降到7%。

新智元
产品应用8

浙大校友打造AI代码测试神器,代码bug,30分钟创建网站

浙大校友打造的智能测试平台TestSprite 2.0,代码bug,30分钟创建网站,能让AI写代码准确率42%跃升至93%,还可自动生成测试报告、调试修复错误,全程无需人工干预。

量子位
算法论文8

AI玩拼图游戏暴涨视觉理解力,告别文本中心训练,无需标注的多模态大模型后训练范式

在多模态大模型后训练浪潮中,现有方法多以文本为中心。MMLab@南洋理工大学提出Visual Jigsaw,将拼图任务用于后训练,让模型不依赖标注强化视觉感知与理解,在图片、视频和3D模态验证有效。

量子位
推荐文章8

把AI 时代最重要的判断力当专业学科训练,专注提升判断力

文章指出AI时代人们多只有“领域内判断力”,判断力可当学科训练。介绍预测大赛中普通人表现超CIA分析师,1小时训练能提升10%准确度,还给出判断力3层栈框架及30天训练清单。

AI Reading Hub
算法论文8

字节Seed新作:模型合并如何改变大模型预训练范式

字节跳动Seed团队在arXiv发表论文,提出预训练模型平均(PMA)技术。该技术将模型合并引入预训练阶段,可提升性能、预测衰减阶段表现,还能解决训练问题。不过,高学习率影响和强化学习应用待研究。

机器之心
推荐文章8

【万字长文】大模型训练推理和性能优化算法总结和实践

本文总结大模型落地的训练、推理和性能优化算法与实践,介绍语言模型发展,对比BERT、GPT等训练方式,分析生成式大模型问题,还阐述数据处理、推理优化及训练调优等内容,并给出不同场景技术选型建议。

阿里云开发者