低精度训练」共找到 3099 篇相关文章

推荐文章7

CUTLASS 笔记 (2):混合精度 GEMM kernel

文章介绍实现支持不同精度的 GEMM 算子,解析精度转换技术细节,还介绍根据 PTX 文档实现自定义 FP8 精度的 GEMM kernel,包括揭开 MMA Atom 面纱、分析 TV 与 MN Layout 等,最后完成精度验证。

GiantPandaLLM
开源动态7

在一台1970年代的PDP-11上训练Transformer需要多久?答案是5.5分钟

近日,开发者复现1970年代技术环境,用PDP - 11汇编语言实现Transformer并训练成功,项目叫ATTN - 11。在资源下实现功能闭环引热议,大家思考Transformer到底需要什么。

机器之心
开源动态8

智谱终于发布GLM-4.5技术报告,从预训练到后训练,细节大公开

上个月底智谱开源 GLM-4.5 及轻量版,成绩亮眼引热议。现其技术报告发布,详述预训练到后训练细节,还介绍了开源 RL 框架 slime,展示模型架构、训练阶段等,评估了在多任务上的表现。

机器之心
算法论文8

打破「数据暴力」预训练惯性,阿里Qwen、上交大等提出预训练动态数据选择范式OPUS

阿里Qwen、上交大等团队提出预训练动态数据选择范式OPUS,打破“数据暴力”预训练惯性。它将数据选择与优化器更新轨迹对齐,提升预训练效率与下游泛化表现,实验显示其“效率+性能”双提升。

机器之心
算法论文8

单卡4090也能高质量视频编辑!西湖AGI Lab无训练框架FlowDirector来了

视频编辑门槛高、现有方法开销大且效果不佳。西湖大学AGI Lab团队提出无需训练的FlowDirector框架,可将基于流的视频生成模型改造成编辑工具,质量高、功能广、开销,解决了时序、结构和编辑幅度问题。

机器之心
开源动态8

9.1K Star 调参师集体失业!亚马逊造出机器学习“核弹”,3行代码打造高精度模型!

在机器学习普及的当下,自动化机器学习框架降开发门槛。AutoGluon由AWS AI开发并开源,仅3行代码就能训练和部署高精度模型,支持多类型数据,有诸多亮点,已获9.1K Star。

开源星探
算法论文7

超越Claude 3.5和o1!8B模型靠「分层投票+测试时训练」逆袭

近日MIT研究者发现测试时训练在大模型应对复杂推理问题时,能分解任务提升回答准确率。8B的lemma3模型经此方法,在ARC和BBH数据集上性能显著提升,超Claude 3.5等。但该策略部署效率

新智元
算法论文8

别再卷数据了,LLM也怕「过劳死」!CMU等揭秘灾难性过度训练

CMU、斯坦福等四大名校研究团队挑战“预训练规模越大越好”观点,提出“灾难性过度训练”现象,即增加预训练数据可能导致后训练性能下降,并从现实证据、控制实验、理论分析等方面阐述新研究贡献,还介绍了相关实验及结论。

新智元
开源动态8

离谱……面壁让 AI 写了个训练框架,然后它自己训出了最强的 1B 模型:MiniCPM5-1B

面壁发布 1B 参数量级最强端侧文本大模型 MiniCPM5 - 1B,其 Base Model 由 AI 编写的训练框架 ForgeTrain 训出,速度超英伟达 Megatron 10%。该模型性能出色,部署门槛,数据治理方案对应数据集也已开源。

AGI Hunt
算法论文8

VLM 实现 10%的精度提高,13.1倍加速!纽约大学新算法让视觉语言模型更小、更快、更准确

纽约大学研究团队用QSVD新方法让视觉语言模型(VLM)效率飞跃,在普通GPU上实现13.1倍加速。它将Q、K、V矩阵捆绑处理,设计秩分配策略,引入量化方案,经多模型评估,展现出硬件成本、高精度优势。

AIGC开放社区