「后训练技术」共找到 5917 篇相关文章
德勤2026技术趋势报告:五大力量正驱动技术和商业进化
德勤《2026技术趋势》报告揭示技术从实验走向商业应用。涵盖物理AI进化、智能体落地、企业重构计算、技术组织架构转变、安全防御等趋势,还提及八大技术演进信号。
deepseek-V4算法工程技术深入浅出
文章围绕deepseek V4技术报告展开,指出当前大模型训练不充分,介绍了算法层面如混合注意力机制、模型结构优化、优化器等,工程层面如细粒度专家并行、算子内核开发等,以及后训练的范式转变和领域专家网络蒸馏等内容。
亲历两场编程语言迁移“惨案”,谷歌大佬揭露技术选型真相:90%决策与技术无关
谷歌大佬 Steve Francia 结合自身经历,指出技术选型常受身份认同等非技术因素影响。如早期创业公司因 CTO 执意换语言错失市场,谷歌团队跟风选 Rust。还分析了背后原因及代价,并给出破局建议。
为什么BF16的FlashAttention会把训练「炸掉」?清华首次给出机制解释,用极简改动稳住训练
社区里长期存在的FlashAttention+BF16训练GPT - 2时loss突然爆炸的问题,清华团队论文给出机制解释。指出是特定条件下数值偏置被放大所致,还给出极小修改稳定训练,且在多模型和硬件上验证有效。
LLM的RL训练轨迹竟然是线性的?Miaow Lab|新工作:无需继续训练,直接“预测”未来模型!
文章介绍《Not All Steps are Informative: On the Linearity of LLMs' RLVR Training》,揭示RLVR训练中LLM权重和输出概率线性变化,提出“权重外推”法,可实现6.1倍训练加速,还介绍三种策略及实验结果。
万字长文 | 异构算力技术架构与核心组件解析
文章聚焦异构算力技术架构与核心组件,解析主流AI芯片特点、国产芯片技术路线;介绍高速互联技术、网络拓扑结构及优化方法;阐述大模型存储需求、分布式存储技术及数据预处理与加载技术,为AI计算提供全面方案。
昇腾MindSpeed:分布式训练加速库的创新实践与突破
在2025年QCon全球软件开发大会上,华为工程师郑加利分享昇腾MindSpeed分布式训练加速库。它在计算、通信、显存等多维度优化,提升训练效率,还介绍业界加速库及MindSpeed架构,阐述多种优化策略。
社区供稿丨MiniCPM-V 4.5 技术报告正式出炉
上个月开源的多模态模型 MiniCPM-V 4.5 广受好评,今日其技术报告出炉。报告从架构、数据和训练三方面探索高效路径,提出三大技术,使模型在多任务上突破,小参数规模下性能和推理速度佳。
Cursor滑跪开源技术报告:Kimi基模这样微调能干翻Claude
Cursor放出Composer 2技术报告力证‘自研’,基于Kimi K2.5经持续预训练和异步强化学习,测试表现好。同时,杨植麟分享Kimi团队最新思考,认为大模型要规模化,断言大模型训练进入第三阶段。
AGI 新技术路线:下一代稀疏注意力机制 Monte Carlo Attention 开源
超对称技术公司在新版基座模型 BigBang - Proton 中使用的 Monte Carlo 注意力开源。它基于二进制块编码技术,用块间代表交流机制实现线性复杂度,兼具多种注意力机制优点,可满足宇宙尺度建模的上下文长度需求。