大模型预训练」共找到 9479 篇相关文章

算法论文7

MOE RL实战:统一FP8全流程训练

SGLang RL团队等联合完成工作,实现RL中全流程FP8训练与采样。介绍FP8训练硬件基础、格式、scale选择等,指出训练难点,分析KL Loss异常归因,验证其在MoE模型RL应用效果,还探究模型规模对训推不一致性的影响。

GiantPandaLLM
新闻资讯8

9位顶级研究员连讲3晚,华为盘古模型底层研究揭秘

华为诺亚方舟实验室成果颇丰,4月开发千亿级通用语言模型Pangu Ultra,5月推出稀疏语言模型Pangu Ultra MoE。5月28 - 30日,机器之心联合举办分享会,9位研究员揭秘量化、剪枝等关键技术突破。

机器之心
推荐文章7

快速理解热门LLM语言模型

本文用通俗易懂方式帮读者理解LLM、Transformer、Prompt等基本概念,介绍模型API使用,如温度参数、角色设定等,还提及Function Calling、Agent、MCP等内容,并对AI未来发展作出假想。

腾讯技术工程
算法论文8

团队直击模型高分神话:人类90分,最强模型仅49分

南京学傅朝友团队在Google Gemini评测团队邀约下推出视频理解新基准Video - MME - v2。它有创新的分层能力体系与组级非线性评分,经超3300人工时标注。评测显示模型与人类差距,还揭示传统Acc指标虚高、‘Thinking’并非总增益等现象。

新智元
算法论文8

联合阶跃星辰提出TensorCast:统一可编程管理模型张量,推理「首字延迟」最高降低93.2%

随着模型规模增长、新应用兴起,模型基础设施面临管理「张量状态」挑战。北、阶跃星辰与北邮联合提出 TensorCast,解耦张量状态,复用管理能力,在多场景测试中表现出色,为模型基建提供新范式。

机器之心
产品应用7

为 OpenAI 秘密提供模型测试, OpenRouter 给 LLMs 做了套“网关系统”

OpenRouter成立于2023年初,为用户提供统一API Key调用各类模型,OpenAI会用其秘密测试。平台token用量高速增长,还发布模型用量排行榜引关注。创始人认为模型非赢家通吃,未来想成agent最佳推理层。

海外独角兽
算法论文8

模型推理上限再突破:「自适应难易度蒸馏」超越R1蒸馏,长CoT语料质量飞升

本文从中兴通讯无线研究院「模型深潜」团队切入,介绍了首创的「LLM自适应题目难度蒸馏」方法,该方法围绕「模型 - 数据动态匹配」提出了一条完整的CoT构建流程,显著提升了长CoT语料的质量。

机器之心
开源动态8

万亿级思考模型,蚂蚁首次开源!20万亿token搅局开源AI

10月14日蚂蚁集团发布万亿参数思考模型Ring-1T,在多领域表现出色,推理能力直逼闭源巨头。此前已开源旗舰通用模型Ling-1T。还介绍了训练技术创新,虽模型有不足,但开源夺冠证明‘思考力’可工程化。

新智元
开源动态8

1M 参数干翻 200M!时序预测选模型,你可能一直都选错了

近期时序预测领域新模型频出,作者开源的 QuitoBench 显示,参数量仅 1M 的 CrossFormer 击败模型夺冠。它还揭示模型选择与历史数据长度有关,且数据边际收益高于参数。

AINLPer
开源动态8

清华SageAttention3,FP4量化5倍加速!且首次支持8比特训练

清华学陈键飞团队提出针对BlackWell架构的SageAttention3,实现5倍于FlashAttention的推理加速,首次支持8比特训练。在多种模型上保持端到端精度,代码将分别于6、7月开源。

机器之心