大模型预训练」共找到 9475 篇相关文章

新闻资讯7

全球开源模型,前十五名全是中国的

近日,随着新一代语言模型更新,开源模型成热门话题。Design Arena排行榜上,若设定为“开源”,前15名均为国产开源模型,排名第一的是DeepSeek - R1 - 0528 ,智谱、阿里等厂商多款模型上榜。

机器之心
产品应用8

还得是华为!Pangu Ultra MoE架构:不用GPU,你也可以这样训练准万亿MoE模型

华为盘古团队发布Pangu Ultra MoE模型架构与训练方法的中文技术报告。该模型全流程在昇腾NPU上训练,团队在架构和训练方法创新,实现准万亿MoE模型训练,还在多方面优化提升性能。

机器之心
推荐文章8

给非技术人的模型介绍:从零训练ChatGPT的全流程、天价成本及企业务实替代方案

文章介绍从零训练ChatGPT级别模型的全流程、高昂成本,指出这对多数企业不现实。建议企业战略从构建转向应用,通过租用API或微调开源模型利用模型,将专有数据视为核心资产。

AI Reading Hub
推荐文章7

C端热战,B端暗涌:模型真正的战场才刚刚开始 | 《中国模型落地应用研究报告 2025》正式发布

InfoQ研究中心联合中欧AI与管理创新研究中心发布《中国模型落地应用研究报告2025》,从驱动因素、C端产品现状到B端落地现状,勾勒模型应用转折期的图景,分析应用难的原因及各端现状。

InfoQ
算法论文8

ICML 2026 | 模型内部也会长出「情绪树」,规模越越懂人心

ICML2026 论文指出,语言模型内部会自然形成类似人类心理学模型的「情绪树」,模型,情绪树越复杂,且在销售等任务上表现更好。同时,模型的情绪结构受身份设定影响,存在与人类相似的情绪识别偏见。

机器之心
算法论文8

模型思考装上“猎鹰重装引擎” :腾讯混元 SEAT 重塑深度思考

本文深度解析腾讯混元最新发布的 SEAT 自适应并行扩展推理框架。它让模型 CoT 升级,应对复杂推理任务。该框架通过多轮并行推理和语义熵导航,解决模型深度思考的局限,且适配多种模型,性价比高。

AI科技大本营
算法论文8

具身智能奇点已至!超越π*0.6,极佳视界自我进化VLA模型拿下世界第一

极佳视界具身模型 GigaBrain-0.5M*依托世界模型实现自我进化,在多真实任务近 100% 成功,超 π*0.6 成 SOTA。其提出基于世界模型的强化学习范式,用超万小时数据训练,推动通用具身智能发展。

新智元
算法论文8

CVPR 2026|突破3D空间推理瓶颈:北联合南科提出QuatRoPE,让模型精准理解三维物体关系

联合南科团队提出全新 3D 位置嵌入方法 QuatRoPE,改善语言模型 3D 空间推理痛点。还提出 IGRE 降低干扰,构建 ASR 基准评估能力。研究被 CVPR 2026 接收,代码与模型已开源。

机器之心
开源动态8

阿里云通义点金发布DianJin-R1金融领域推理模型,32B模型荣膺榜首

阿里云通义点金团队与苏州学合作推出DianJin-R1金融领域推理模型,介绍其开源数据集与模型、基于通义点金平台的数据合成,展示了其在性能测试中的优异表现,推动金融科技智能化进程。

机器之心
新闻资讯8

微软分享三王炸算法:突破模型推理瓶颈,性能

今天凌晨微软官网分享三创新算法,即rStar - Math、LIPS、CPL,可助模型突破推理瓶颈,增强数学推理和思考链能力,还介绍了各算法原理、优势及对应论文地址。

AIGC开放社区