大模型预训练」共找到 9455 篇相关文章

开源动态8

企业级OpenClaw最强拍档来了!万亿参数的国产多模态模型,刚刚开源发布

YuanLab.ai团队开源源Yuan3.0 Ultra多模态基础模型,是万亿级开源多模态模型之一。它优化训练效率,在多任务表现突出,为企业Agent AI提供支撑,还提出新算法和训练策略,全面开源推动落地。

量子位
产品应用7

AIGCode宿文:我就是要自训练模型,直接做「L5」| AI产品十人谈

AIGCode宿文坚信Coding是培育模型的最佳场景,公司自训练66B基础模型,发布锡月模型,开启AutoCoder内测。宿文认为AI Coding能解决代码供给问题,目标是实现AGI,虽面临诸多质疑,但他坚持直接做L5。

AI科技评论
算法论文8

模型作为!微博的VibeThinker-1.5B超越DeepSeek R1等头部模型

近年来,“参数越,能力越强”成行业共识,但带来成本高和资源集中问题。微博AI团队开发的VibeThinker - 1.5B用1.5亿参数和低训练成本,在多项测试中超越头部模型,还提出SSP框架和MGPO算法。

深度学习自然语言处理
新闻资讯8

王小川:医疗行业对模型有三刚性要求,但通用模型一条都不达标

5月22日百川智能展示医疗模型Baichuan - M4与AI家庭医生「百小医」。王小川指出通用模型用于医疗有问题,医疗对模型有低幻觉、强循证、会提问的刚性要求,而通用模型不达标。Baichuan - M4表现出色,百小医也有独特定位和优势,且与三家顶尖医院合作成果显著。

Founder Park
算法论文8

调整训练数据出场顺序,模型就能变聪明!无需扩模型/数据规模

微软亚洲研究院提出全新文本数据组织范式DELT,通过引入数据排序策略,充分挖掘训练数据潜力,优化训练数据的组织方式,在不同模型尺寸与规模下都达到了良好性能,且不用增加数据量或扩模型规模。

量子位
开源动态8

专为“超模型而生”,新一代训练引擎 XTuner V1 开源!

9月8日,上海AI实验室开源书生模型新一代训练引擎XTuner V1。它能应对复杂训练场景、速度更快,尤其在超规模稀疏混合专家(MoE)模型训练中优势显著。还将一并开源AIOps工具DeepTrace与ClusterX。

OpenMMLab
产品应用7

用 Docker 跑模型训练,Unsloth 解决了环境配置难题

Unsloth AI 发布 Docker 镜像版本,解决本地训练模型环境配置难题。拉镜像就能训练,依赖和示例 notebook 都打包好。使用简单,不过有暂不支持 Mac 系统等限制,单卡 NVIDIA GPU 场景较适用。

AI工程化
开源动态8

微软、哈佛开源创新优化器:全面超越Muon,提升模型训练效率

随着模型训练所需计算资源爆炸式增长,微软和哈佛团队联合开源优化器Dion。它利用低秩近似和解耦动量缓冲区,避免分布式训练同步完整梯度,在集中式和分布式场景都有高效表现,性能超Muon。

AIGC开放社区
算法论文8

NeurIPS 25 | GRPO进阶版来了,GVPO重构模型训练范式

模型训练越发关键,GRPO 有缺陷。作业帮与香港科技学(广州)团队在 NeurIPS 2025 提出 GVPO 方法,解决 GRPO 稳定性难题,理论有最优解保证,实验表现超现有方法。

机器之心
算法论文8

模型智能体不止能写代码,还能被训练成白帽黑客

Amazon AWS AI的Q Developer团队发布两项训练网络安全模型的新方法Cyber - Zero和CTF - Dojo。前者不依赖真实环境生成训练数据,后者构建实战环境让模型学发现漏洞,二者结合为AI白帽黑客成长提供路径。

机器之心