小模型训练」共找到 8468 篇相关文章

开源动态8

Qwen-Scope:看穿大模型的“心思”

Qwen-Scope是基于Qwen3和Qwen3.5系列模型训练的可解释性模块,通过在隐藏层插入SAE提取可解释特征。它能分析模型行为、优化模型,应用于推理、数据、训练、评估等场景,可前往Huggingface或魔搭体验。

千问大模型
算法论文7

英伟达说,语言模型(SLM)是智能体的未来

英伟达论文指出语言模型(SLM)是代理人工智能未来。SLM参数于100亿,可装在消费电子设备。英伟达认为其强大、适合代理系统且经济。微软、英伟达等多家厂商的模型表现出色,文中还分析了SLM优势及代理架构。

AI与安全
算法论文7

英伟达新研究:模型才是智能体的未来

英伟达最新论文指出,大模型在Agent任务中消耗大量计算资源,成本高、效率低、灵活性差,而模型能在性能够用前提下让任务执行更经济灵活。模型通过优化硬件资源和任务设计高效执行任务,但落地面临挑战。

量子位
算法论文8

字节最新大模型秘籍:只挑能有推理潜力的数据训练!1.3B模型无需标签自动挑选

字节Seed团队发布AttentionInfluence成果,用1.3B模型给7B模型选数据,无需训练和标签。通过比较基础与弱化模型损失差异评估数据影响,在多基准测试提升模型性能,还能结合分类器全面提升表现。

量子位
开源动态8

成本不到8千美元!新浪微博1.5B模型超越近万亿参数模型

新浪微博开源的VibeThinker - 1.5B模型,仅15亿参数、训练成本不足8000美元,却在顶级数学竞赛基准击败近万亿参数模型。它采用频谱到信号原则,分两阶段训练,性能出色,成本低且数据无污染。

AIGC开放社区
开源动态8

智谱发布GLM 4.5,不仅开源模型还把训练框架也开源了

智谱AI发布GLM 4.5,不仅开源模型,还开源整套后训练基础设施。模型规格亮眼,性能也超越qwen 235b。其开源的训练框架slime专为强化学习扩展设计,完整工具链支持多种模型

AI工程化
新闻资讯7

535B大模型“直播”训练三个月:代码、数据、Loss全公开,吴恩达公开力挺

当多数模型公司还在争论是否开放权重时,斯坦福大学的Marin项目启动535B-A23B模型训练,并公开训练过程。该项目旨在探索基础模型能否像开源软件一样被公开研究和建设,引发关注。

InfoQ
开源动态8

破局大模型训练黑盒,MegatronApp开源实现万亿参数「可视可控」训练

在2025上海QCon大会上,算秩未来赵伯罕博士指出万亿级大模型训练困境。上海期智研究院和算秩未来联合研发MegatronApp,以低入侵方式补齐链路,其四个模块形成闭环,让训练从黑盒变白盒,项目已开源。

InfoQ
新闻资讯7

OpenAI新模型,被曝秘密训练中!万字硬核长文直指o4核心秘密

SemiAnalysis爆料,OpenAI正训练规模介于GPT - 4.1和GPT - 4.5间的新模型,下一代推理模型o4基于GPT - 4.1训练。强化学习成推理模型进步功臣,但面临基础设施瓶颈,奖励函数难定等问题。

新智元
算法论文8

训练提速4.6倍!FP4+BF16双轨并行,NVIDIA×港大×MIT联手重新定义扩散模型训练速度上限

NVIDIA、港大、MIT团队提出Sol - RL,采用「FP4先探索、BF16再训练」框架,将扩散模型训练收敛速度最高提至4.64x,在速度与对齐效果间给出工程可行解法。

机器之心