「开源权重模型」共找到 8832 篇相关文章
AST| 西工大单湘淋、张伟伟等:基于湍流各向异性分析与符号回归的改进型二阶非线性涡粘模型
针对非线性涡粘模型各向异性建模难题,西工大单湘淋、张伟伟等通过雷诺应力各向异性分析方法开展特征提取,构建新型二阶非线性涡粘模型,在方形管道与矩形扩压器湍流测试中,精度优于现有模型。
不只是DeepSeek V4,还有个万亿级大模型,训推全程国产芯片
2026年4月24日,DeepSeek发布新一代模型DeepSeek - V4系列预览版并开源。同日,美团用全国产算力集群训练出万亿参数大模型LongCat - 2.0系列预览版,训推全流程摆脱英伟达,在国产算力支撑万亿级模型研发上取得突破。
Qwen3技术报告首次全公开!“混合推理模型”是这样炼成的
本文首次公开Qwen3技术报告,介绍其模型架构、预训练及后训练过程、性能表现等技术细节。Qwen3整合两种模式,引入思考预算机制,降低轻量级模型计算资源,在多基准测试领先,多语言支持扩展至119种,所有模型开源。
顶尖技术+标准产品+创新模式+可靠服务,打造大模型商业落地中国范式 | 卓世科技@MEET2026
在大模型参数竞赛白热化的当下,焦点转向模型如何在行业存活、产生价值。卓世科技合伙人赵策在MEET2026大会提出,大模型下一场竞争在模型、终端、数据与业务流闭环,该司据此在多领域落地应用。
华为中科大联创大模型低比特量化算法,1‰数据实现昇腾无损压缩7倍
华为诺亚方舟实验室联合中科大提出CBQ后训练量化方案,仅用0.1%训练数据实现大模型7倍压缩,保留99%精度。该成果登ICLR 2025 Spotlight,已加入昇腾ModelSlim工具包。
Qwen-Scope:看穿大模型的“小心思”
Qwen-Scope是基于Qwen3和Qwen3.5系列模型训练的可解释性模块,通过在隐藏层插入SAE提取可解释特征。它能分析模型行为、优化模型,应用于推理、数据、训练、评估等场景,可前往Huggingface或魔搭体验。
昆仑万维开源的SkyReels-V3,把马斯克请来带货了
1月29日,Skywork AI团队宣布开源SkyReels - V3多模态视频生成模型系列,涵盖三大核心能力,达业界领先。经测试表现出色,其技术有创新,且模块化设计适配性强。昆仑万维此前在视频生成领域迭代快,此次开源或加剧竞争。
Qwen3 变身扩散语言模型?不从零训练也能跑,30B参数创纪录
扩散语言模型(DLM)潜力大但训练难,Radical Numerics团队改造Qwen3-30BA3B,推出30B参数的开源扩散语言模型RND1-Base。该研究系统性研究A2D转换关键因素,成果超现有部分模型,还提出简单方法及训练策略。
新SoTA方法RM-R1:让reward model对评分说出原因!超越GPT4o
过去模型‘黑箱打分’不透明、不灵活。论文提出ReasRM,经两阶段训练,让奖励模型像人类先思考再打分。它能分任务类型、动态奖励,实验中碾压GPT - 4,小模型逆袭,团队已开源6个模型。
抗干扰能力提升近40% !无需对抗训练,北航上海AI Lab新蒸馏方法提升模型鲁棒性 | ICML 2025
在人工智能模型规模持续扩大的今天,数据集蒸馏方法能提升训练效率、降低成本,但蒸馏模型在安全性要求高的任务中抗干扰难。北航上海AI Lab团队提出ROME方法,无需对抗训练,显著提升模型鲁棒性,成果被ICML 2025接收且已开源。