「模型开源」共找到 8802 篇相关文章
顶尖技术+标准产品+创新模式+可靠服务,打造大模型商业落地中国范式 | 卓世科技@MEET2026
在大模型参数竞赛白热化的当下,焦点转向模型如何在行业存活、产生价值。卓世科技合伙人赵策在MEET2026大会提出,大模型下一场竞争在模型、终端、数据与业务流闭环,该司据此在多领域落地应用。
华为中科大联创大模型低比特量化算法,1‰数据实现昇腾无损压缩7倍
华为诺亚方舟实验室联合中科大提出CBQ后训练量化方案,仅用0.1%训练数据实现大模型7倍压缩,保留99%精度。该成果登ICLR 2025 Spotlight,已加入昇腾ModelSlim工具包。
Qwen-Scope:看穿大模型的“小心思”
Qwen-Scope是基于Qwen3和Qwen3.5系列模型训练的可解释性模块,通过在隐藏层插入SAE提取可解释特征。它能分析模型行为、优化模型,应用于推理、数据、训练、评估等场景,可前往Huggingface或魔搭体验。
The Batch: 859 | Qwen3 的自主智能新进展
不到两周前 Kimi K2 超越其他开源非推理模型,如今阿里巴巴发布基于早期 Qwen3 - 235B - A22B 的三款新大语言模型权重,介绍了输入输出规格、架构设计、性能表现、使用方式等,还进行了性能对比。
昆仑万维开源的SkyReels-V3,把马斯克请来带货了
1月29日,Skywork AI团队宣布开源SkyReels - V3多模态视频生成模型系列,涵盖三大核心能力,达业界领先。经测试表现出色,其技术有创新,且模块化设计适配性强。昆仑万维此前在视频生成领域迭代快,此次开源或加剧竞争。
Qwen3 变身扩散语言模型?不从零训练也能跑,30B参数创纪录
扩散语言模型(DLM)潜力大但训练难,Radical Numerics团队改造Qwen3-30BA3B,推出30B参数的开源扩散语言模型RND1-Base。该研究系统性研究A2D转换关键因素,成果超现有部分模型,还提出简单方法及训练策略。
新SoTA方法RM-R1:让reward model对评分说出原因!超越GPT4o
过去模型‘黑箱打分’不透明、不灵活。论文提出ReasRM,经两阶段训练,让奖励模型像人类先思考再打分。它能分任务类型、动态奖励,实验中碾压GPT - 4,小模型逆袭,团队已开源6个模型。
抗干扰能力提升近40% !无需对抗训练,北航上海AI Lab新蒸馏方法提升模型鲁棒性 | ICML 2025
在人工智能模型规模持续扩大的今天,数据集蒸馏方法能提升训练效率、降低成本,但蒸馏模型在安全性要求高的任务中抗干扰难。北航上海AI Lab团队提出ROME方法,无需对抗训练,显著提升模型鲁棒性,成果被ICML 2025接收且已开源。
DeepMind大佬最新暴论:单体大模型穷途末路,未来买的不是模型,是"智能路由"
DeepMind研究员Andrew Trask认为,因Scaling Law对资源需求攀升,AI将成协议而非程序。组合不同厂商模型有优势,当主流榜单同等评分时变革加速,之后人们将买“智能本身”。
研究表明,开源能推动AI创新和经济增长
Siliconangle消息,Linux基金会新研究显示开源对全球经济贡献达9万亿美元。其首席经济学家Frank Nagle指出,AI加入使开源价值评估方式改变,计算开源AI价值复杂,参与开源项目能增加经济价值。